No Priors 采访了 OpenAI Deep Research 负责人之一 Isa Fulford。
Isa Fulford 回顾了项目从小型 RL/数学实验成长为知识密集型 Agent 的历程,并分享了在人类专家数据、强化微调与工程延迟上的经验。
时间线与要点
00:00 – 06:12 起源与愿景:小团队孵化;目标是“会读、会写、懂检索”的研究助手。
06:12 – 07:20 数据质量:自建高质量专家标注数据;强调“质 > 量”。
07:20 – 09:05 强化微调 (RFT):让模型在长链推理中自我改进;关注事实准确率与步骤可解释性。
09:05 – 11:23 专家数据价值:专家示例显著降低幻觉、提升深度推理;计划扩充“专家池”。
11:23 – 13:55 Agent 失效模式:检索缺失、调用链断裂、置信度误判;采用细粒度评测集做回归测试。
13:55 – 18:32 未来路线图:近期聚焦低延迟与多模态检索;中期加入写作风格控制与自动引用;长期开放插件生态、培养主观“品味”。
18:32 – 19:29 训练“品味”:用对比学习 + 人类偏好数据让模型学会审美和质量判断。
19:29 – 22:03 打造通用 Agent 方法论:① 高质量任务分解 ② 稳定工具接口 ③ 评测先行。
22:03 – 25:55 Deep Research vs o3:前者专注知识深度与引用完整度;后者更通用。
25:55 – 27:56 延迟与工程权衡:并行检索、缩短生成步、缓存机制以降低延迟。
27:56 – 结尾 能力预测:1 年内自动写作与代码修复;3 年内多模态决策与长期任务编排。
核心洞察
- 数据质重于量:高质量专家示例是提升事实准确率与推理深度的关键。
- 检索 + 强化微调成为“事实型 Agent”主流范式:检索保证信息新鲜度,RFT 决定“何时检索、何时推理”。
- “品味”可以被系统化训练:对比学习与偏好标注赋予模型审美与质量评估能力。
- 工程瓶颈集中在延迟与工具编排:多轮 API 调用拉高延迟,需平衡体验与准确率。
- Deep Research 与 o3 互补:o3 提供宽覆盖能力;Deep Research 针对知识密集型任务做深度优化,形成“宽 + 深”组合。
视频链接:www.youtube.com/watch?v=qfB4eDkd_40
