高飞
25-04-27 11:14 微博认证:至顶科技创始人 AI博主

#模型时代# OpenAI深度研究探秘:模型未来能在一小时完成人类需要数天的工作

深度研究基本是我每天都要用的模型功能了,如果按照Token量来算,在ChatGPT上,甚至和普通提示各占一半。这是最新一期的No Priors播客中,主持人Sarah与OpenAI的Isa Fulford关于"深度研究"(Deep Research)的访谈。

Isa Fulford是OpenAI深度研究团队的核心成员,在对话中Isa分享了这款创新产品从构思到实现的完整历程。播客中,Isa还解释了深度研究与OpenAI现有O3模型的区别,延迟问题的处理方法等。

……
一、深度研究的诞生背景:从算法突破到产品构想

Isa Fulford回忆起深度研究项目的起源,可以追溯到大约一年前。当时,OpenAI内部对一种新的强化学习算法取得的进展感到非常振奋。她解释道:"我们看到这个算法在数学问题、科学问题和编程问题上取得了显著进步。"同时,她与在OpenAI工作的朋友Yosh正在进行一些关于代理的副项目。

"我们想知道是否可以将同样的算法应用到更符合普通用户日常需求的任务上,"Isa说道。他们最初考虑的两个方向是网络浏览任务和软件工程,Isa主要专注于前者。与数学和编程问题不同,这些领域没有现成的训练数据集。

"因为我认为在许多不同的职业中,人们确实需要做大量的研究,综合大量的信息,然后返回一份报告,"Isa解释道。这成为了深度研究的核心功能定位。

与业界普遍关注的交易型用例不同,如通过DoorDash订购汉堡或在线订花,Isa和她的团队选择了一条截然不同的路径。"我们希望在着手执行正确操作之前,先确保模型能够很好地从大量信息源中综合信息,主要是只读任务,"Isa说。

这个方向选择基于几个原因:首先,大量知识型工作主要涉及信息整合;其次,这与OpenAI创建能够进行新科学发现的AGI的总体目标相契合;最后,只读任务在安全问题上相对容易控制,是一个良好的起点。

二、从概念到实现:数据创建与模型训练的艰辛历程

Isa描述了将深度研究从概念变为现实的过程。最初,团队构建了一个没有模型训练的演示,完全基于提示工程,配合UI来展示产品愿景。之后,他们开始考虑如何创建数据、训练模型以及开发工具,使模型能够有效浏览互联网。

"我们与Edward Sun和其他几位同事密切合作,同时与强化学习团队进行了大量协作,"Isa说。"这绝对是一个重大的工程项目。好的一点是,我们能够在几个月内不受干扰地工作,提升我们评估指标上的数字。"

在数据创建方面,团队采用了多种方法:使用人类训练师、开发新型数据集,以及设计数据集来锻炼模型需要学习的特定技能。Isa解释道:"你必须找到一种方法来评估这些数据集,同时还要开发工具,让模型能够成功完成任务。"

目前,深度研究具有两个主要工具:基于文本的浏览器(可以查看嵌入图片和打开PDF文件)和Python工具(用于分析、计算和绘制图表)。Isa透露,未来版本将扩展工具集,使模型变得更加强大,但这也意味着需要创建新的数据集,让模型学会使用这些工具并在训练过程中解决复杂问题。

团队使用了一些特定的任务来评估模型的能力,例如找出Liam Fetters和Barrett Zoff共同撰写的所有论文(约11篇)。"模型现在能找到其中大部分或全部,"Isa自豪地说。另一个早期测试是找出一位同事的中间名,尽管出于合理的原因,模型现在无法再回答这类问题。

三、强化微调的应用:何时值得,何时可以用其他方法替代

随着对深度研究开发过程的深入讨论,Sarah询问了Isa关于强化学习微调(RFT)的见解,特别是对于考虑在特定任务上使用RFT的初创公司或其他组织的建议。

Isa提供了一个平衡的观点:"通常情况下,如果你在特定任务上训练模型,它在该任务上的表现一定会更好。但我们也看到从一种任务的训练到其他领域有很多泛化能力。例如,你可以训练一个推理模型,主要在数学、编程和其他推理类问题上,它在写作方面也会表现不错。但如果你专门针对写作任务进行训练,它在写作上的表现会更好。"

Isa建议在以下情况下考虑使用强化微调:

当你有一个非常特殊的任务,与模型可能接受过的训练有很大不同,尝试了各种提示后效果仍然不佳;

当任务对业务工作流程至关重要,提高10-15%的性能对成败至关重要。

相反,如果模型已经表现不错,只是偶尔出错,而且你观察到每次新模型发布性能都有所提升,那么可能不值得花费精力进行强化微调,因为模型自然会越来越好。

"如果是一些基因测序任务或其他对模型来说分布外的内容,它无法自行弄清楚,这是尝试强化微调的好时机,"Isa解释道。

四、人类专家数据的重要性:信息综合的通用技能

讨论转向了人类专家在数据创建中的作用,以及浏览专业知识的价值。Isa将浏览视为一项普遍的任务,几乎每个职业都涉及提出问题或在某个领域进行研究,然后从多个来源找到信息以综合答案。

"在这个过程中,你需要专业知识来判断:这是一个有用的来源吗?我应该包含这个吗?这完全离题了吗?这种情况几乎普遍存在于大多数工作或科学领域中,"Isa表示。

强化学习的优势在于,你不需要了解人们如何进行研究的整个过程,只需要知道任务是什么以及结果应该是什么。"模型将在训练过程中学习如何从问题到良好答案,"Isa解释道。

OpenAI采取了一种广泛的方法,这是大型AI实验室的优势——他们可以专注于广泛的用户群体,聘请不同领域的专家,尝试在所有领域同时取得进步。尽管团队也创建了许多合成数据集,但人类数据仍然是使模型成功的关键部分。

当被问及模型是否展示出令人惊讶的学习计划能力时,Isa提到有时它会使用她不一定会使用的搜索词,有时它会提前制定计划再开始研究,尽管他们没有教它这么做。"有时模型会做一些聪明的事情,试图绕过你设置的限制,所以你必须确保它不在'黑客'中,尝试使用你提供的搜索引擎以外的搜索引擎,"她补充道。

五、代理的失效模式:从幻觉到安全考量

谈到代理可能面临的经典问题,如累积误差、分心或安全问题时,Isa指出深度研究与典型的代理安全问题有所不同,因为它不能执行非读取类操作。

"但由于回答更全面,耗时更长,人们会更加信任它们。所以我认为幻觉可能是一个更大的问题,"Isa解释道。"虽然这个模型比我们发布的任何模型幻觉都要少,但它仍然可能产生幻觉,通常是因为从某个来源错误地推断出某些内容。这就是我们提供引用的部分原因,用户能够查看信息来源,如果不正确,希望他们能够发现。"

展望未来的代理,Isa认为理想的代理应该能够为用户进行研究并代表用户采取行动。"这是一个更加困难的问题,需要我们解决。这也是能力和安全性融合的地方——如果你不能信任代理完成任务而不产生你不希望的意外副作用,那么代理就没有用处。例如,如果你让它为你完成一项任务,但在此过程中它发送了一封尴尬的电子邮件之类的东西,那么这不是成功完成任务。"

关于用户是否需要明确的保障措施,Isa认为初期保持用户确认每个写操作是有意义的。随着模型能力的提升和用户信任的建立,可能会逐步放宽一些限制。"虽然这些不是终极能力状态,但我们仍然希望确保有良好的监督水平,但我认为它们会变得如此之好,以至于我们会信任它们代表我们做事。"

六、深度研究的未来发展规划:从读取到写入的演进

当被问及深度研究作为产品如何改进时,Isa提到了几个明显的发展方向:

扩展到写入操作:从仅读取扩展到能够代表用户采取行动。

访问私有数据:能够在内部文档、GitHub等私有信息源上进行研究。

工具集扩展:增加新工具,提升模型能力。

持续改进现有功能:提高模型在当前任务上的表现。

"理想状态是拥有一个统一的代理,可以完成所有这些不同的事情。任何你会委托给同事的事情,它都应该能够做到,"Isa表示。

Sarah询问人们如何决定是交给同事还是交给代理来完成任务,Isa认为大多数人可能会先尝试使用代理。"每次模型变得更加强大,人类的抽象层次就会更高。你要求它完成的任务层次越来越高,但你仍然在启动任务。也许一年前我让它为我写一个函数,现在我让它写一整个文件,明年它可能会为我创建一个完整的PR(pull request)。所以我认为我们仍然会在驾驶席上。"

关于与强化学习团队的合作,Isa描述了一种有效的工作关系:"很多团队会为他们进行的大型运行贡献数据集。我们贡献数据集,然后当他们用大量计算训练模型时,它就成为我们继续训练的更好的基础模型。所以我认为能力正在不断累积。"

七、深度研究与O3模型的比较:何时选择哪个工具

Sarah承认她在何时应该使用深度研究而不是O3模型方面没有清晰的心智模型,Isa对此提供了有价值的指导:

"深度研究在处理非常具体或明确定义的查询时非常出色。不是主题的一般概述,而是你在寻找一些特定信息,你认为它会通过现有的在线研究得到补充。即使基础模型也经过这些信息的训练,但拥有实时访问权限还是很有用的。"

Isa还指出,深度研究的输出通常比正常模型更长,所以如果用户需要全面的内容,它会很有帮助,尽管有时可能对某些任务过于全面。

Sarah分享了她使用深度研究寻找时尚相关信息的经历,Isa解释道这正是深度研究的优势所在:"我用它来寻找新品牌。我会说,'这些是我喜欢的品牌类型,请找到新的品牌,我可以在那里找到看起来像这个的特定外套'。它非常擅长找到这些。"

相比之下,基本模型可能会提供一些品牌,但不一定能满足所有约束条件,例如特定季节的特定长度的人造皮草外套。这是因为它可能没有最新信息,也不一定能在一次查询中处理所有约束条件。

"我会用它来找那些需要我花费数小时才能找到的非常特定的东西,"Isa继续说道,"比如我在寻找这个非常特定的商品,或者可能在RealReal或其他地方有售但我找不到的毛衣。或者我正在寻找具有非常特定约束条件的Airbnb。对于这类事情,深度研究非常有用。而对于更一般、更高层次的事情,你应该使用普通搜索。"

八、延迟与思考时间的权衡:未来发展方向

Sarah提到她习惯了所有技术工具都是即时的,而深度研究需要时间思考和使用工具。Isa承认这是一个需要平衡的问题:"我确实认为在两者之间有一个很好的中间点,有时你不希望它进行真正深入的研究,但你希望它做的比搜索更多。"

Isa暗示OpenAI将很快发布能满足这种需求的功能:"我们很快会发布一些人们会满意的东西,填补这个空白。"

关于用户如何表达他们对思考时间的偏好,Isa认为让用户做这个决定可能不是理想的用户体验:"模型应该更善于知道思考多长时间。我认为我们在训练模型时做了一个决定,每次都会使用最大思考时间。所以有时我会问一个非常简单的问题只是为了测试,然后因为它仍在思考而感到相当沮丧。所以我确实认为,知道思考多长时间也是一个需要改进的领域。"

Isa预计,深度研究将继续专注于需要最长时间的任务,而O3或未来版本将在这方面有所改进。考虑到深度研究目前在5-30分钟内可以完成人类专家评价需要数小时的工作,Isa推测未来的模型在一小时内可能完成人类需要数天的工作,在一天内可能完成人类需要数周的工作。

九、未来一年代理能力的展望:统一体验与持续进步

展望未来一年——在AI领域算是很长的时间——Isa预测将出现能够处理多种不同任务的通用代理:"一个可以帮助你完成很多不同领域任务的通用代理。对我来说,我做很多编程工作,我希望有一个在编程方面相当熟练的代理,但我会信任它,我给它一个任务,它可能会创建一个PR。但可能我也可以请同一个代理帮我预订去韩国的旅行。我希望我们能达到一个更统一的体验。"

Isa还认为模型提升的速度会让大多数人感到惊讶。关于为什么统一体验很重要,Isa解释道:"我认为你可能会希望两者兼而有之。你可能希望一种体验,你可以在某个时候覆盖或中断模型,说'哦,不,我不是那个意思'。或者你可以接管并开始输入一些内容。"

在短期内,随着模型在不同领域的能力有所不同,Isa设想一种结合方式:"你让模型为你做一些事情,但也许就编程例子而言,你也在VS Code中,你的光标和它一直为你做一些事情。但你也可以实际输入,你知道,自己写一些。所以我认为会是这些事情的结合,但我希望它是某种就像在Slack上有同事一样的东西,或者像远程同事,你可以让他们为你做事,给他们发送Slack消息,然后他们会开始做,然后你可以在某个时候审查他们的工作或提供帮助。"

Isa认为实现这种统一代理仍有一些困难的挑战需要克服:

安全问题:当代理能访问GitHub仓库、密码和私有数据时,风险更高。

上下文管理:对于需要很长时间的任务,需要有效管理上下文。

数据创建和工具开发:这需要大量工作。 http://t.cn/A6divLFW

发布于 韩国