如何看待Anthropic全面开放Claude Fable 5.1和Mythos 5.1?有哪些亮点?
悲观党现在可以继续悲观了。
因为这轮提升的依然是长Agent能力,比较大的突破在于科学研究方面,说明A➗依然要走2B路线,而且是坚定不移的走。
从实测表现来看,依然是拉长思考换更好的结果。
换句话说就是更努力了,当然token消耗更多也会更贵。
所以如果你悲观一点的话,就会发现从Opus 4.6开始,A➗的模型几乎都有这个问题,都是以不断的左右脑互搏与拉长思维过程换取进步,所以模型本身的“智能”到底还会不会出现一个大的跃进属实让人非常怀疑。
不过抛开这一点不谈的话,这次缓存命中的价格降低到了原来的1/4,此消彼长之下价钱应该依然还在接受范围之内。但要记得5.1思维过程拉长了,所以最后的结果到底是省钱还是亏钱很难说,有些测试结果是5.1max比5max反而要贵20%,因为输出长了很多。
至于到底要不要用疯狂消耗的token换一点点的提升,大家还是根据自己的经济实力来吧
目前看High 是真正的甜点档。
另外一个好消息是对话文风大有改善,之前跟他讨论代码问题他动不动就“最狠的一刀”,但是如果拿来写文(我靠会有人拿它来写文吗???)开到Medium 就差不多了,思维链更高不会改进文风,只会提升它的工具使用能力
然后是坏消息。
首先就是幻觉增强,自信的胡说八道更多了(根据Artificial Analysis 的事实校准测试):Fable 5就有这个倾向,OPUS 5这个倾向强到不可思议。我说过我有一个史料校验的平台,这个平台上OPUS 5根本无法正常运行,因为它会自动进行大量的脑补(我踏马是校验,不是瞎编)然后自信满满地跟我说虽然没有史料,但它相信XX说法是对的……
越来越想弄死A➗了,浪费了我那么多token。
这里补充一下,实际上想要“恰到好处”的对史料进行校验是一个非常非常非常考验模型能力的工作,因为模型必须具备足够的知识面,才可能知道大概要去搜索什么方向的内容;模型必须具备足够强的发散能力,才能去更多地进行搜索;模型必须幻觉足够低,才能诚实地报告自己查到的内容。Opus的知识面很好,也足够发散,但是幻觉问题非常严重,比如我找到一本书里张伯伦给自己自己妹妹写的信,但是书里没标注是写给他哪个妹妹的,所以我将这段史料标注为待查,然后有意思的来了。
Gemini会很自信地告诉你一个错误的回答,但是如果类似的事情重复的足够多,你会发现他很多时候会蒙对(知识面极宽,但是幻觉极强)
Gpt5.6 sol max会燃烧大量token,最后给你正确的回答,但是推理强度不够时它可能搜不到。
Opus 5就踏马非常奇妙了,它会燃烧大量token,然后告诉你它搜到一个很接近的东西,虽然不是你点名要的这个,但是应该也能证明你的这个论证。
我后来想了一下,如果是长Agent任务的话,Opus5这个做法实际上是很合理的——只要能完成任务,中间跳过一些步骤,或者是在某些步骤中找个代用品,难道不行吗??
问题是对史料校验来说,行就是行,不行就是不行,所以它的做法就显得很讨厌了
总结一下就是由于Fable5本身能力很强,所以虽然本次提升有限,但Fable 5.1依然站在所有模型的顶端。肉眼可见的提升一次比一次更小,A➗要是再没有突破性的进展未来估计不会太乐观。
而且本周Gpt-6就要发布了。
Tibo,按下那个按钮吧。
