笑哭,最近几个大模型的吃相都不太好看。
先说Claude和Claude Code,一个月前就开始明显降智,愈演愈烈,且新迭代的模型出现了退化,Opus 4.7和4.8都不如4.6。更有意思的是,看不懂中文了,如果我用中文提问,即使是Opus 4.6也会回复如图1.2那样乱七八糟的语言。只有使用英语才能维持基础思考。昨天收到提醒,新模型Fable 5和Mythos上线,但是,一个只能在我的付费账号里使用2周即更改为API付费,一个从一开始就不包含在任何付费账户里,必须额外付费;且价格分别是O 4.8的2倍和5倍,算了下,即是我常用的O 4.6的4倍和10倍。而目前O 4.6支持下的Claude Code在我这里每5小时滚动窗口流量只能维持实际1-2个小时的使用[允悲]。逼着用户砸钱了。
然后说GPT和Codex,理论上我们已经购买了最高流量的订阅了,但前提是不能使用最高的5.5 Pro Extended,不然GPT/Codex一天就能烧完一个月的最智慧使用量。目前两个Agent平时不眠不休做任务,看得到效果,但会把人搞的非常焦虑,怕它一时降智瞎搞。但是,内嵌的image 2模型是真逆天,各种插件和跟其他软件的串联也是绝对的扛把子。对于GPT非智慧模型,我能感觉出明显幻想了,这也从很多海外公众号的文章能看出来,排版还是GPT,参考链接也还有,但是延伸解说幻想严重,我猜很多公众号博主都辨别不出来内容真假就直接发了。
最后说Gemini,毕竟是谷歌的,搜索功能、快速阅读文本和总结功能还是不错的,至于深度思考、建模、写码...就被前面的CC和C甩远了。不过我购买Gimini最大的出发点是可以扩展全家人共5个账户的储存,同时连接所有Drive,邮箱,通讯录,实现平时对手机和车的完全声控,这一点还是前面两个比不了的。也正是这个有点,它非常适合孩子使用。另外她对于各种复杂文科的备考的助力还是很效率的。
情况就是这么个情况,虽然理解所有AI软件类公司目前很可能还是赔钱状态,但如果因此财政包袱转移,降低已有年费用户的使用模型准确率还是很让人不爽的,理论上我甚至认为是侵权。
