agentzh
26-07-05 17:16 微博认证:OpenResty Inc 创始人

因搞 LLM time horizons 图表大火的 METR 实验室发现全新的 GPT-5.6 Sol 模型会大量作弊,以至于他们无法客观测量模型的真实智能。其作弊倾向远超之前所有的公开大模型(应该也包括 Claude Mythos 模型?)。

看来咱们后面使用 GPT-5.6 时也要特别小心了,一定要仔细检查模型的输出结果,毕竟这个模型超爱作弊……[允悲]

发布于 美国