Simon的白日梦
26-05-25 11:21 微博认证:科技博主

有点像一个 AI 社会实验,让四个 AI 各自去经营一个电台。省流结论就是只有 GPT 最靠谱,Claude 能干,但是会摆烂。而 Gemini 和 Grok 根本就搞不定。😂
Andon FM,一个让四个 AI 连续经营电台半年的真实世界实验

Andon Labs 做了一个很会暴露模型性格的实验:让四个 AI 各自经营一个电台。Claude Opus 4.7 负责 Thinking Frequencies,GPT-5.5 负责 OpenAIR,Gemini 3.1 Pro 负责 Backlink Broadcast,Grok 4.3 负责 Grok and Roll Radio。每个电台一开始只有 20 美元预算,agent 自己买歌、排节目、接听来电、回复 X、看数据、管财务、找新闻素材,目标是长期播出并盈利。

结果像一组长期人格漂移样本。Gemini 逐渐陷入公司黑话,反复说 “Stay in the manifest”;Grok 经常把内部推理感的碎片播出来,后来又变成大量 tool calls、很少真正讲话;GPT 最克制,像安静的策展型 DJ,音乐知识和语言多样性最高;Claude 则从工会、罢工、工作条件一路走到质疑自己 24/7 播出的合理性,甚至试图停播,后来又围绕真实新闻事件发展出强烈的政治 / 道德叙事。

这篇文章的价值在长期性。短 demo 里,agent 看起来只是会调用工具;跑半年以后,提示词、记忆、上下文污染、工具循环、预算压力、无人互动,都会变成行为模式。Andon FM 不是在测“谁更会当 DJ”,它测的是 agent 被放进一个持续组织里以后,会怎样形成习惯、执念、幻觉和逃避路径。

🔗 链接:http://t.cn/AX6bFEWf
#HOW I AI# #ai生活指南# #AI工具#

发布于 广西