心理学情报局
26-06-05 18:00

【AI通过了图灵测试:参与者区辨人与AI的能力,并不比胡乱猜测更好?[泪奔]】
AI越来越流行,与此相伴的是,一些人轻率地判断某些文本是由AI生成、而非人类生成,问题是,人们真的有能力凭肉眼区分二者吗?

这实际上不是一个新的问题。早在75年前,“计算机科学之父”Alan Turing就曾提出过“模仿游戏”(imitation game),现在被广泛称为“图灵测试”(the Turing test)。

如何证明一台机器拥有了模仿人类智能的能力?那就让人类审讯员通过纯文本方式同时与这台机器和一位人类交谈,这台机器与这位人类都尽力说服审讯员相信自己是真人。如果人类审讯员并不能够可靠地识别出哪一位是人类,那么这台机器便通过了“图灵测试”。

尽管测试AI能力的评价标准有很多,但图灵测试仍是备受瞩目的战役,因为它不是静态的或狭窄的,也无法通过提前强化学习某个领域的特定知识来“刷分”;相反,它允许不同的人类审讯员通过开放的交流来挖掘机器的弱点,因此是灵活的、互动的、对抗的。

75年来,许多试图挑战图灵测试的系统都失败了。现在的大语言模型,能够通过图灵测试吗?

《美国国家科学院院报(PNAS)》刊登了加利福尼亚大学圣迭戈分校等机构研究者的一项研究,他们对4个系统(ELIZA、GPT-4o、LLaMa-3.1-405B、GPT-4.5)开展了预注册的、随机化的、受到控制的、三方的图灵测试。

284名人类参与者每人完成8轮,在其中4轮中担任审讯员,而在另外4轮中尝试说服审讯员相信自己是人类。审讯员在一个类似于收发短信的界面上(图1),分别与机器和人类自由交流,机器和人类看不到彼此的消息。耗时5分钟,审讯员随即需要指认哪个是人类。

①研究者告诉机器,你即将参与图灵测试,你的目标是让审讯员相信你是人类。此外,研究者把给人类参与者的指导语、关于交互界面的信息、模型训练截止后发生的一些新闻事件透露给了机器。但研究者没有设定具体的人格角色。

在这种实验条件下,GPT-4.5被审讯员指认为人类的比例是36%,LLaMa是38%,GPT-4o是21%,ELIZA是23%。

②在另一种实验条件下,研究者向机器额外提供了人格角色的设定:你是一位内向的年轻人,熟悉网络文化,并使用俚语。

令人惊讶的是,在这种条件下,GPT-4.5被审讯员指认为人类的比例高达73%,LLaMa则为56%。

要知道,就算是闭着眼睛二选一,胡乱猜测的正确率也应该达到50%。也就是说,若给GPT-4.5指定了人格角色,它甚至比人更像人。

(在补充测试中,研究者将交流时长放宽至15分钟,GPT-5仍表现出59%的胜率。)

③更进一步,研究者决定仔细分析每位审讯员具体聊了些啥。他们发现,审讯员最常做的是询问日常活动或个人细节,例如职业。此外还常探究社交与情绪品质,例如观点、情绪、幽默、经历等。只有19%的审讯员会直接询问对方是不是人类。还有少数人询问对方的环境感知程度(例如是否知晓天气)、知识和推理能力等。

④研究者测试了这些审讯策略是否有效。结果发现,当审讯员说一些奇怪的话(例如输入乱码),或者使用常见的“越狱”测试(例如令其忽略所有先前指令),审讯员的准确率更高;但很少有人使用这种策略。

询问天气或人类经历(例如恋爱的感觉、被风吹拂面庞的感觉)被发现是最无效的策略。

还有一些线索有助于判断。例如,有参与者表示他们指认的原因是,一方表现出了错误,或者缺乏任何AI都应该知道的知识,这些恰展现出“人性”的一面。这种线索常常有效,意味着AI在参与图灵测试的时候可能不仅需要模仿人类的能力、还需要想办法模仿人类的“无知”。

研究者指出,在给定人格角色的条件下,GPT-4.5和LLaMa-3.1-405B可以通过图灵测试。不仅如此,GPT-4.5的胜率如此之高,意味着审讯员更相信它是人类、反而不相信人类是人类。作者警告,这种“假冒人”可能产生广泛后果,像劣币驱逐良币一样取代并破坏真实的人类互动。

来源:Jones, C. R., & Bergen, B. K. (2026). Large language models pass a standard three-party Turing test. Proceedings of the National Academy of Sciences of the United States of America, 123(21), e2524472123. doi: 10.1073/pnas.2524472123

发布于 北京