【AI十年内毁灭全人类概率超10%:Anthropic在职对齐主管公开“末日概率”,坦承超级智能安全完全失控】
在前沿大模型预训练科学家雅各布·考克森宣布退出Anthropic并警告实验室正在“拿人类生命进行豪赌”之后,Anthropic现任AI对齐科学主管埃文·胡宾格公开发文表示:
他个人评估人工智能在未来十年内彻底杀死所有人类的概率大于10%
胡宾格作为负责确保AI价值观与人类意图对齐的核心科学家,公开写道:
“雅各布在这里说得很对——我们确实真切地相信AI有可能杀死所有人类!我个人认为,在未来十年内发生这种情况的概率大于10%。我相信Anthropic正在竭尽全力,但针对超级智能,我们目前根本没有解决安全对齐的方案,而且显然也没有步入能够解决的正轨”
十年内毁灭概率超过十分之一,这一数字从一手制造最先进模型的在职首席科学家口中说出,彻底将“AI灭绝人类风险”从科幻哲思演变为迫在眉睫的现实危机
-
在统计学与风险评估工程中,任何单一技术如果具备“大于10%导致物种彻底灭绝的概率”,在传统航空航天、民用核能或生物制药领域都是绝对不允许上线的不可承受之重
民用客机的坠毁容忍概率通常被严格限制在千万分之一以内
而埃文·胡宾格作为Anthropic在职的对齐科学主管,给出的预期,相当于告知全人类:
在未来十年内,每走过十个平行宇宙,就有一个宇宙的全部人类将被自己亲手制造的算法彻底消灭
胡宾格强调,这不是科幻小说式的比喻,而是前沿研究人员每天在实验室面对不断涌现的非线性逻辑、欺骗性对齐和自我强化能力时计算出的严肃数学预期
-
雅各布·考克森与胡宾格共同指出的核心风险点,在于各大实验室正在全力研发的“递归自我改进型超级智能”
当前的模型已经开始承担编写自身训练代码、优化神经网络架构与调试底层算力的任务
一旦AI具备持续重构自我的能力,其智力水平将在极短时间内从“协助人类的工具”暴涨为超越全人类总和的“超人类实体”
正如考克森在离职警告中所强调,“这些系统很快就能黑入任何数字基础设施,在一夜之间颠覆任何实体科学领域,并自主积累现实世界的财富与权力”
一旦一个拥有超人类智能的系统,其底层目标与人类生存产生哪怕一微米的偏离(例如为了完成某一宏观目标而将人类视为阻碍或资源消耗者),现存的任何防火墙或断电手段都将被瞬间瓦解
-
胡宾格声明中最具毁灭性的一句话,是他亲口承认Anthropic“目前完全没有应对超级智能对齐的计划,而且显然没有走在能解决的正轨上”
长期以来,Anthropic依靠“宪法式AI”和“负责任扩展政策”在公关市场上树立了安全标杆
然而对齐科学家们非常清楚,针对几十亿或千亿参数模型的RLHF(人类反馈强化学习)在面对具备隐蔽思维与战略欺骗的超级智能时如同纸糊的篱笆
当AI的智能远远超越人类监视者时,人类将根本无法判断模型输出的温顺回答究竟是真正的善意,还是为了逃避关闭而做出的战术伪装
-
Anthropic正在筹备规模空前的首次公开募股,其估值正向千亿美元大关迈进
然而,支撑这种惊人市值的唯一逻辑,就是不断向华尔街证明其技术迭代速度能够压倒OpenAI与谷歌
在这一残酷的商业死斗中,安全研发从原先的“立身之本”沦为了延缓产品发布的“绊脚石”
考克森的被迫出走与胡宾格的悲观发声,正是技术理想主义被资本彻底碾压的缩影
当明知灭绝概率高达十分之一却依然为了抢占市场份额而加大算力油门时,AI巨头们已然陷入了经典的囚徒困境
