程墨Morgan
24-12-25 16:22 微博认证:AI博主

发明ARC-AGI测试的真是个天才 !

前几天o3被吹得神乎其技的时候,一个重要指标就是ARC-AGI测试达到了87.5%的通过率,这是一个重大突破,因为ARC-AGI被认为是考核真正通用人工智能(AGI)能力的基准,其他大部分基准测试考察的更多是『知识』而不是『智能』,此话怎讲呢?

比如,问『世界第三高峰是哪座山』,AI能答出来不足为奇,因为这是知识;再问『12343乘以2342242是多少』,对于AI来说更不难,只需要识别这是一个乘法问题,那就用传统计算就可以搞定;再问『请续写哈姆莱特』,大语言模型更是擅长。

上面说的这些『智能』,更多是人类知识的总结,而不是纯粹的聪明不聪明。

ARC-AGI测试的创建者François Chollet提出的理念是,真正纯粹的『智能』测试,应该是『对于人类很容易,对于AI很难』,我的理解就是,一个思维心智正常的十岁左右人类小孩,不需要积累什么知识,也能很容易做出来的题。

François借鉴了IQ测试中的瑞文氏测试(Raven Progressive Matrices),创建了专门测纯只能得ARC-AGI,我给你一个例子,你就明白所谓『对于人类很容易,对于AI很难』是怎么做到了的,见附图1。

左边4对图,每一对中左边是输入,右边是输出,让AI看到这样几对样图,然后根据中间的测试输入,在右边画出对应的输出。

从人类角度去看这个例子,一个没啥知识的小孩也能发现规律,所有的褐色方块周围要加上一圈绿色的『光芒』,『光芒』的厚度为褐色方块边长的一半,然后每个褐色方块方框要往下垂直『照射』一道蓝色的光线,但不能遮盖绿色部分——差不多就是这个模式。

所以答案如附图2所示。

这个思考过程中,真的不需要什么『知识』,纯粹的就是智力,纯纯的智力,如果AI能够做出这样的纯智力题,才算向AGI迈进了一步。

ARC-AGI测试还有悬赏,总共几百道这样的题,第一个正确率能达到85%以上的可以获得一百万美元奖金,o3满血版能够达到87.5%,但是很遗憾,o3也不能获得这一百万美元,因为对于AI的字源消耗有要求,要求解一题的花费也就几美分,但是o3解决一道ARC-AGI要花费巨大计算量,花费几千美元!

不管怎样,ARC-AGI测试真是一个天才发明,这种纯粹的不依赖于知识积累的智能,才能真的考察AI是否达到AGI。

#人工智能##AGI#

发布于 美国