阅读思考写作-每日不坠
26-06-08 13:21

最近在学习具身机器人的数据采集,作为知识扩展的一部分,学了一点皮毛之后,就开始有个感觉,这个领域的突破,如果不能出现什么革命性的变化,遥遥无期。

当下人工智能大语言模型的突破,背后依托三个核心支柱,硬件、算法与数据。在这三个支柱中,数据是最早完善与成熟的,人类几千年的知识,通过文字、绘画、录音、照片、视频、数据积累下来,然后通过互联网数字化并且广泛传播触手可及,这样海量的数据,原本就是一个待开采的金矿,因为它已经远远超过任何一个个体所能理解与吸收的范畴。

然后是硬件,GPU并不是因为人工智能发展而重新设计的,原本它就因为图像处理的需要而出现,因为游戏产业的发展而得到了大规模商业化与不断完善的机遇,只是在最早的时候,没有人,包括英伟达自己,能够预期到它后来发挥的作用。

在三根支柱中,所缺的就是最后一个,算法,也就是如何将充裕完善的数据与GPU的硬件结合起来,催生当代人工智能的出现。

Transformer就是这样革命性的算法,而这样算法最后能够一骑绝尘还离不开一个关键因素,就是海量供训练的高质量数据推动其越过拐点,证明Scaling Law的成立,之后,无论是完善硬件、增强算法还是发掘更多可用数据,都已经是在一个飞速旋转的飞轮上添砖加瓦了。

追涨杀跌,是人性的习惯,当一个事物确定是飞速上涨的时候,就不会缺乏资金、人才、市场与机会。

但是具身智能,尤其是以具身机器人为标志物的具身智能,处于完全不同的阶段。

在这个体系之中,最领先的是硬件,无论是机器本体的关节、操控,还是用于感知的视觉、触觉,还是用于运算的GPU、CPU,都已经具备了相当的高度,甚至可以说比大语言模型人工智能早期的状况相比要好得多,因为有多得多的资金、人才与关注投入这个领域。但是一堵难以逾越的高墙,是数据。

知识可以积累,感觉无法积累,人类可以积累历史上数百亿人几千年经历堆积的知识将其用于现代的大语言模型,但是感觉是完全个人的,并不存在几千年的叠加,也不存在百亿人的叠加。

用大语言模型的数据训练具身智能,已经遭遇明确障碍,因为具身智能的核心不是知识与建立在知识上的输出,而是感觉与建立在感觉之上的行动。

这个感觉从何而来?只能去人为的出于训练的目的去收集与创造。举个例子,如果我们假设在上世纪六十年代已经具备了足够强大的硬件与足够完善的算法,只是需要有人把那些停留在纸张、唱片、相片、胶片上的信息数字化,那么需要多少人多少企业花费多少钱多少时间,才能完成这个工作呢?

答案是,这就是一道无法跨越的高峰。

根据我目前粗浅的学习,采集用于训练具身智能的数据,困难而且复杂,需要专业的设备,需要设定某种特殊的训练环境与场景,需要专门的操作人员,需要各种不同维度的数据采集,需要有人对采集的数据进行矫正清洗,一个小小的细节是,现在的确有基于视频与高灵敏度触觉的灵巧手设计,但是这几乎无法用于数据采集,因为这些设备磨损太快,消耗太大,成本太高,那些数据采集公司扛不住,能用的,还是粗糙皮实的机械爪,如此采集数据的质量,也就可想而知了。

所以具身智能很可能遭遇的,是完成了硬件准备后,发现智能迟迟不具备条件,不具备条件是因为在当下算法下训练的数据远远无法满足条件而且几乎不可能满足条件,解决方案只能是寻求新的算法,这种算法可以通过可采集的数据(无论是机械数据还是自动驾驶的视频数据还是人体数据)产生智能,而这种新的数据又可能对于硬件提出新的挑战(比如植入人体的设备),或许要经历多轮循环,才能真正达到大语言模型突破的那个拐点。

当然也可能永远达不到拐点。

或许未来想象中的泛化的全能的机器人并不会出现,因为也的确没有却然的必要性,在合成生物学取得巨大突破后,人的成本真的可以变得很低。在遭遇难以克服的障碍后,转向某种具体用途的专业机器人可能是破局之道,比如充分利用现在自动驾驶技术与数据开发出来的快递机器人,比如在工厂、矿山、深海、高山运行的任务单一环境锁定与人之间直接交互简单的当代工业机器人升级版的可以在更大范围活动的工业具身机器人,比如服务于失能人士的医疗辅助机器人,比如应用在一个根植于人性本能特殊领域的专用机器人,比如以大语言模型为根基的陪伴机器人,就如我们不一定需要一个全能的通用人工智能,我们也不一定需要一个无所不能的通用具身机器人。

在人工智能巨大成功后,对于具身智能突破后带来巨大回报的设想激励了巨大的投入,而相对于大语言模型已经被验证的发展规律,具身智能并不存在任何被验证的成熟路径,一切都是在试错。

试错的含义是,没有人知道怎么成功,没人知道什么时候成功,没有人知道会不会成功,如果资本或者政绩追求的是短期内可见的巨大回报,怕是要失望。

不是说它没有市场,而是它的市场可能更加接近于传统的工业制造品,而不是按照当下人工智能逻辑想象出的天量空间。

发布于 北京