酥说AI大厂
26-05-04 14:33

一个亲手奠定今天数据库基础的图灵奖得主,却公开劝退了整个计算机专业。

这两天刷到这个访谈,我一开始还以为又是啥贩卖焦虑的标题党。点开仔细看完才发现,这位老爷子是真敢讲大实话。

他叫 Mike Stonebraker,中文圈常叫他石破天,是 Ingres 和 Postgres 这俩核心数据库背后的关键创造者。

在被问到如果今天重新开始会给年轻人什么建议时,他极其直接地扔出了一句话,他说计算机科学未来很可能不再是一个增长型行业,他不确定还会不会建议18岁的人去学计算机。

顺着老爷子的思路往下看,我才发现他讲的这些,句句都扎在咱们普通开发者的痛点上。

坦率的讲,他在访谈里骂了半个行业,但绝不是瞎骂。

大家平时看大模型的公开测试,那些让模型写数据库查询语句的成绩,很多已经能做到 80% 甚至更高的准确率了。

有些榜单上甚至能跑到 85%。看着是不是觉得马上就能顶替掉一大波程序员了,但老爷子的团队去四个真实的生产环境数据仓库里跑了测试。

结果极其离谱,准确率直接是 0%。

你敢信???哪怕加上了 RAG 这类外挂知识库,甚至把要访问的表和具体的连接条件都直接喂给模型,最多也只能勉强摸到 35% 的边。

为啥公开榜单和真实业务的差距这么大。
其实就是因为真实世界太乱了。

公开跑分用的那些数据库,表名和列名都很干净直观。

但在真实的数据仓库里,到处都是为了效率搞的物化视图,产生了一大堆冗余数据。

最要命的是,列名经常是一堆带下划线的奇葩缩写,连人看着都得猜半天含义。

再加上现实里有大量非常特殊的数据逻辑。

比如他们提到麻省理工有个叫 J-term 的东西,指的是一月份一个月的学期。

这种极其本地化的概念,根本不在大模型的通用训练语料库里。

面对这种一团乱麻的真实环境,一个熟练的人类工程师能做到 90% 以上的准确率,但现在的大模型完全抓瞎。

说到底,阻碍 AI 替代你的,恰恰是商业社会运行中积攒的那些无法标准化的粗糙和混乱。

顺着上面的再聊聊现在火热的智能体应用。
我自己这两天正好在搞 OpenClaw,深切地感受到了老爷子说的一个痛点。

现在市面上绝大多数这类应用,其实还是只读型的。

比如系统跑一堆逻辑预测一个客户好不好,最后给你产出一个结果看看,并不去真的修改任何核心数据。

但老爷子极其清醒地指出,只要智能体从只读走向可读可写,问题立刻就会回到数据库的老大难上。
你想想看,如果你想让两个智能体协同帮你把账户里的 100 美元转给另一个人。

它们必须先扣掉你的余额,再给对方加上 100。
而且这两个智能体必须就提交这件事完全达成一致,否则就得把一切操作回滚。

这就是传统的原子性和一致性问题。
这真的让人脑子一清。

大家现在天天盯着上层的大模型参数有多大,却忘了最底层的工程规则永远摆在那里。

一旦进入真实的业务读写,AI 负责理解意图,但把事做成的底座依然是扎实的分布式系统。

聊到这里,老爷子在访谈里最硬核的部分来了,他对大科技公司毫不留情地开炮。

很多人遇到技术选型,第一反应是看大厂怎么做,觉得他们聪明肯定是对的。

但他直接点名批评当年 Oracle 的 Larry Ellison,说把还没实现的功能写在手册里卖给客户就是一种撒谎。

他还吐槽 Amazon 维护了大概 15 种数据库,完全是种类太多了,很多性能不够好的早该被淘汰。

最狠的是对 Google 的批评。
当年 Google 推 Hadoop 和最终一致性的时候,几乎全行业都在跟风盲目相信。

但老爷子觉得最终一致性在真实业务里根本行不通。比如库存必须大于等于 0 这种硬性约束,最终一致性就是会失效,导致商品超卖。

事实证明他是对的,Google 后来搞 Spanner 的时候还是老老实实用回了传统事务系统,等于自己承认了老问题绕不过去。

这其实给了我们一个极其重要的视角。
如果你已经在计算机这个行业里了,或者正在考虑怎么规划职业路径。

他的建议是,去找一个愿意带你的导师,挑一个不是顺着潮流走的方向去钻研。

去追逐所谓的主流大热点,往往是最卷也最容易被替代的。

回到咱们普通人的处境。
我是真的觉得,纯靠写代码堆工作量的红利确实在消失。

这可能也是他不建议年轻人闭着眼选计算机的原因。

但这恰好也是那些懂业务的人最好的时代。
不用再从头手搓底层的轮子,把繁琐的通用代码交给各类 AI 框架。

真正值钱的变成了你对那个垂直领域的业务认知,是你能不能搞懂那些藏在烂尾表名背后的特殊逻辑。

去挖掘一件你真正有热情的事。
就像老爷子说的,哪怕赚不到很多钱,大概率也会比做一件自己根本没热情的事过得更开心。

发布于 上海