现在论文太多了,没时间都看,通常社交媒体上很多人讨论某一篇论文时才会引发好奇心去读一读,昨晚看到一些对DeepSeek R1的讨论,早晨趁注意力好就阅读了一下,又一次被震惊了。如果说DeepSeek V3的思路还都在想象范围内,更多是惊艳的工程交付能力,DeepSeek R1就是纯粹的无人区探索和发现了(可能OpenAI已经这么做了,但没公开,也可能DeepSeek R1的做法比OpenAI还要好),从V3到R1 ,DeepSeek完成了对OpenAI的从致敬到超越,这让我有点相信梁文锋说的ASI了。
1,Zero 的做法太简洁了,简单直接有效;2,R1 一步一步cook ,确实像炼丹,像酿酒,像煲汤,勾勾兑兑,成了
可以预期开源大模型全面超越闭源模型。模型开源的一个好处是,全世界的人才都聚拢过来一起在这个路线上探索,譬如DeepSeek也不给我们钱,但我们整个团队都投入到优化DeepSeek部署性能上去了,在我们之外的大玩家就更多了。
发布于 北京
