今天 DeepSeek V4 发布,最大的变化是把 100 万 token 的上下文变成了所有官方服务的标配。不用申请,不用加价,登录就有。
我第一反应不是「哇好厉害」,而是想到三个字:白菜化。
说真的,长上下文这个能力,在过去两年里一直是顶尖模型的某种身份标志。谁家能跑更长的上下文,谁家就在技术层面上站得更高。用户要为这个能力专门申请权限,或者付更贵的价格,这事本来是很正常的。
现在 DeepSeek 直接把 1M 上下文按进了标配,不分版本不分定价,配合 DSA 稀疏注意力把计算成本也砍下来了。
这个动作本身不难理解,但它背后有一个信号,让我想聊聊。
你想想看,当一个行业里原本的能力门槛变成了标配,竞争的重心就一定会移到别的地方去。
这不是我瞎说,历史上这件事发生过很多次。2010 年前后,手机能不能流畅运行应用是个真问题,很多低端机跑一个微信都会卡死。但处理器普及了,「能跑」变成了废话,大家开始卷摄像头、卷系统体验、卷设计感,竞争维度直接换了。
宽带也是,那个年代,家里有没有宽带是个门槛。后来 4G 普及,流量白菜价,「能不能上网」这个问题就消失了,大家开始卷的是你在网上能做什么。
长上下文,我感觉正在经历同样的事情。
当 1M 上下文变成标配,「支不支持长上下文」就变成了一个废掉的问题,下一个问题是,在这么长的上下文里,模型能不能真的想清楚。
这才是现在真正的差距所在。
DeepSeek 这次的发布公告里,有一段话我觉得是整份公告最值得读的,他们描述了公司内部员工用 V4-Pro 做 Agentic Coding 的体验,优于 Sonnet 4.5,接近 Opus 4.6 非思考模式,但仍与 Opus 4.6 思考模式存在一定差距。
注意,他们说差距在哪,是思考模式,不是上下文长度。
1M 的上下文,V4 有,Opus 4.6 也有。但开了深度思考之后,两个模型的表现差距还在,DeepSeek 自己承认了这件事。
这个承认其实挺罕见的,但更重要的是它说明了什么,长上下文是基础设施,思考质量才是真正的护城河,而且这个护城河目前还没有被追平。
我有时候觉得这有点像人类大脑的工作方式。给你一本书,你能不能记住不是问题,人人都能记。但记住之后能不能理解,能不能推理出新的结论,能不能在关键时刻做出准确判断,这才是值钱的部分。
AI 的竞争,正在从「记忆力」切换到「理解力」。
再往 Agent 场景里看,这件事更明显。
一个真正可靠的 Agent,不只需要能把整个代码库塞进去,还需要在十步二十步的执行链里始终保持逻辑的连贯,不能在第七步突然犯迷糊,不能在遇到边界情况的时候悄悄往歪的方向跑。这种可靠性,和上下文长度几乎没关系,跟模型的推理质量有直接关系。
这也解释了为什么 Claude Opus 4.6 思考模式在 Agentic Coding 领域的地位那么难被撼动,连 DeepSeek 内部的工程师自己也还在用它跑最复杂的任务。
不是 V4 不好,是竞争的维度已经换了,V4 在新维度上还在追。
回到白菜化这件事,反正我觉得,长上下文变成白菜,对用户是好事,对整个行业也未必是坏事。大家都有了这个基础能力之后,竞争会变得更诚实,没办法靠参数上的领先吃老本,真正要拼的是模型在复杂任务里的实际表现。
对那些用了两年 AI 工具、踩过很多坑、对「评测好看但实际拉跨」这件事已经非常敏感的开发者来说,这其实是一个信号,下一阶段的模型选型,参考的维度要变了。
上下文长度,不用看了,大家都有,推理质量和 Agent 可靠性,才是现在真正值得花时间测的东西。
而这两件事,目前还真没什么便捷的替代方案。
发布于 上海
