蚂蚁开源了 Ling-2.6-1T,万亿参数的旗舰 Thinking 模型,主打省 token,可能跟他们 Qoder 团队有关吧。
不知道阿里为什么有这么多的不同产品线的模型。有qwen又有这个ling,有wan又有 Happy Horse.
他们工程优化核心是加了 Adjustable Thinking Effort,能根据任务复杂度动态切算力:
▪️ 混合架构:MLA + Linear Attention 结合,长 context 推理的显存占用和延迟明显被压下来了。
▪️ Agent 调度:PinchBench 跑到了 87.6%,SWE-bench 也有 72.2%,原生适配 Claude Code 等主流框架。
▪️ 认知上限:AIME 26 冲到了 93.9%,复杂逻辑走 Deep Thinking,常规任务走 Fast Thinking 压低 token 消耗。
其实很简单,研究的痛点就是:万亿级模型怎么在成本和智力间找平衡
现在新开源的模型都这样,OpenRouter上现在免费一周。(截至 5 月 15 日):
🔗 HuggingFace:
http://t.cn/AXJk7cC2
发布于 四川
