咋打的? 16个周伯通左右互搏!
阶跃星辰放出了 Step3-VL-10B, 一个仅有 10B 参数的多模态模型, 但性能直接吊打 10-20 倍体积的大模型!
官方放出的跑分成绩: AIME 2025 数学竞赛上拿到了 94.43 分 (PaCoRe模式, AIME25看看得了, 现在是个模型感觉都能刷爆), 比 235B 的 Qwen3-VL-Thinking (83.59) 和 Gemini 2.5 Pro (83.96) 都高出一大截. HMMT 2025 (哈佛-MIT数学竞赛, 美国顶级高中数学竞赛) 更是达到 92.14, 代码能力 LiveCodeBench 76.43 也超过了 Gemini 2.5 Pro.
那么这么猛是如何做到的? 答案是搞了个叫 PaCoRe (并行协调推理) 的新方法, 用 16 路并行探索来提升复杂任务的性能, 最后把这 16 路的输出拼成一个合成上下文 (所以单次运行需要的上下文长度也不小), 让模型基于所有证据生成最终答案. 你可以简单理解为同时开16个模型, 让他们16个同时输出, 然后16个答案组合为一个大的上下文, 最终总结答案.
代价嘛: 计算量约 16 倍, 汇总阶段还需要 128K tokens 的超长上下文 (普通 SeRe 模式只要 64K). 本质上是一种"测试时计算扩展"策略, 和 OpenAI o1 思路类似, 用更多推理计算换更高准确率. 考虑到16倍那就是160B, 所以日常使用 SeRe 模式就够了, PaCoRe 适合数学竞赛这种高精度场景.
是骡子是马稍后为大家带来详细评测.
模型地址: huggingface.co/stepfun-ai/Step3-VL-10B
#ai生活指南# #ai创造营# #HOW I AI#
