Kimi K2.5 技术报告昨晚发布了。
速览要点:
- 文本–视觉联合训练:使用 15T 视觉-文本 token 预训练,零视觉 SFT(纯文本)激活视觉推理
- Agent Swarm + PARL:动态编排并行子 Agent,延迟降低至 4.5 倍,BrowseComp 得分 78.4%
- MoonViT-3D:统一图像-视频编码器,实现 4 倍时间压缩,在相同上下文长度下可处理 4 倍更长的视频
- Toggle:Token 高效的强化学习,Token 用量减少 25–30%,精度无损
这是我们迈向可扩展、真实世界智能体的进展。更多细节见报告 👉 http://t.cn/AXqmfFzC Kimi 翻译了一份中文版👉http://t.cn/AXqmfFzN
发布于 北京
