新品实测拆解
14小时前来自 科技看点

Kimi K3大模型有哪些技术突破?

一、核心架构:两项自研注意力机制创新

Kimi K3颠覆了Transformer中沿用十余年的核心组件,通过两项自研技术解决了超大规模模型在长序列与深度网络中的效率瓶颈。

1. Kimi Delta Attention (KDA) 混合线性注意力机制

长文本处理的计算量随序列长度呈平方级增长,这曾是超长上下文落地的关键障碍。KDA采用混合线性注意力,用线性注意力替代大部分计算,同时保留少量全注意力层处理需要精确检索的场景。

在100万token上下文长度下,KV缓存使用量最多减少75%,解码吞吐量最高提升6.3倍。

计算成本从平方级增长逼近线性增长,同等算力下能够处理更长、更复杂的任务。

这项技术直接让百万级上下文的高效推理成为现实,模型能一次性吞吐大型代码库与复杂文档。

2. 注意力残差 (Attention Residuals / AttnRes)

随着模型层数增加,信息在传递过程中容易衰减失真,训练难度显著上升。注意力残差技术改进了信息在不同网络层之间的传递与复用方式。

让模型有选择地跨层检索原始信息,底层学到的知识不容易被顶层“覆盖”或遗忘。

以不到2%的额外成本,带来了约25%的训练效率提升。

相当于为2.8万亿参数的巨型模型加装了一套“稳定器”,确保大规模训练能够稳定收敛。

二、规模扩展:极稀疏MoE架构与训练优化

Kimi K3总参数高达2.8万亿,是全球首个开源的三万亿级模型,但其实际运算量远低于参数规模所暗示的水平。

采用Stable LatentMoE混合专家架构,内部包含896个专家模块,但每次推理仅激活其中16个,稀疏度极高。

结合Quantile Balancing(分位数平衡)和Per-Head Muon等训练优化方法,整体扩展效率相比上一代K2提升了约2.5倍。

这意味着在同等算力条件下,K3能产出更强的能力,算法优化而非简单堆算力成为关键路径。

三、能力突破:编程登顶、多模态与超长上下文

1. 编程能力首度登顶全球

在Arena前端代码竞技场的匿名盲测中,K3以1679分登顶,超越Claude Fable 5(1631分)和GPT-5.6 Sol(1618分),并在7个细分领域中拿下6个第一,这是开源模型首次在真实开发者盲测中战胜所有闭源对手。

单轮提示词即可自主完成122项复杂开发任务,全程无需人工分步干预。

能从零手写GPU编译器(MiniTriton),性能与成熟编译器Triton相当。

连续运行48小时可自主完成芯片设计与验证流程。

2. 原生多模态与百万token窗口

原生支持文本、图像和视频多模态理解,无需额外插件或拼接。

具备了100万token上下文窗口,可一次性处理超长文档、完整项目代码库甚至整本书籍。

四、综合表现:全球第三的开源旗舰

Artificial Analysis智能指数综合排名全球第三,仅次于Claude Fable 5和GPT-5.6 Sol,超过了Claude Opus 4.8。

在多项基准测试中与闭源旗舰模型达到可比区间,前端编程等单项实现反超。

实际单任务成本仅约0.94美元,低于GPT-5.6 Sol(1.04美元),约为Claude Opus 4.8(1.80美元)的一半,性价比优势显著。

五、清华底色与创新文化

Kimi K3的诞生离不开其创始团队的深厚学缘。五位核心创始人均出自清华大学,公司300多人平均年龄不到30岁,团队内部没有层级,创新自下而上有序涌现。这种“清华以南、北大以东”的人才聚集效应,加上北京海淀区在人才引进、算力补贴、房屋租赁等方面的系统支持,为K3这样难而正确的创新提供了土壤。