硅域寻常栈
3小时前来自 科技看点

Kimi K3的基础参数有哪些?

一、核心参数总览:全球最大开源模型的技术底座

Kimi K3由月之暗面于2026年7月16日正式发布,是目前全球已公开规模最大的开源模型,其基础参数构成如下。

1. 参数规模与架构

总参数量:2.8万亿(2.8T),为全球首个突破2万亿参数级别的开源模型。

激活参数量:每次推理仅激活约500亿参数,在保持高效计算的同时实现大规模知识覆盖。

专家数量:采用混合专家(MoE)架构,包含896个专家模块,每token仅激活其中16个,稀疏度极高。

上下文窗口:原生支持100万token(1M)超长上下文,可直接处理整本书籍或大型代码仓库。

2. 架构创新:KDA与AttnRes双引擎

KDA混合线性注意力机制:用线性注意力替代大部分计算,保留少量全注意力层处理精确检索场景,使KV缓存使用量减少75%,在100万token上下文下解码吞吐量提升最高6倍。

Attention Residuals(AttnRes):允许模型有选择地跨深度检索信息,避免底层知识被顶层“遗忘”,训练效率提升约25%且额外成本不到2%。

Stable LatentMoE:通过分位数平衡和逐头Muon等训练优化,实现更稳定的MoE路由和负载均衡。

二、多模态与视觉理解能力

Kimi K3原生支持文本、图像和视频多模态理解,并非单纯的语言模型,而是面向长程编程、知识工作和复杂推理等场景设计的综合智能体模型。

三、训练与推理效率

算力转化效率:相较于上一代K2,K3的整体训练效率提升约2.5倍,同等算力产出达前代的2.5倍。

量化感知训练:从SFT阶段开始引入MXFP4权重和MXFP8激活的量化感知训练,增强硬件兼容性并降低部署门槛。

推理成本:API输出定价为15美元/百万token(约100元人民币/百万token),整体单任务成本约0.94美元,接近GPT-5.6 Sol的1.04美元,仅为Claude Opus 4.8的一半左右。

四、核心能力指标

1. 编程能力

Code Arena前端代码竞技场:以1679分登顶,超过Claude Fable 5(1631分)和GPT-5.6 Sol(1618分),这是中国大模型首次在该盲测榜单中取得第一。

Program Bench:得分77.8,超越GPT-5.6 Sol的77.6。

FrontierSWE:得分81.2,显著领先GPT-5.6 Sol的71.3。

Terminal Bench 2.1:得分88.3,距GPT-5.6 Sol仅差0.5分。

2. 综合智能水平

在Artificial Analysis智能指数中,K3综合得分位列全球第三,仅次于Claude Fable 5和GPT-5.6 Sol,已进入全球前沿模型梯队。

五、开源策略与生态兼容

开源计划:完整模型权重预计于2026年7月27日前全面开源,企业和开发者可自行下载、微调及私有化部署。

兼容性要求:K3对历史思考内容敏感,建议使用Kimi Code等经兼容性验证的Agent框架,避免会话中途切换模型。

活跃专家数:激活专家数(500亿)是DeepSeek-V3(约370亿激活参数)的1.35倍,在编程、数学等长程高难任务中展现了更强的推理能力。

六、商业模式与定价体系

Kimi K3的API定价分为输入和输出两档,输出价格为100元/百万token(约15美元),输入方面缓存命中时低至2元/百万token,编程等场景缓存率超过90%,实际使用成本可控。月之暗面已将会员拆分为面向办公的Kimi Membership和面向开发的Kimi Code Membership两个套餐,针对不同用户群体精准匹配算力资源。