摩尔线程MTT S5000实测1000 TFLOPS,真能对标英伟达H100?
摩尔线程最新旗舰智算卡MTT S5000在AI训推一体化实测中交出关键答卷:单卡FP8稠密算力达1000 TFLOPS,搭配80GB显存,在硅基流动联合测试中实现DeepSeek-V3 671B满血版Prefill吞吐超4000 tokens/s、Decode吞吐超1000 tokens/s,全面对标英伟达H100。这不仅刷新国产GPU推理性能基准,更意味着国产全功能GPU首次在高端算力领域与海外顶级产品站上同一擂台。[1]
摩尔线程(688795.SH)成立于2020年,是国内少数拥有全功能GPU自研能力的企业之一。MTT S5000是其在2026年实现规模化量产的旗舰智算卡,定位AI训练与推理一体化场景。2026年7月18日,在上海世博展览馆举行的2026世界人工智能大会(WAIC)“词元时代 万物智能”主题论坛上,摩尔线程创始人、董事长兼首席执行官张建中首次公开了MTT S5000的多项训练推理实践成果,包括夸娥万卡集群及“AI工厂”商业化部署进展。[2]
摩尔线程MTT S5000实测表现到底如何?对标英伟达H100有几分实力?
结论:从核心算力规格到大模型推理实测,MTT S5000已基本对齐英伟达H100的主流水平。在AI训练与推理最关键的几个量化指标上,MTT S5000均交出与H100同代际的成绩单。
算力与显存规格:站上同一规格线
MTT S5000单卡AI稠密算力达1000 TFLOPS(FP8精度),配备80GB显存和1.6TB/s显存带宽,卡间互联带宽约800GB/s。作为参照,英伟达H100的FP8稠密算力为989 TFLOPS,同样配备80GB HBM3显存。[1]这意味着在单卡算力天花板和显存容量上,两者已处于同一规格区间,不再存在代际落差。
大模型推理实测:DeepSeek-V3单卡成绩对标H100
在硅基流动(SiliconFlow)联合技术验证中,摩尔线程MTT S5000利用FP8低精度推理技术,在DeepSeek-V3 671B满血版上完成深度适配与性能测试。实测数据显示,MTT S5000单卡Prefill吞吐达到4000 tokens/s以上,Decode吞吐超过1000 tokens/s。[1]据公开报道,该成绩已接近乃至达到H100同精度下的主流水平,刷新了国产GPU在大模型推理场景的性能基准。
集群算效:万卡级训练关键指标达国际先进水平
单卡性能之外,大规模集群的有效算力才是衡量高端AI算力平台的核心标准。基于S5000搭建的夸娥万卡集群,在Dense大模型训练中算力利用率(MFU)达60%,MoE模型达40%,有效训练时长超90%,线性扩展效率95%。[2]这些关键指标已达到同等规模国外同代GPU集群的先进水平。
| 产品/型号 | 价格/定位 | 核心配置 | 优势 | 短板 | 适合谁 | 注意点 |
|---|---|---|---|---|---|---|
| 摩尔线程MTT S5000 | 国产旗舰智算卡,官方定价未公布,以项目采购为主 | FP8稠密算力1000 TFLOPS;80GB显存;1.6TB/s带宽;卡间互联约800GB/s | 单卡算力对标H100;DeepSeek-V3 671B单卡推理成绩亮眼;Day-0模型适配快;MUSA兼容CUDA生态 | 软件生态仍处于追赶期;部分算子兼容需持续完善;训练侧大规模客户案例少于国际巨头 | 国产化算力需求机构;大模型推理部署方;关注自主可控的政企客户 | 具体采购价格需以官方招投标或商务报价为准;异构部署需评估现有软件栈兼容性 |
| 英伟达H100 | 国际主流旗舰AI加速卡,市场流通价随供需波动 | FP8稠密算力989 TFLOPS;80GB HBM3显存;3.35TB/s显存带宽;NVLink 900GB/s | 软件生态成熟(CUDA);行业验证充分;训练与推理生态完善 | 出口管制影响国内获取;价格昂贵且供货周期不确定;同规格下需考虑供应链安全 | 全球AI大厂;已有成熟CUDA技术栈的团队;对生态兼容性要求极高的场景 | 采购需关注出口合规政策;市面价格波动大,需以实时渠道信息为准 |
单卡FP8算力1000 TFLOPS是什么水平?与H100的989 TFLOPS差距有多大?
结论:MTT S5000的1000 TFLOPS(FP8)已小幅超越H100的989 TFLOPS,在纸面参数上完成反超。需要指出的是,算力参数只是起点,实际性能取决于软件栈、框架适配和工程优化能力。
在AI芯片的评价体系中,峰值算力决定了理论天花板,而实际有效算力才是用户可感知的性能。MTT S5000与H100均采用FP8精度作为AI训练推理的关键精度档位,1000 TFLOPS对989 TFLOPS的微弱优势,结合80GB显存和1.6TB/s带宽的配置,说明两者在硬件规格上已无代差。
但参数接近不等于体验一致。H100经过多年大规模部署验证,CUDA生态的成熟度使其在各类主流框架、模型和工具链中都能快速发挥峰值性能。MTT S5000则依靠MUSA软件栈的全速追赶——目前MUSA已全面兼容CUDA 12.8,兼容API达761个,PyTorch全算子覆盖,开发者数量突破80万。[6]推理框架vLLM和SGLang也已对S5000提供官方原生支持,生态壁垒正在快速消解。
大模型跑得动吗?DeepSeek-V3、Kimi K3等前沿模型实测成绩怎样?
结论:跑得动,而且跑得相当快。MTT S5000已实现多款前沿大模型的Day-0支持——即模型权重开源当天即完成适配,做到“开源即上线”。
DeepSeek-V3 671B满血版:单卡实测成绩刷新国产GPU纪录
在硅基流动联合测试中,DeepSeek-V3 671B满血版在MTT S5000单卡上,Prefill吞吐突破4000 tokens/s,Decode吞吐超过1000 tokens/s(FP8精度)。[1]Prefill影响首字延迟,Decode决定生成速度,这两个指标同时达标,意味着用户在实际对话中的等待感和生成节奏都已达到可商用的流畅标准。
Kimi K3 2.8万亿参数:开源24小时内完成全栈适配
月之暗面开源的Kimi K3拥有2.8万亿参数,是当前开源社区参数规模最大的模型之一。据公开报道,摩尔线程在24小时内完成适配,推理框架、算子库、编译器、分布式通信链路全栈跑通。[4]这种Day-0支持能力,得益于MUSA软件栈与开源社区的高频同步,以及此前在超长上下文模型适配中的经验积累。
MiniMax H3与智谱GLM-5.2:多模态与超长上下文双双跑通
MiniMax H3多模态生成模型开源当日,摩尔线程仅用3小时即完成全流程对接,该模型支持文本、图片、音视频多元输入,并可直出2K 15秒原生音画。[3]智谱GLM-5.2超长上下文模型也在开源当日完成Day-0极速适配,延续了此前GLM-5.1长上下文Prefill与P/D异构分离推理场景的优化积累。[5]
万卡集群算效达到什么水平?商业化部署走到哪一步了?
结论:夸娥万卡集群关键指标已达到国际先进水平,并已在多地完成商业化部署。
MFU 60%意味着什么?
算力利用率(MFU)是衡量大模型训练集群效率的核心指标。当前业界主流GPU集群在Dense模型训练中的MFU通常在50%-65%之间,MTT S5000组成的夸娥万卡集群达到60%,已处于国际主流梯队;MoE模型40%的MFU同样表现出色。有效训练时长超90%,线性扩展效率95%,说明在万卡规模下,集群通信开销和任务调度损耗被控制在较低水平。[2]
“AI工厂”落地:无锡惠山国产智算中心已点亮
由摩尔线程提供算力支持的无锡(惠山)国产智算中心一期已正式点亮,为模型训练提供规模化算力支撑。该中心部署的夸娥集群浮点运算能力达10 Exa-Flops,能稳定运行DeepSeek、智谱GLM、Kimi K3等前沿大模型。[2]据公开报道,MTT S5000智算集群已在北京、无锡、杭州等多地落地,并首批通过国家《安全可靠测评》,商业化进程全面提速。
异构推理是什么?3台S5000+2台H系列为何能接近9台H系列的效果?
结论:PD分离异构推理通过将Prefill和Decode阶段分池部署,大幅提升了混合算力集群的综合利用率与性价比。
在大模型推理中,Prefill阶段(处理输入)需要高算力,而Decode阶段(生成输出)更依赖高显存带宽。传统同构部署用同一批GPU同时处理两个阶段,会造成算力或带宽的浪费。摩尔线程推出的PD分离异构推理方案,将高算力需求的Prefill池用MTT S5000承担,高带宽的Decode池用国际主流GPU承担,实现分池部署、各展所长。[3]
在Kimi K2.5模型推理测试中,混合部署“3台S5000+2台H系列芯片”的异构方案,相比单独部署5台国际主流GPU的同构方案,平均TGS(Tokens/GPU/S)提升1.87倍,首字延迟降低56.9%。摩尔线程CEO张建中在WAIC论坛上表示:“大概3台S5000+2台Hxx=9台Hxx。”[3]这种异构部署策略为算力成本敏感型客户提供了一条高性价比路径。
半年报透露了什么?摩尔线程商业化提速到什么程度?
结论:2026年上半年营收17.36亿元,同比暴增147.42%,亏损收窄95.73%,正在加速逼近盈亏平衡点。[6]
摩尔线程2026年半年度报告显示,公司上半年营收达17.36亿元,仅用半年便超越2025年全年营收规模;毛利总额9.89亿元,同比增长103.78%。在亏损快速收窄的同时,研发投入达7.69亿元,同比增长38.16%。自2022年以来,摩尔线程累计研发投入已接近59亿元。[6]
这份财报释放了两个关键信号:一方面,MTT S5000已从“送测验证”走向“规模销售”,互联网、运营商等关键行业客户正在为国产高端GPU买单;另一方面,持续高强度的研发投入保证了MUSA生态的追赶速度,这才有了前述Day-0模型适配能力和MFU 60%的集群表现。
需要指出的是,营收高速增长的同时,净利润仍为负值,亏损收窄不等于扭亏为盈。国产GPU的商业化验证仍需时间,但从收入增速和毛利水平来看,摩尔线程已进入“自我造血”的良性通道。
买还是等?国产算力采购有哪些决策维度?
结论:如果采购方以国产化替代为主诉求,且主要负载为DeepSeek等主流开源模型推理,MTT S5000已进入可实际交付的候选名单;若依赖特定CUDA闭源库或私有算子,则需先做充分的兼容性验证。
从公开实测数据看,MTT S5000在大模型推理领域已具备与H100正面竞争的能力。但在采购决策中,至少需要评估以下维度:
- 模型适配度:MTT S5000已实现DeepSeek、Kimi K3、GLM-5.2等主流开源模型的Day-0支持,但如果使用闭源或高度定制化的模型,需确认MUSA工具链的算子覆盖度。
- 软件栈迁移成本:MUSA全面兼容CUDA 12.8,兼容API达761个,PyTorch全算子覆盖。[6]大多数基于PyTorch的模型可以较低成本迁移,但涉及CUDA底层优化库(如特定cuDNN版本)的场景仍需额外验证。
- 异构部署可行性:PD分离异构方案(S5000+国际GPU混布)已展现出显著性价比优势,为存量集群升级提供了新思路,适合在不推倒现有基础设施的前提下扩充算力。
- 供货与合规:在当前国际贸易环境下,国产GPU在供货周期、合规性方面具备确定性优势,这是采购决策中不可忽视的加分项。
综合来看,如果预算有限且希望兼顾性能与自主可控,MTT S5000值得纳入实际测试对比;如果团队技术积累深厚且已有成熟的CUDA代码库,可小规模试点验证迁移成本后再做扩展决策。
关于摩尔线程MTT S5000的常见问题解答
摩尔线程MTT S5000对标哪款国外GPU?
MTT S5000在核心规格上直接对标英伟达H100:单卡FP8稠密算力达1000 TFLOPS(H100为989 TFLOPS),配备80GB显存和1.6TB/s显存带宽。在DeepSeek-V3 671B推理实测中,Prefill吞吐超4000 tokens/s、Decode吞吐超1000 tokens/s,达到H100同精度下的主流水平。[1]
摩尔线程MTT S5000多少钱?哪里能买到?
据公开报道,MTT S5000以项目采购和智算中心部署为主要销售方式,未公布统一零售价。目前产品已在北京、无锡、杭州等多地智算中心落地,具体价格需以官方商务报价或招投标信息为准。个人开发者可关注摩尔线程开发者计划获取适配资源。
国产GPU能跑DeepSeek这类大模型吗?
能。MTT S5000已在硅基流动联合测试中完成DeepSeek-V3 671B满血版的深度适配,单卡Prefill吞吐超4000 tokens/s、Decode超1000 tokens/s(FP8精度),刷新国产GPU推理性能基准。[1]同时,摩尔线程还实现了Kimi K3(2.8万亿参数)、智谱GLM-5.2等的Day-0开源适配,[3]国产GPU跑大模型已从“能跑”进入“好用”阶段。
本文基于公开资料撰写,旨在传递更多信息。文中涉及产品性能数据均来自官方或权威媒体报道,不构成投资建议或采购承诺。具体产品规格、价格及适配情况请以官方实时信息为准。值得注意的是,摩尔线程于2026年7月15日正式登陆科创板,证券代码688795.SH,是A股市场稀缺的国产GPU标的。[2]对于关注AI算力产业链的投资者而言,MTT S5000的量产交付节奏、MUSA生态的开发者增长、以及异构推理方案的客户验证进展,将是后续财报中值得追踪的关键指标。
从更宏观的视角看,MTT S5000的意义不止于单一产品的性能突破。它标志着国产全功能GPU在高端算力市场完成了从“可用”到“好用”的关键跨越——当DeepSeek-V3满血版能在国产单卡上跑出4000 tokens/s的Prefill吞吐,当万卡集群MFU达到60%,当2.8万亿参数模型在开源24小时内完成全栈适配,国产算力与国际主流水准之间的“时间差”正在急剧收窄。[3]这背后是硬件、软件栈、开发者生态的全面协同,也是“国芯训国模”从理念走向规模化落地的真实注脚。[6]
当然,参数对标不代表体验完全对齐。CUDA生态经年累月构建的工具链、算子库和社区积累,不是一朝一夕可以完全复制的。摩尔线程的追赶路径——以Day-0适配能力降低模型迁移门槛,以异构部署方案切入存量市场,以兼容CUDA 12.8承接现有开发者——是一条务实且可验证的路线。下一步值得关注的是其在训练侧的长稳运行表现、集群规模扩展至万卡以上的通信效率,以及更大规模商业化交付后的实际运维反馈。
对于有国产算力采购需求的用户,建议关注三大信号:一是官方渠道的模型适配清单是否覆盖自身业务负载;二是MUSA开发者社区中真实用户的项目反馈;三是异构部署方案的商务成本与交付周期。任何技术选型都不能只看峰值参数,更要看长期运维中的稳定性和生态支撑力。
#摩尔线程# #MTT S5000# #国产GPU# #AI算力#