艾瑞网
26-05-28 10:01 微博认证:聚合互联网数据资讯,融合互联网行业资源的国内新经济门户。

#Qwen##大模型推理##NVIDIA##开源模型#
【行业动态:Qwen3.5把智能体推理速度推到新高】
Qwen3.5在TokenSpeed推理引擎上,针对智能体工作负载达到580 tokens per second的速度纪录。这个成果由通义千问推理团队、lightseekorg Foundation TokenSpeed团队、NVIDIA和Mooncake团队共同实现,并采用了FlashAttention-4优化。这里的重点不是单纯刷一个跑分,而是面向智能体工作负载提升推理吞吐,让模型在多轮规划、工具调用、代码生成等高token消耗场景里更快响应。
随着Agent产品从聊天走向执行,推理速度会直接影响用户体验和成本结构。580 tps这种级别的优化,意味着开源模型阵营正在从“模型效果竞争”深入到“推理系统竞争”。谁能在同等硬件上跑得更快、更稳、更便宜,谁就更容易进入企业内部工具、开发者平台和高频自动化场景。模型生态的下一轮竞争,很可能会落在推理引擎和部署效率上。

发布于 北京