DeepSeek今天联合北大发布了DSpark推理加速框架,针对大模型高并发生产环境的推理效率瓶颈。同等吞吐量下,单用户生成速度提升60%到85%。
大模型自回归生成,每生成一个token就要一次完整前向传播,输出越长延迟线性增长——这就是AI对话响应慢的根因。传统推测解码用小模型生成候选、大模型并行验证,但受候选质量和算力占用限制,实际部署往往要妥协。
DSpark用两个机制破局:候选生成阶段采用半自回归架构,并行主干产出候选,轻量级顺序模块注入前缀信息,两层Transformer深度就超过五层并行方案的效果。验证调度阶段引入置信度调度,动态分配算力给存活概率最高的token,全局吞吐量最大化。
已部署在DeepSeek-V4-Flash和Pro预览版,GitHub开源了训练代码和评估脚本。局限是对接受率低的复杂查询,计算开销无法回收。
#DeepSeek##DSpark##推理加速#
发布于 重庆
