AIGCLINK
26-05-06 14:32 微博认证:AI博主

谷歌刚刚给Gemma 4新上了:Multi-Token Prediction草稿器,使模型推理速度提升最高达3倍,且不损失输出质量

相当于给Gemma 4配了一个草稿助手,让AI写东西时不用逐字逐句慢慢想,先快速打草稿再一次性确认,速度提升了答案质量完全不变

响应速度大幅提升,近实时聊天、语音应用,Agent 工作流响应更快

26B MoE和31B Dense可以在个人电脑/消费级GPU上高速运行;E2B/E4B在移动设备上可以更快更省电

MTP草稿器采用推测解码架构,分成两步:草稿器复用主模型的计算结果,快速预测接下来的好几个token;主模型再并行验证这些token对不对

草稿器共享主模型的KV Cache,不用重复理解上下文

如果主模型认可草稿,则一次性接受整段+额外再生成1个token,猜到哪错了,截断到错误位置之前重新来,前面正确的部分保留

博客:https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/

#Gemma4##MultiTokenPrediction##llm# http://t.cn/AXJHpZVc

发布于 山西