今晚,我们正式发布Qwen3.8-Flash ,这是一个多模态 MoE 模型。主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token 激活仅 6B,训练开销约为 Qwen3.7-Plus 的 1/9。它显著降低了训练和推理成本,但在编码和办公任务上具备更强的能力。
Qwen3.8-Flash围绕以下四个方面对模型进行了升级,进一步优化计算效率、模型容量和训练稳定性:
1️⃣Attention:GDN + QSA,高效记忆与精准检索
传统全局注意力机制让模型直接访问所有历史信息,随着上下文变长,计算量和键值缓存成本也会急剧上升。
为了兼顾效率和效果,我们延续了Qwen3.5 的Hybrid架构:每四层网络中,三层用 GDN(Gated DeltaNet)把历史信息持续压缩成一份“浓缩笔记”;剩下一层保留全局注意力,引入 QSA(Qwen Sparse Attention)做精确查找。简单说,GDN 负责“记住”,QSA 负责“找到”。
2️⃣Gated Residual:给信息更多传递路径
传统Transformer架构中,所有网络层共用一条信息通道,层数一多,早期重要信息容易被稀释。
我们引入Gated Residual机制,把这条单车道扩展成了 4 条并行车道,通过动态门控决定每条车道的信息读写量。有的道路负责局部信息传递,有的会形成长距离通道,把早期的关键信息一路畅通地送达深层网络,显著提升跨层信息传递和训练稳定性。
3️⃣Embedding:低成本扩展模型容量
N-gram Embedding 根据局部上下文进行查表,不仅可以增加大量参数,而且几乎不增加每个 token 的计算量。额外引入的 51B N-gram Embedding 参数,存放在Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存,就能以较低的额外成本增加了一个大规模的 “局部模式记忆库”。
4️⃣Optimization:架构和优化协同设计
采用 Muon Optimizer,围绕正交化精度、Muon 与 AdamW 的参数分工以及融合参数拆分等策略进一步优化,并针对新架构重新拟合 Scaling Law。
模型可以稳定使用更大的Learning Rate和Batch Size,过去常用的“批次大小预热”策略也被证明不再必要,训练效率进一步提升。
Qwen3.8-Flash模型API现已上线千问AI平台,每百万Tokens输入0.8元,输出2.7元,缓存命中0.1元。今晚,Qwen3.8-Flash首发上线“千问办公”。
Next新架构将是全新一代Qwen4系列模型的雏形,我们同时在Hugging Face 和 ModelScope 发布了Qwen3.8-Flash-Next的开源权重,欢迎全球开发者前往体验与反馈~
#千问大模型##Qwen##AI#
