子夜梦廊
26-08-26 23:17 微博认证:科技博主 微博原创视频博主

#阿里发布Qwen3.8Flash#
阿里今晚放了个大招:Qwen3.8-Flash。

这名字里的"Flash"不是随便起的,意思是"快"。但Qwen3.8-Flash的快,不只是跑得快的快,是"花小钱办大事"的快。

先说参数。总参数量125B,但每处理一个token,只激活6B。什么意思?就像一个公司有一千个员工,但每个项目只派最懂行的六个人去干,其他人 standby。这叫MoE,混合专家模型。好处是:能力不缩水,成本砍九成。

训练成本只有上一代Qwen3.7-Plus的九分之一。推理成本更狠:每百万token输入1块钱,输出3块钱。DeepSeek-V4-Flash的三分之一。

什么概念?你让Qwen3.8-Flash写一篇文章,可能花不到一瓶矿泉水的钱。

但便宜不等于菜。Qwen3.8-Flash的性能,超越了Claude Opus 4.6,接近Opus 4.8。在智能体编程测试SWE-bench Pro上,领先Opus 4.6整整9.1分。在模拟手机操作的AndroidWorld评测中,高出22.5分。在视觉推理数学任务MathVision中,超出25.1分。

简单说:代码写得快、手机玩得溜、看图算题准。这三样,正是现在AI应用最刚需的能力。

再说说MoE这个架构。很多人听不懂,我打个比方。

传统模型像一家全能医院,什么病都看,但每个科室都开着,资源消耗大。MoE模型像一家专科医院联盟,来了心脏病患者,只调心脏科专家;来了骨科患者,只调骨科专家。其他科室不启动,省电、省人、省资源。

Qwen3.8-Flash的125B参数里,藏着一堆"专家"。每次任务,只激活最相关的6B。所以它能做到"大模型的脑子,小模型的开销"。

这带来一个直接的好处:速度。

同样的任务,Qwen3.8-Flash可能比传统大模型快几倍。因为传统模型每次都要调动全部参数,它只需要调动一小部分。就像你搬家,传统模型是把整栋楼的东西都搬一遍,MoE模型是只搬你要用的那几间房。

那Flash模型和旗舰模型怎么选?

旗舰模型像全科医生,什么都能干,知识面广、推理深度强,适合复杂任务、长文档分析、深度研究。但贵、慢、耗资源。

Flash模型像专科医生,特定领域特别强,代码、办公、智能体任务,又快又便宜。但通用知识可能不如旗舰全面,极端复杂的推理任务可能差一口气。

所以选哪个,看你要干什么。

如果你是个开发者,每天写代码、调API、跑自动化任务,Flash是首选。便宜、快、够用,省下来的钱够你喝一年咖啡。

如果你是个研究员,要分析几百页的论文、做深度逻辑推理,旗舰更靠谱。贵是贵点,但关键时刻不能掉链子。

如果你是个普通用户,偶尔写个邮件、查个资料、生成个图片,Flash完全够用。你不需要为"可能用不上"的能力买单。

这就引出一个更大的问题:当模型能力逐渐够用,速度和价格会不会成为新的竞争重点?

会,而且已经是了。

去年大家比的是"谁的模型更聪明",benchmark分数更高。今年风向变了,比的是"谁的模型更便宜、更快、更省资源"。因为开发者发现,GPT-4再聪明,如果调用一次要几毛钱、等十几秒,很多应用场景就玩不起。

AI应用要规模化,成本必须降下来。Qwen3.8-Flash的定价——输入1元、输出3元——直接把门槛砍到了地板价。这意味着更多小公司、个人开发者、学生,都能用得起大模型。

但价格战也有风险。如果大家都卷价格,模型质量可能下滑。阿里这次的做法是:用MoE架构降低成本,但不降低性能。这是技术驱动的降价,不是烧钱换市场。

另外,Qwen3.8-Flash还释放了一个信号:Next架构。

阿里说,这次开源的Qwen3.8-Flash-Next,是Qwen4系列的雏形。提前放出架构改动,让社区先检验,再基于反馈构建完整模型家族。这和智谱牛来的"匿名公测"异曲同工——先让市场说话,再正式发布。

看来,中国AI厂商都在学同一招:不急着吹,先让开发者用,用好了再认领。

最后说个实用的。Qwen3.8-Flash今晚首发上线"千问办公",API服务也即将上线。如果你用千问办公写文档、做表格、分析数据,速度会明显提升。如果你是开发者,可以等API上线后接入,成本比DeepSeek还低。

总之,Qwen3.8-Flash不是"更聪明的模型",是"更聪明的商业模式"。它证明了:大模型不一定非要又大又贵,小而精、快而省,可能是未来的主流。

当AI从"炫技"走向"实用",价格和速度,就是新的战场。#千问[超话]##ai创造营# http://t.cn/AXpQ2Qhd

发布于 上海