i陆三金
26-08-26 22:46 微博认证:AI博主

智谱刚刚发布了 GLM-5.3-Flash (320B-A18B),即之前匿名的 Ox Alpha。

划重点:之前在OpenCode和OpenRouter 上的免费测试请求流量全部由国产芯片提供算力支持。

名字就能看出来,模型总参数320B,激活 18B。

智谱表示,GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。结合其最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。

另外,GLM-5.3-Flash 采用了稀疏注意力与线性注意力混合架构,也大幅降低了长上下文服务成本。

定价:GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20。

在 GLM Coding Plan 中, GLM-5.3-Flash 相较于 GLM-5.3,可用额度增加至 3 倍。

发布于 北京