就在刚刚,Ox Alpha 的马甲终于掉了,居然是智谱!
说实话,我一开始真以为,Ox Alpha是某家海外大厂藏起来测试的新模型😂
毕竟它上周五突然匿名空降OpenCode和OpenRouter,一夜之间冲到调用榜第一,还终结了DeepSeek在OpenCode连续56天的霸榜纪录。
海外开发者追着问它到底是谁家的,有人猜小米MiMo,连Gemini也参与了“认领”,不少网友干脆给它取名“牛来”。
今天,这场狼人杀终于迎来了大结局。
Ox Alpha的正式名字是GLM-5.3-Flash,也是GLM系列首个原生多模态模型。
支持1M上下文,重点强化Coding和Agent能力,上线即以MIT协议开源。能力定位达到Opus 4.8级别,价格大约是后者的1/40。
所以,这几条全AI圈都在讨论的“牛来”大模型,到底为什么热度这么高?
1
先重点聊一下GLM-5.3-Flash的Visual Coding能力。
这里说的视觉,不是让模型识别一张图片,再告诉你里面有什么。
对于前端和3D项目来说,你需要让它理解画面里的版式、空间和设计关系,继续把这些信息变成一个可以运行的产品。
比如下面这个就是GLM-5.3-Flash在Blender中构建一个厨房,没有任何外部素材......
我测试的时候,只给了它一张很简单的米色线框草图,让它从零制作一个LumaSeed桌面生态灯的3D发布页。没有现成产品图,草图只规定了大致版式,视觉细节需要它自己完成。
可以看到,它做出来出的页面几乎没什么AI味,天气、时间和植物生长也被很好的组织在同一套产品逻辑里。
我又给它换了一个更复杂的任务,又让它做一个引擎的3D 交互演示。
外壳可以切换透明,叶轮和等离子流持续运动。拖动爆炸视图以后,五层零件沿轴线展开,标注还不能互相遮挡。
下面是一次直出的效果👇
我还让它做了一个3D版的云上风电岛,不仅要生成画面,还要让 15 点的雷暴触发风机停机,让 19 点的电池参与调峰。
最后一道题,我让它从零做一款能通关的横版游戏《深海邮差》,需要自己处理潜艇移动、氧气、包裹完整度、洋流和危险物,还要加入视差、光束、粒子和无障碍模式。
是不是视觉效果都非常不错?
很多模型可以很快做出第一版,但功能增加几轮以后,前面能用的部分可能突然坏掉。
这也是原生视觉能力进入Coding以后最有价值的地方。模型可以打开浏览器观察自己的输出,发现渲染和交互中的问题,再回到代码里修改。
2
我们再回头来看一下价格。
GLM-5.3-Flash 的能力对标 Opus 4.8,但价格只有后者的约1/40,GLM-5.3的1/10。
但Token便宜,不代表完成任务一定便宜。1/40价格真正有意义的前提,是模型能够完成那些原本需要昂贵模型处理的工作。
GLM-5.3-Flash把激活参数降到18B,可以理解成一支专家团队每次只派合适的小组工作。
它还采用了线性注意力与稀疏注意力结合的混合架构,相较GLM-5.3,注意力计算量降低3.01倍,KV缓存大小降低4.44倍。
当然,这套架构也不是所有指标都已经做到最好,它的KV缓存仍略高于Kimi-K3和DeepSeek-V4-Flash,后面还有继续优化的空间。
3
值得一提的是,GLM-5.3-Flash的全部线上流量,由10万张国产卡提供服务!
让模型在实验环境中跑通,和接住全球开发者突然涌入的真实流量,是两回事。
这次Ox Alpha上线完全匿名,很多海外用户也不知道这个模型来自中国,尤其这里面还有多模态Coding、1M上下文和长时间Agent任务。
这些请求对显存、通信、调度和稳定性都提出了更高要求,反而让测试结果更有说服力。
为了适配国产芯片,智谱重新优化了推理引擎,并把多模态编码、提示词预填充和逐Token解码拆成可以单独调度的工作池。
与最初的系统相比,端到端服务性能提高了3倍,单Token成本已经达到与主流英伟达GPU相当的水平!
有意思的是,这套系统本身也有GLM-5.3参与优化,模型帮助工程师诊断瓶颈,改进后的系统再反过来承载模型。
GLM-5.3-Flash已经正式面向全球开源,同步开放了API调用。
这才是前沿智能从展示能力,走向真正普惠的重要一步。
#牛来模型确认为智谱GLM系列# 微博vibelab# #vibework#
