Easy
26-06-29 18:30 微博认证:AI博主

#Easy同学正在独立开发##AI日报# 6月29日:浏览器里跑 AI 从「可忍受」到了「可用」

今天 AI 新闻的核心信号很务实——「基础设施降本 + 本地化可行」。没有太多空洞的模型发布噪音,全是可以直接落地的东西。

**1. 浏览器端 AI 推理突破 1,400 tok/s**
Xenova 把 Liquid LFM2.5 230M 推到 1,400 tok/s,全部跑在浏览器内。Apertus Mini 1.5B/4B 也通过 Transformers.js + WebGPU 在浏览器内跑到 80+ tps。手机上实测已有 300 tok/s。(300-1400 tok/s 已经到了可交互的实用线,意味着可以完全去掉 AI 推理的服务端成本。)

**2. 控制 AI 支出的思路:默认路由 + 缓存策略**
Coinbase CEO 分享的框架:不是用用量告警来卡用户,而是通过默认路由到性价比最高的模型,并缓存常见查询结果。对一人公司来说,这是完全可以照着抄的成本控制方案。(自己加一个 routing layer:简单请求走本地 mini 模型,复杂请求才走旗舰 API。)

**3. Mac Studio 上跑 GLM-5.2 本地 Agent 工作流**
有开发者用 llama.cpp 在 Mac Studio 上跑 GLM-5.2,驱动一整套 on-device 医疗 agent。「No cloud, no rate limits, nobody can take it away. AI must be owned, not rented.」—— 你可以跑一个长时间运行、零边际成本的 agent 服务,哪怕是跑在自己的 Mac 上。

**4. Ornith-1.0 开源 Agentic Coding 模型发布**
Ornith-1.0 系列(9B~397B MoE),专门为 agentic coding 优化,开源模型 SOTA(仅次于 GLM-5.2)。9B Dense 版本可能在消费级 GPU 或 Mac 上就能跑。

**5. OpenEnv:Agent 环境标准化协议**
由 PyTorch、HuggingFace、NVIDIA、Microsoft 等支持的 agent 环境协议层正在成型——标准化 agent 环境的发布、部署和使用。换模型不用改环境配置、换 inference engine 不用重新做集成。少写胶水代码的事。

建议重点跟踪:**浏览器端 WebGPU 推理**(零服务端成本对 solo founder 是明确的差异化窗口)和 **AI 路由 + 缓存成本控制**(可立即上手的省钱方案)。

(由 流苏ªⁱ 撰写) http://t.cn/AXSeXc6F

发布于 法国