Token使用效率的工程优化是今年很热门的话题,分享两个热帖供讨论~
1. Coinbase Brain Armstrong:”Token使用量不变,但支出少了一半”(链接:http://t.cn/AXSE9k48) :
"在Token使用量呈指数级增长的同时保持AI支出持平,靠的不是设置阻力和支出警报,而是更好的默认设置、路由和缓存。
更好的默认设置(而非使用限制)—— 工程师可以选择他们想要的任何模型,但默认设置非常重要。我们正在尝试通过我们的 LLM 网关,将默认选项设定为像 GLM 5.2 和 Kimi 2.7 这样的开放权重模型,同时仍鼓励工程师为不同的任务选择最合适的模型。我们 91% 的员工从未触及过他们的使用上限,因此,与其降低上限并引发一堆警报,我们选择转向成本更低的默认设置。请注意,代码审查阶段会使用多种不同的模型,这样它们就能交叉检查彼此的工作。
更好的路由 —— 在我们的自定义框架中,我们会对提示词(prompts)进行预处理,综合考虑缓存命中率和模型定价后,将其路由给最适合该任务的模型。例如,你可能希望使用前沿模型(frontier model)来进行规划,但在执行阶段就不需要,因为那样大材小用了。最终,人类不应该再去手动选择模型——AI 完全可以把这项任务自动化。
更好的缓存 —— 缓存未命中是导致成本飙升最轻易的方式。我们所有的请求都具备缓存感知能力,因此只要有可能,我们就会重复利用已预热的缓存。例如,一旦正确实施,我们在 LibreChat 中的缓存命中率直接从 5% 飙升到了 60%。
保持上下文精简 —— 切换任务时开启新的会话。严格限制文件上下文的范围。断开未使用的工具连接。不要只是简单地压缩内容。我们的目标不是“使用更少的 token”,而是“浪费更少的 token”。
更高的可见性 —— 我们的工程师可以使用他们想要的任何模型、任意数量的 token,但我们让使用情况变得透明可见——并且你在 AI 上花费得越多,我们期望你产出的影响力就越大。
我们的目标并非抑制使用量。而是要构建起能够支撑指数级增长可持续发展的基础设施。将这些措施付诸实践后,我们的 AI 支出削减了近一半,而我们的 token 使用量仍在持续增长。"
2. Nicolas Bustamante(MSFT, Ex Fintool)基于此贴提出了另一个很有意思的概念:第一波浪潮是“使用更多的 AI”。下一波浪潮则是“在正确的时间,搭配正确的缓存,在正确的模型上使用正确的 Token”。http://t.cn/AXSE9k4R
"路由(Routing)、默认设置(Defaults)、缓存(Caching)、精简上下文(Lean context)以及可见性(Visibility)——所有这些都将构成基础设施层,使 Token 的指数级增长在经济上具有可持续性。
我的预测是:下一波巨大的优化浪潮将是后台智能体(Background Agents)。
这不仅仅是跨模型的智能路由,更是跨时间的智能路由。许多智能体的工作其实不需要同步进行。比如代码审查、评测、重构、数据提取、文档更新、安全扫描、研究分析、收件箱清理、CRM 数据丰富、测试生成、迁移计划等等。这些任务中有很多都可以等上 30 分钟、2 小时,甚至一整晚再做。
今天,我们的思维大多局限于固定的 Token 价格:每百万输入 Token 多少钱,每百万输出 Token 多少钱。但算力的稀缺性实际上并不是固定的。GPU 容量有高峰也有低谷。交互式使用的需求往往在工作日激增,因此,后台工作负载完全可以在算力更便宜的时段运行。
所以我认为我们会从“固定 Token 价格”转向“感知延迟的 Token 价格”(Latency-aware token price)。换句话说:马上就要结果?支付实时价格。能等一个小时?便宜些。能等 24 小时?便宜得多。
这种趋势已经随着批处理 API(Batch APIs)初见端倪,但我认为它会演变成一个更加庞大的基础原语。未来的智能体不仅会决定使用哪个模型,还会决定何时运行该任务。
未来的 AI 技术栈将在模型质量、缓存状态、延迟容忍度、GPU 容量以及商业价值之间进行综合优化。
我们的目标本身并不是“减少 Token 的使用量”,而是“减少在错误时间对昂贵 Token 的浪费”。"
