三天送出几千亿 Token,生成超过两百万张图片和两百万秒视频。
最早看到这组数据,是在极客公园今天发布的一篇对 Agnes AI 创始人的访谈文章里 。这家初创团队在六月一号做了一个完全打破行业常态的决定,把旗下的文本,图片,视频三个模型的 API 彻底免费开放 。这不是送给用户一点用完即止的试用额度,而是真正的管够。
要知道在这之前,主流做多模态大模型的厂商基本都在严格按表计费,文本输出和多模态生成是一笔非常昂贵的开销。很多个人开发者面对高昂的调用定价只能望而却步,在算力被明码标价的阶段,全模态全部免费的举动显得非常罕见 。
顺着极客公园的这篇长文往下看,我发现这件事真正有意思的地方,并不是这家公司到底烧了多少服务器成本,而是当限制创造力的账单被拿掉之后,普通人展现出的爆发力。
1️⃣Token 焦虑正在限制用户的操作边界
过去一年真正高频使用 AI 的人应该深有体会,自从 Agent 和 Vibe Coding 流行起来,算力的消耗速度变得非常快。
以前每个月固定的订阅费基本能覆盖日常需求,现在跑一个复杂的代码工作流,或者挂着一个 Coding Agent 跑一下午,账单金额越堆越高。这种直接的计费反馈改变了很多人的使用习惯。每次想要测试一个新想法,或者让模型把代码重写一遍,第一反应是在心里算一笔账,评估这个任务到底值不值得烧掉对应的 Token。
很多原本可以深入挖掘的想法,刚冒出一个苗头,就被高昂的测试成本压了回去。AI 本来的意义是让每个人都能尽情去创造,现在反而成了一件需要能省则省的事情。
2️⃣ 免费解锁的其实是那些不敢试的念头
Agnes 宣布全面免费后,第一周涌进来的几乎全是连夜赶来的极客。在这些早期的测试里,有人跑出了长达几分钟的视频,有人给它配上工作流做整套素材。
极客公园的文章里提到一个细节,有个用户把两个女儿一路长大的零碎片段剪成了短片,配上了 AI 生成的旁白。如果按照市场上主流的多模态计费标准,反复调试生成几分钟的视频成本很高,很多人压根舍不得去尝试。
这就是 Token 免费真正带来的变化。它最核心的价值不在于省下了具体的多少钱,而是把成本对潜力的限制彻底拿掉了。当你拥有无限次试错机会时,原来不敢放手去做的事情就可以落地了。
他们团队没有选择只做单一的模型形态,而是把文字,图片,视频三个模态一起做。越好的多模态理解文本模型,越能支持图片和视频的生成。很多独立开发者或者小团队去配置三个不同厂商的接口门槛非常高。把这三个整合在一起做一个 Omni 模式的 API,能大幅度降低使用的复杂度。
免费开放的前几天,他们就收获了意想不到的反馈。原本他们写邮件给 OpenClaw 团队申请接入默认模型,对方回复说不会接入没有名气的模型。
但在免费开放的三天里,每天都有几十个普通用户在 GitHub 上排队提 issue,追问为什么不支持 Agnes,并且主动帮他们写适配的代码。
3️⃣ 把 Harness 搭好比追求贵模型更实用
很多人对免费模型有天然的疑虑,觉得不收费肯定是因为性能不行。大模型的价格和性能并不绝对挂钩,像 DeepSeek 的价格非常便宜,但在很多指标上完全不亚于高价模型。
Agnes 创始人 Bruce Yang 提到一个骑马的理论,很多时候我们不需要去训练一匹完全没有马具的野马,而是要学会使用马具。一匹跑得慢但听话的马,和一匹跑得很快的马,只要缰绳控制在手里,差距其实没那么大。这里的缰绳,指的就是现在大家常用的 Harness 智能体框架,比如 OpenClaw 或者 Claude Code。
正因为有了这种框架的强约束,不同模型之间的能力差距被弱化了。对于普通开发者来说,不用非要死磕最贵的前沿模型,在一个便宜甚至免费的模型基础上,把自己的工作流搭好,同样能解决绝大多数的场景需求。
为了支撑免费的庞大算力消耗,他们把重点放在了 200B 以内参数的模型优化上。他们专门成立了性能优化团队,测试循环调用 Transformer 层来逼近大模型效果的技术,也就是 recurrent depth transformer,在小规模验证里把参数利用率提升了百分之十。目前给普通用户的限制是每分钟请求 20 次,这基本能满足个人的开发需求。
这种策略背后其实有一种技术平权的诉求。创始人是从国内四线城市长大的,靠着竞赛和奖学金一路去到了新加坡莱佛士书院和加州大学伯克利分校。
因为经历过跨越,他非常清楚门槛的阻碍作用。
十年前不懂外语可能会在职场遇到瓶颈,十年之后不懂 AI 面临的可能是被替代的风险。一家初创团队把全模态的使用门槛降到了零,这也算是让技术平权往前走了一步。
发布于 上海
