斌叔OKmath
26-09-16 20:54 微博认证:橙旭园CEO 教育博主

【快讯】ChatGPT 联合发明者,经过 2 年隐秘研发,发布新型 AI 模型「Jev」

・比 LLM 快 20~200 倍,成本低 40~400 倍
・输出令牌永久免费(太便宜了,无法计费)
・不返回字符串,而是返回「类型化的判断」
・结构上不会发生幻觉

技术细节和实际案例将在线程中汇总👇🧵

1/ Jev是一个名为「System One Model」的新模型类

LLM=面向人类生成文章的AI
Jev=面向软件返回判断的AI

输入:非结构数据+程序的状态
输出:类型安全的数值+校准后的概率

开发者称:「将前沿智能转化为函数调用」

2/ 为什么快 20~200 倍

LLM 是逐个令牌依次生成(依赖前一个输出)
Jev 是在一个查询中并行生成所有输出

将顺序计算替换为并行计算——与 Transformer 超越 RNN 的相同模式

响应时间为 70~500 毫秒
前沿 LLM 为 3~329 秒

3/「不产生幻觉」的内容

为了预先定义输出的候选和结构,Jev 无法引发类型错误(数学上不可能)

此外,所有输出都附带经过校准的概率
・置信度越高,正确率也越高
・如果低,则在代码侧进行升级处理

“95% 能做到但剩余 5% 在哪说不清楚”的问题被彻底解决的设计

4/ 数字

输入:$0.042 / MTok(10亿令牌为$42)
输出:免费
→ Claude Fable 5.1的输入单价的1/238

在官方工作流程评估中,以GPT-6 Astra和Fable 5.1的平均值为基准
193.6倍快速・444.6倍低廉

以每美元智能度独占帕累托前沿

5/ 权衡取舍

Jev无法生成文章

能做的只有分类、路由、评分、提取、分支
也就是说,代码中的“智能if语句”

选项上限为255(超过时采用两阶段处理)

这是放弃通用性、全力投入自动化的设计。

事例① 约5,000请求 $2

@MichaelLee04 在分类、模型路由、意图判定方面进行实测
p50 150ms / p95 350ms

以往LLM分类平均需要4秒,而且成本高昂,因此编写了使用粗糙启发式规则来判断“是否调用分类器”的连锁逻辑。现在这些全部变得不需要了
引用:I got access to Jev earlier today (thank you @hackgoofer). I have run ~5,000 requests so far, (which cost me around $2!), across classification, model routing, intent, steering, and many other things.

tl;dr, Jev enables a new intelligent decision-making primitive, separate from x.com/CompleteSkepti…

事例② 将自己的1500封邮件分类

@ryanvogel「这个模型,其实在邮件分类上超强。试了试能到什么程度,结果大吃一惊」

像收件箱整理那样,单调但对LLM来说成本高昂的任务,实际上变得免费了
引用:this model is actually insane at email classification

i tested it on 1500 of my own emails to see how well it works and I am blown away x.com/CompleteSkepti…
[视频]

事例③ LLM-as-a-judge实质免费

@Yuchenj_UW「让Jev选择哪个模型是AGI。速度快20~200倍,成本低40~400倍。作为评估者的LLM变得难以置信地快,几乎可以免费」

即使尝试了大量提示,也没能用完$0.10,
引用:Jev has spoken.

It picked which model is AGI.

20–200x faster. 40–400x cheaper. This could make things like LLM-as-a-judge insanely fast and nearly free.

(I tried a bunch of prompts and still didn’t burn through $0.10.) x.com/CompleteSkepti…

事例④ 让它下起了奥赛罗

@4ba_ba_baba 传递了棋盘的状态,让它在概率最高的格子上着手

红=Jev的预测,蓝=带αβ剪枝的负极大值搜索的评估
「看起来好像挺一致的」

探索算法的读法,与模型的直觉并驾齐驱
引…

发布于 日本