技术博文:揭开 Jev 的架构面纱
http://t.cn/AXOKToqZ
“我通过一万次 API 调用探测 Jev,试图大致弄清它是如何构建的,以及为什么 X 上那些投机取巧的评论大多完全错了。”
由于 TypeSafe 没有公开 Jev 的模型权重和完整研究方法,作者通过约一万次 API 调用、延迟测量、分词器指纹、选项顺序与信息可见性实验,对其架构进行黑盒推测。
作者认为,目前证据最支持的模型是:Jev 以预训练的因果 Transformer 为基础,只编码一次共享状态,让多个相互隔离的问题分支并行读取它;每个问题会联合处理其全部候选项,最后通过数值读取头直接输出概率,而不进行逐 token 文本生成。其概率分布可能经过 TypeSafe 所称的 RLCD 方法训练,但具体损失函数并未公开;API 中单独名为 confidence 的字段,则只是根据输出分布计算出的摘要值,并非另一个模型预测。
作者还推测底层可能采用稀疏 MoE,以解释约 3 万 token 在约 160 毫秒内完成处理的速度,但这是全文证据最弱的一环。
发布于 山东
