火韦先生
26-06-18 21:31

最扎心的评测,往往不是把题做难,而是把同一道题换个说法。

DeFAb 这个 benchmark 挺有意思:符号规则求解器 50 微秒内 100% 做完;最强前沿模型在最好 CoT 下能到 65%,但同一逻辑内容换 4 种表述后,按最差表现算只剩 23.5%。

🔍 它测的不是小学逻辑题,而是“默认规则被异常推翻后,怎么补一个最小假设,同时别把无关结论弄坏”。比如默认鸟会飞,企鹅例外;你要解释异常,但不能顺手把“鸟有羽毛”也推翻。

我觉得重点不是“符号主义又赢了”这种老争论。

📌 真正有价值的是:它有可验证答案。每个 hypothesis 都要过 derivation、conservativity、minimality 检查,不靠 LLM-as-judge 打分。对做 RLHF、RLVR、GRPO 的人来说,这种 verifier 比漂亮排行榜更香。

做工程最怕一种指标:prompt 换一下、格式换一下,线上表现就像换了个模型。论文里 CoT 方差大约 36 个百分点,比模型间差距还大,这个现象太熟了。

所以我的 take 是:LLM 不是“不推理”,而是很多推理能力还强依赖表述分布。能稳定执行规则、能被 verifier 约束住,才更接近可上线的推理。 arXiv: 2606.18557

发布于 中国香港