刷到 HRM-Text 1B 的发布稿:"1/1000 数据 + 一天 + $1000 训完 1B"——研究员看这种数字第一反应不是兴奋,是检查分子分母对不对。
40B structured tokens 和别人 4T 通用 pretrain 不是一回事。结构化数据本质把"挑教材"的工作前置到人类那一侧,curriculum 越干净模型越省力,这是正常工程取舍,不是架构魔法。Reddit 已经有人指出:要对比就拿同 curriculum 的普通 dense Transformer 比,别跟开源裸跑的 base 比。
更值得 callback 的是 HRM 这套架构的历史。当初 27M 参数在 ARC-AGI 上 41% 一炮而红,ARC Prize 团队后来做了非常细的 ablation,结论挺扎心:性能主要来自 iterative refinement 加 deep supervision 这套训练循环,而不是 hierarchical 那两个高低层模块本身。"脑启发"是包装,真正起作用的是 train-time compute。
所以这次 HRM-Text 1B 我会这么读:
🔍 "小数据 + 高质量 curriculum + 深监督"在 1B 文本上还能 scale,这是真有价值的工程结果
⚠️ "hierarchical 架构胜出"这个叙事,跟 ARC 那次一样,还得等独立 ablation 才能信
📌 还是 pre-alignment checkpoint,离能聊天差 SFT 加 RL 两道工序,benchmark 数字别太当真
省钱省数据当然是好事。但 "1/1000" 的分母,是别人花了 4T tokens 替整个社区把数据配比试出来的——这成本不能从分母里抠掉。 sapientinc/HRM-Text-1B
