36氪
26-08-13 21:00 微博认证:36氪官方微博

【#36氪深度#|不蒸馏,大模型公司的代价是什么?】
“一个正常的训练管线,应该把蒸馏作为一种冷启动,让模型快速走到90分,然后再去解决后面的的那10分。”谈及蒸馏在当前LLM(大语言模型)训练的作用,一位基模研究员这样说道。

他所说的“冷启动”,是指让能力较弱的模型先学习更强模型已经跑通的答案和任务轨迹,尽快得到一个可以继续训练的基础版本。

对模型公司而言,“不蒸馏”则意味着要放弃这段加速过程,从基础能力开始自行探索。这样做的好处是,可以拥有一套更独立的训练体系,但也需要付出更长的模型迭代时间。

36氪智能涌现此前曾报道,字节跳动Seed成立之初便定下“不做蒸馏”的原则。另一方面,在张一鸣表态“不蒸馏”的前一周,英伟达CEO黄仁勋在接受采访时曾表达过完全相反的观点。

到底该不该蒸馏?不蒸馏的代价和回报分别是什么?36氪跟多位大模型研究员交流了相关问题。详情请阅读: http://t.cn/AXNWoCA7