???把Fable 蒸馏进12B开源模型 ??😲
yuxinlu1,把 Fable 5 / Composer 2.5 的代码推理蒸到本地 12B GGUF 模型里
🔗 中文阅读链接:http://t.cn/AXSmCVa1
🌐 Hugging Face 主页:http://t.cn/AXSmCVa3
个人开发者逯雨鑫在 Hugging Face 上爆火的两个模型:基于 Gemma 4-12B 做后训练,再发布成 GGUF 量化版,让普通玩家能用 llama.cpp、Ollama、LM Studio、Jan 这类工具在本地跑 coding / agentic 模型。最低版本大约 4.5GB 显存或统一内存可跑,推荐 Q4_K_M 大约 6.87GB。
两个版本分工不同:V1 偏 Coder,主打写代码、解题、生成可运行代码;V2 偏 agentic,加了多步工具调用能力,可以读、推理、动手、验证。文章里最关键的技术点是数据:作者强调训练数据不是粗暴堆量,而是“可验证”的代码推理,每条思维链对应的代码都要真的通过测试;Composer 2.5 做错的题再交给 Fable 5 重推,缺失的 reasoning 又用 Claude Opus 4.8 xhigh 重建。
作者自测称,V2 在 tau2-bench 的 telecom 子集上从基座 Gemma 4-12B 的 15% 提到 55%。他自己也说明这是本地自测、单一领域、20 个任务的结果,不能直接拿去和官方榜单比。这个态度反而是加分项:模型火了,但作者没有把它包装成“打败大厂”。
逯雨鑫是美国高校 AI 方向研究生,模型是纯自费个人项目;单是 V2 就花了 40 多小时,还烧掉一个 Claude Max 20× 套餐。硬件主要是一张 RTX 5090,真正耗时的地方不是训练,而是清洗、构造、裁剪 agentic 数据。多轮 agent 对话动辄几千到上万 token,但训练时受显存限制只能喂 2048 token,所以他用了类似滑动窗口的方式,把最近用户消息和一次工具调用附近的上下文裁进预算。
这篇最有价值的地方,是它把“小模型机会”说得比较具体:个人开发者没必要做全能模型,可以卡一个真实痛点,比如本地 coding、隐私代码、零 API 成本、低门槛 agent 体验。大厂有算力和品牌目标,个人开发者反而能围绕一个狭窄需求快速迭代。这里的关键词不是“个人打败大厂”,而是“个人用高质量数据和清晰分发方式,挤进了一个真实需求缝隙”。
#HOW I AI# #ai生活指南# #agent#
