带货测试
26-06-09 06:58

从老师到瓷砖——一个从零手写的LLM蒸馏与服务引擎,刚在GitHub上开源,星数虽不多(68星),但值得每一位关注AI Infra的开发者点进去看一眼。这个叫Tessera的项目,核心是“自己造轮子”:不用现成的vLLM或TGI,而是用自定义的Triton/CUDA内核,从蒸馏训练到推理部署全部自己写,还集成了FSDP(完全分片数据并行)做蒸馏。

值得关注的有三点:

1. **技术上的“反主流”勇气**。在大家都在调包、用成熟框架的今天,作者选择从CUDA内核写起,相当于把LLM服务引擎的底层控制权拿回自己手里。这种“全栈自研”思路,在追求极致性能和定制化场景(比如边缘部署、特殊模型结构)时,可能比套壳优化更有突破空间。海外社区讨论中有人评价这是“对vLLM黑盒的一次解构尝试”。

2. **蒸馏+服务一体化的设计**。很多项目把蒸馏训练和推理服务分开,Tessera却把它们整合在一个引擎里,用FSDP做蒸馏,再用同一套底层内核跑服务。这意味着你训练完一个小模型,马上就能用同一套代码部署,省去了模型转换和适配的麻烦。对国内中小团队来说,这种“训练即服务”的思路,能显著降低从大模型到小模型落地的工程成本。

3. **对国内同行的启示**:当大家都在卷大模型参数时,Tessera提醒我们,**小模型的极致优化同样有巨大价值**。国内很多场景(如端侧AI、垂直行业)其实不需要千亿参数,一个蒸馏好的小模型配上高效的底层引擎,可能才是性价比最高的方案。与其等海外框架做适配,不如自己动手写核心内核——虽然门槛高,但护城河也深。

一句话:别只盯着大模型参数,把蒸馏和服务引擎做到极致,小模型也能跑出大价值。

#日报#

发布于 北京