HuggingFace
25-07-01 08:19 微博认证:HuggingFace官方微博

🚀 大模型开发者看过来!SGLang 现在正式支持 Hugging Face Transformers 作为后端啦!
Transformers 一直是最受欢迎的大语言模型开发工具,但部署时经常踩坑:推理慢、延迟高、上线难。而现在,SGLang 带来了真正“即插即用”的解决方案 ✨

🎯 核心亮点:
支持运行 Hugging Face 上的绝大多数 Transformers 模型(包括 LLaMA 3、Qwen、Helium 等)
不需要额外适配,模型没被 SGLang 原生支持也没关系,系统会自动 fallback 到 Transformers 实现
自定义模型也能跑,只要支持标准接口即可(如启用 trust_remote_code)
与 OpenAI 接口兼容,轻松接入你的现有系统
后端具备 RadixAttention 等高性能推理特性,哪怕 fallback 也比传统 Transformers 更高效!

🧠 简单来说:以前 Transformers 是做实验用的“原型机”,现在配合 SGLang,立刻变成高效可部署的“工业机”!

🔧 官方团队也在积极开发更多能力:性能优化、LoRA 支持、多模态模型(VLM)集成都在路上!

🤗 欢迎加入我们的中文社区:Chinese LLMs on Hugging Face,一起探索更强大的模型部署方式!
#大语言模型##Hugging Face##模型部署#

发布于 美国