HelloGitHub
24-12-30 09:56 微博认证:微博新知博主 科技博主

分享一个高效的开源 LLMs 推理和服务引擎:vllm

这是一个高效易用的大型语言模型推理引擎,专为解决推理速度慢、资源利用率低等问题而设计。它基于 PyTorch 和 CUDA,并结合内存优化算法(PagedAttention)、计算图优化和模型并行技术,大幅降低 GPU 内存占用,并充分利用多 GPU 资源提升推理性能。同时,vLLM 与 HF 模型无缝兼容。支持在 GPU、CPU、TPU 等多种硬件平台上高效运行,适用于实时问答、文本生成和推荐系统等场景。#AI创造营#

项目详情:http://t.cn/A6uIXeB8

发布于 山西