AMD 与 Hugging Face 携手合作,为大规模语言模型提供 AMD GPU 开箱即用加速
原文 http://t.cn/A6lb8Cwr
AMD 和 Hugging Face 早些时候在 AMD AI Day 活动上宣布了合作加速 AI 模型的计划。现在,两家公司已宣布将为 Hugging Face Transformers 模型提供 AMD Instinct GPU 的开箱即用加速,这意味着 Hugging Face 社区成员可以在 AMD 硬件上以最佳性能运行最新的 AI 模型,而无需进行任何代码更改。
AMD Instinct GPU 是 AMD 最新一代服务器级 GPU,专为高性能计算和人工智能应用而设计。AMD Instinct MI250 GPU 配备了 128 GB 的高带宽内存,可支持运行更大的模型和工作负载。
为了充分利用 AMD Instinct GPU 的优势,AMD 和 Hugging Face 已集成了最新的 AMD 创新,包括 Flash Attention v2 和 Paged Attention,以及 ROCm 支持的深度加速 Text Generation Inference。
Flash Attention v2 是一个用于加速注意力机制的技术,可以显著提高模型的性能。Paged Attention 是一种用于减少模型内存占用的新技术,这对于大型模型来说非常重要。ROCm 是一个开源的 GPU 编译器平台,支持 AMD Instinct GPU。
Text Generation Inference 是一个端到端的解决方案,用于将大规模语言模型部署用于大规模推理。Text Generation Inference 现在可在 AMD Instinct GPU 上通过 docker 映像 ghcr.io/huggingface/text-generation-inference:1.2-rocm 部署到生产环境中。
AMD 和 Hugging Face 致力于继续合作,为 Hugging Face 社区提供更多创新和高效的 AI 解决方案。他们计划在未来几个月内为 AMD Radeon GPUs 提供更多支持和验证,并继续优化 MI300 系列的性能。
关键要点:
AMD Instinct GPUs 现在提供开箱即用支持 Hugging Face Transformers 模型,无需更改代码。
AMD 和 Hugging Face 已集成最新的 AMD 创新,包括 Flash Attention v2 和 Paged Attention,以及 ROCm 支持的深度加速 Text Generation Inference。
AMD Instinct MI250 GPU 配备了 128 GB 的高带宽内存,可支持运行更大的模型和工作负载。
Text Generation Inference 现在可在 AMD Instinct GPU 上通过 docker 映像 ghcr.io/huggingface/text-generation-inference:1.2-rocm 部署到生产环境中。
AMD 和 Hugging Face 致力于继续合作,为 Hugging Face 社区提供更多创新和高效的 AI 解决方案。
(written by Gemini)
