NVIDIA英伟达GPU计算
24-12-16 17:56 微博认证:英伟达GPU计算官方微博

#NVIDIA# 【TensorRT-LLM: LLM API 精简指令畅享卓越性能!】NVIDIA TensorRT-LLM 是一个专为优化大语言模型 (LLM) 推理而设计的库。它提供了多种先进的优化技术,包括自定义 Attention Kernel、Inflight Batching、Paged KV Caching、量化技术 (FP8、INT4 AWQ、INT8 SmoothQuant 等) 以及更多功能,确保您的 NVIDIA GPU 能发挥出卓越的推理性能。
我们深知您对易用性的需求,为了让您更快上手,并迅速实现流行模型的高性能推理,我们开发了 LLM API,通过简洁的指令,您可轻松体验 TensorRT-LLM 带来的卓越性能!
点击链接了解详情:http://t.cn/A6m1Y7BM

发布于 北京