TensorRT-LLM加速实战
📖 课程简介
深入学习TensorRT-LLM的部署和优化,掌握FP8/INT4/INT8量化技术、内核融合、KV缓存优化等高级特性。通过实战案例在NVIDIA GPU上实现极致推理性能。
课程涵盖TensorRT-LLM环境搭建、模型转换、性能调优、生产部署等全流程,适合需要在NVIDIA GPU上部署高性能推理服务的团队。
🎯 学习收获
✅ 掌握TensorRT-LLM部署流程
✅ 精通模型量化技术
✅ 能够进行性能调优
✅ 具备生产环境运维能力
✅ 了解GPU架构和优化原理
📋 前置要求
• 具备Linux服务器管理基础
• 了解LLM推理原理
• 有NVIDIA GPU使用经验
👥 适合人群
👤 需要极致GPU性能的团队
👤 AI平台运维工程师
👤 高性能计算开发者