vLLM高性能推理部署

高阶 99元 ⏱ 14 课时 👥 950 人已学
立即购买 - 99元 加入收藏

📖 课程简介

深入学习vLLM高性能推理引擎的部署和优化,掌握PagedAttention算法原理、连续批处理、张量并行、量化推理等核心技术。通过实战案例搭建高吞吐、低延迟的推理服务。

课程涵盖vLLM环境配置、模型转换、性能调优、监控告警等生产级部署技能,适合需要在生产环境部署大模型的团队。

🎯 学习收获

✅ 深入理解vLLM架构和原理
✅ 掌握PagedAttention配置优化
✅ 能够部署多GPU推理服务
✅ 学会性能监控和调优
✅ 具备生产环境部署能力

📋 前置要求

• 具备Linux服务器管理基础
• 了解Docker容器化技术
• 有大语言模型基础知识

👥 适合人群

👤 需要部署高性能推理服务的团队
👤 AI平台运维工程师
👤 追求极致性能的开发者

🛠️ 技术栈

vLLM GPU Docker

📑 课程大纲

第1章 vLLM架构与原理 2节
PagedAttention原理 ⏱ 25分钟 免费试看
连续批处理机制 ⏱ 20分钟
第2章 环境搭建与配置 2节
环境准备与安装 ⏱ 20分钟
模型加载与转换 ⏱ 25分钟
第3章 性能调优实战 2节
张量并行配置 ⏱ 20分钟
量化推理优化 ⏱ 25分钟
第4章 生产环境运维 2节
API服务部署 ⏱ 20分钟
监控与告警 ⏱ 15分钟
共 4 章,8 节课程