AI大模型服务器运维实战

课程详情

课程详情

课程名称:AI大模型服务器运维实战

课程核心介绍

本课程旨在通过实战演练,帮助学员掌握AI大模型服务器运维的核心技能。课程内容涵盖从硬件到软件的全面知识,包括AI模型、GPU集群、系统配置、资源管理、性能优化等,旨在培养具备实战能力的AI模型服务器运维专家。

适合人群

  • 具备Linux系统维护经验的运维人员
  • AI算法工程师,需要了解服务器运维知识
  • 希望转行AI领域的技术人员
  • 对AI大模型服务器运维感兴趣的学习者

学习收获

  • 掌握AI大模型服务器运维的全面知识体系
  • 能够独立搭建和运维AI大模型服务器
  • 了解GPU集群的配置和管理
  • 学会资源优化和性能调优技巧
  • 具备解决AI大模型服务器常见问题的能力

课程亮点

  • 实战性强:通过真实案例和模拟环境,让学员快速掌握实战技能
  • 全面系统:涵盖AI大模型服务器运维的各个方面,满足不同层次学员的需求
  • 专家授课:由经验丰富的AI大模型服务器运维专家授课,确保教学质量
  • 互动性强:课程设置互动环节,让学员在实战中不断学习和进步

课程目录

01 构建AI大模型运行的k8s集群
  01 分享内容介绍.mp4
  02 带GPU主机获取方法-本地主机.mp4
  03 带GPU主机获取方法-公有云主机.mp4
  04 Nvidia Drive与CUDA Toolkit关系说明.mp4
  05 k8s集群主机准备.mp4
  06 容器管理工具准备.mp4
  07 安装NVIDIA容器工具包及使用.mp4
  08 k8s集群部署过程.mp4
  09 部署NVIDIA Device Plugin及GPU使用测试.mp4
02 k8s集群部署ollama使用deepseek大模型
  01 分享内容介绍.mp4
  02 k8s集群主机准备.mp4
  03 k8s集群容器管理工具准备.mp4
  04 k8s集群初始化及可用性验证.mp4
  05 k8s集群负载均衡器准备.mp4
  06 k8s集群服务代理Gateway API准备.mp4
  07 k8s集群后端存储准备.mp4
  08 使用ollama运行deepseek并验证可用性.mp4
03 本地化部署vLLM及运行大模型
  01 分享内容介绍.mp4
  02 vLLM简单介绍.mp4
  03 带GPU主机获取方式.mp4
  04 安装miniconda虚拟环境工具.mp4
  05 安装nvidia gpu驱动.mp4
  06 安装cuda-toolkit工具套件.mp4
  07 安装pytorch基础设施.mp4
  08 安装vLLM推理框架.mp4
  09 获取大模型文件.mp4
  10 运行vllm api服务.mp4
  11 使用测试案例验证可用性.mp4
04 容器化部署和使用vLLM
  01 分享内容介绍.mp4
  02 带GPU主机获取及驱动安装.mp4
  03 安装Docker容器管理工具.mp4
  04 安装NVIDIA Container Toolkit.mp4
  05 使用容器运行vLLM及可用性验证.mp4
  06 使用docker-compose运行vllm及open webui.mp4
05 k8s集群部署及使用vLLM运行大模型
  01 分享内容介绍.mp4
  02 k8s集群主机准备.mp4
  03 k8s集群节点容器管理工具准备.mp4
  04 NVIDIA容器工具包准备.mp4
  05 k8s集群初始化全过程.mp4
  06 k8s集群网络插件部署及可用性验证.mp4
  07 NVIDIA设备插件实现GPU注册.mp4
  08 k8s集群后端持久存储准备.mp4
  09 k8s集群部署vLLM及访问测试.mp4
  10 k8s集群部署open webui及使用测试.mp4
  11 部署Prometheus监控系统前期准备.mp4
  12 部署Prometheus监控系统.mp4
  13 部署GPU监控组件及查看vLLM监控指标.mp4
  14 添加GPU及vLLM监控规则.mp4
  15 添加GPU及vLLM监控仪表盘.mp4
06 本地部署SGLang及运行大模型
  01 分享内容说明.mp4
  02 SGLang介绍.mp4
  03 SGLang运行环境准备.mp4
  04 带GPU主机获取方式.mp4
  05 虚拟环境工具Conda准备.mp4
  06 NVIDIA GPU驱动安装.mp4
  07 SGLang安装.mp4
  08 SGLang运行.mp4
  09 SGLang使用测试.mp4
  10 SGLang运行时GPU基本运行维护.mp4
07 docker运行SGLang及运行大模型
  01 分享内容说明.mp4
  02 SGLang运行环境准备.mp4
  03 带GPU主机获取及GPU驱动安装.mp4
  04 容器管理工具Docker安装.mp4
  05 NVIDIA容器工具安装及使用.mp4
  06 使用docker容器运行SGLang.mp4
  07 使用docker-compose运行SGLang.mp4
  08 容器运行SGLang实现负载均衡.mp4
08 使用k8s部署SGLang运行大模型
  01 分享内容说明.mp4
  02 k8s集群节点准备.mp4
  03 k8s集群节点容器管理工具准备.mp4
  04 NVIDIA容器工具包准备及配置Docker.mp4
  05 k8s集群初始化全过程.mp4
  06 k8s集群网络插件部署.mp4
  07 NVIDIA设备插件部署实现GPU注册.mp4
  08 k8s集群后端存储.mp4
  09 k8s部署sglang及open webui.mp4
  10 Prometheus监控系统安装.mp4
  11 部署GPU监控组件及暴露sglang监控指标.mp4
  12 监控与数据仪表盘及告警规则.mp4