如果你已经能把一个开源模型跑在自己的显卡上,回答几个问题,那么下一步真正卡住你的,通常不是模型本身,而是:多个人要同时用,模型怎么放、显存怎么切、请求怎么排队、接口怎么统一、某个节点挂了怎么办。这门课处理的就是这一层问题——把单机跑通的大模型,变成企业内部可持续提供服务的 AI 网关和大模型服务。

先确认你是不是这门课的目标读者

几种典型情况,对上一种就说明这门课对你有效:

  • 单机能跑 vLLM,但没在 K8s 里部署过,不知道 GPU 是怎么被 Pod 申请和分配的。
  • 团队只有一两张卡,却要同时服务多个业务方,不知道怎么把一张物理卡切给多个负载。
  • 线上接了多个模型(本地 vLLM、外部 API 混合),每个业务各写一套调用代码,想收口成统一网关。
  • 模型服务上线后经常被打爆或超时,需要限流、缓存、多实例负载均衡,但没做过这类改造。

如果以上都不沾边,只是想让模型在自己电脑上跑起来,那这门课偏重基础设施侧,不是你当前需要的。

课程主线:三段能力缺口

第一段:K8s 里的 GPU 到底是怎么被用起来的

不搞清楚 Device Plugin 和 GPU Operator 这条链路,后面所有调度问题都会变成玄学。这一段要解决的是:GPU 作为一种特殊资源,如何被 K8s 识别、上报、分配给具体容器;驱动、容器运行时、调度器各自负责哪一部分。很多人部署失败,卡点就在这一层没打通。

第二段:vGPU 与显存切分,让一张卡承载多个负载

企业里最常见的现实是卡不够。这段围绕 vGPU 调度展开,重点是把物理 GPU 的算力和显存按需切分给不同模型或不同租户,并让 K8s 能按切分后的粒度调度。你需要在这里建立起「资源怎么分、隔离边界在哪、切多了会出什么问题」的判断力。

第三段:vLLM 服务化 + LiteLLM 网关

vLLM 负责把模型跑成高吞吐的推理服务,LiteLLM 负责把它收成一个统一入口。这一段的具体内容包括:用 vLLM 部署大模型并接入 K8s;用 LiteLLM 搭建网关层,做多模型路由、限流和缓存;最后把两者拼成高可用结构——多副本、健康检查、故障转移。限流和缓存不是可选项,它们决定了你的服务在真实并发下会不会崩。

配套练习应该怎么用

这门课的价值集中在动手环节,建议按下面的顺序自检,而不是看完视频就算过:

  • 能独立把一个 GPU 节点接入集群,并确认调度器看得见这块卡。
  • 能把一块卡切成多份,让两个不同的推理负载同时跑起来且互不干扰。
  • 能把 vLLM 服务部署成多副本,并验证杀掉其中一个实例后请求仍能正常返回。
  • 能在 LiteLLM 侧配出限流规则,并实际压出触发限流的效果。
  • 能说清楚缓存命中与不命中时,请求分别走到了哪里。

做不到其中任何一条,就回到对应章节重做一遍,别急着往下走。

学完之后,你应该能回答这些问题

  • 一个 Pod 申请 GPU 时,从提交到真正拿到设备,中间经过了哪些组件?
  • vGPU 切分粒度定得太细或太粗,分别会带来什么后果?
  • vLLM 多副本前面挂 LiteLLM,请求是怎么被分发的,某个副本不健康时如何被摘掉?
  • 限流和缓存放到网关层而不是模型层,理由是什么?
  • 私有化场景下,这套结构的瓶颈最可能出现在哪一环?

这些问题答不上来,说明你只是跟着敲了一遍命令;能答上来,才说明这套 AI 基础设施你真的能自己搭、自己排障。

企业级大模型落地二:基于K8s、VLLM、LiteLLM、vGPU落地高可用AI网关和大模型

课程详情

课程标题

企业级大模型落地二:基于K8s、VLLM、LiteLLM、vGPU落地高可用AI网关和大模型

适合人群

  • 想要基于K8s落地vGPU、VLLM和LiteLLM的
  • 想要实现私有化大模型从零落地的
  • 想要落地高可用AI基础设施的

你将会学到

  • 基于K8s、vGPU、vLLM、LiteLLM落地企业级高可用AI网关和大模型
  • 落地高可用AI网关LiteLLM
  • K8s落地vGPU调度
  • LiteLLM限流和缓存
  • vLLM部署大模型
  • 基于K8s落地AI大模型

课程简介

课程包含:
  • K8s 云原生 AI 基础设施与 GPU 管理基础:
    • K8s 管理 GPU 和大模型的核心优势与必要性分析
    • K8s Device Plugin 机制与 GPU 资源调度技术架构详解
    • NVIDIA GPU Operator 自动化运维工具介绍
    • Linux 服务器 GPU 驱动安装
    • K8s 集群部署流程与环境准备
    • GPU Operator 一键部署与集群 GPU 能力注入
    • K8s 动态存储 Longhorn 部署与持久化数据管理
  • vLLM 推理引擎与 LiteLLM 高可用网关架构实战:
    • K8s 环境下大模型权重文件的预下载
    • vLLM 高性能推理引擎在 K8s 中的容器化部署
    • 企业级 LiteLLM 高可用架构设计与规划
    • K8s 高可用 Redis 哨兵模式部署
    • K8s 高可用 PostgreSQL 数据库部署
    • LiteLLM AI 网关的多副本高可用落地实战
    • LiteLLM 接口连通性测试与功能验证
    • 基于 RPM/TPM 的精细化流量控制与限流策略配置
    • LiteLLM 缓存功能验证
  • K8s GPU 虚拟化 HAMi 平台与高密度部署进阶:
    • K8s GPU 虚拟化调度平台 HAMi 核心原理介绍
    • 基于 HAMi 实现物理 GPU 资源的切分与虚拟化配置
    • K8s vGPU 调度机制测试与资源隔离验证
    • 基于显存大小的精细化 vGPU 调度策略
    • 指定显卡型号的定向调度实战
    • vLLM 推理引擎结合 vGPU 虚拟化部署

注意

本课程需要学习第一阶段的课程《企业级大模型落地一:基于VLLM和LiteLLM落地私有化大模型》。

课程目录

01 课程介绍
  01 课程介绍.mp4
02 K8s环境准备
  01 为什么要使用K8s管理GPU和大模型.mp4
  02 K8s管理GPU资源技术架构.mp4
  03 K8s GPU Operator介绍.mp4
  04 GPU服务器环境准备.mp4
  05 GPU服务器驱动安装.mp4
  06 K8s集群部署.mp4
  07 K8s GPU Operator部署.mp4
  08 K8s部署动态存储Longhorn.mp4
03 基于K8s落地大模型和AI网关
  01 基于K8s的vLLM部署模型方式.mp4
  02 基于K8s模型文件预下载方式.mp4
  03 基于K8s和vLLM部署大模型.mp4
  04 基于K8s的高可用LiteLLM部署架构介绍.mp4
  05 基于K8s部署高可用Redis哨兵模式.mp4
  06 基于K8s部署高可用Postgres.mp4
  07 基于K8s部署高可用AI网关Litellm.mp4
  08 AI网关Litellm测试.mp4
  09 AI网关Litellm RPM TPM限流.mp4
  10 AI网关Litellm缓存功能测试.mp4
04 基于K8s实现GPU虚拟化vGPU
  01 K8s GPU虚拟化调度平台HAMi介绍.mp4
  02 K8s部署HAMi实现GPU虚拟化.mp4
  03 K8s vGPU虚拟化调度测试.mp4
  04 K8s vGPU虚拟化指定显存调度.mp4
  05 K8s vGPU指定显卡类型调度GPU.mp4
  06 K8s使用vLLM+vGPU部署模型.mp4