这门课的名字里有两个词值得先拆开看:部署和开发。很多人学大模型是从调 API 开始的,写几行 Python 调一次接口,觉得已经"会了"。但真到企业环境里,问题立刻变成另一副样子:模型放在哪台机器上、用谁的显卡、推理服务怎么起、并发上来之后显存够不够、知识库的数据从哪来、检索召回不准怎么办。这门课针对的正是这段落差。

先确认你是不是它的目标读者

如果你目前的状态符合下面任意一条,这门课的内容会踩在你的缺口上:

  • 会写提示词,也跑通过大模型 API,但从没自己把模型拉到本地跑起来过;
  • 听说过 Ollama、Xinference 这类推理框架,装过但没弄清楚各自适合什么场景、显存怎么算;
  • 做过后端或数据开发,被安排去接一个大模型相关的需求,不确定该从模型侧还是应用侧入手;
  • 知道 RAG 和 Agent 这两个词,也看过示意图,但没动手把一条完整的问答链路搭通过。

反过来说,如果你已经独立部署过 vLLM 集群、调过推理吞吐,这门课的前半段对你偏基础,价值主要集中在企业级应用编排和落地的部分。

它关心的不是"跑通一次",而是"跑在别人的机器上"

课程里有相当一部分内容围绕算力环境展开,比如租用云上 GPU 实例这类操作。这一点容易被忽略,但它恰恰是自学者最容易卡住的地方:本地一张消费级显卡能跑 7B,不代表 32B 或者并发十个请求时还能跑。显存占用怎么估算、量化版本怎么选、模型文件放系统盘还是数据盘、服务怎么对外暴露端口,这些都是实际动手才会撞上的问题,而且撞上之后网上答案七零八落。课程把这块单独拎出来讲,说明它假设的读者是要真正把服务交付出去的人,而不只是本地玩一玩。

应用层:从对话到 Agent 与 RAG

模型能推理只是起点。企业场景里,模型往往要嵌进一个具体流程:读企业自己的文档、按角色调用不同工具、多轮对话里记住上下文。这就是 RAG 和 Agent 要解决的问题。

RAG 部分值得留意的是它怎么处理"检索不准"这个老大难。文档切片切多细、向量库选哪个、召回之后要不要重排、召回了无关内容模型会不会硬编答案——这些问题没有标准答案,只有踩过坑之后形成的经验判断。

Agent 部分则更偏工程:什么任务适合交给 Agent、工具怎么定义、调用失败怎么兜底、循环调用怎么设上限。这部分如果只跟着敲一遍代码,很容易产生"我懂了"的错觉,真正检验掌握程度的是你能不能给一个自己业务里的流程设计出合理的工具边界。

配套练习与看完应能回答的问题

资料里包含讲解文档和实操素材,建议按"先动手、再回看"的顺序使用:先在云上把推理服务跑起来,遇到报错再翻对应章节,比顺着目录看一遍印象深得多。

学完之后,你应该能明确回答这几个问题:

  • 给定一个模型参数量和量化精度,怎么估算它需要的显存,并据此选显卡;
  • Ollama 和 Xinference 各自的定位差别在哪,什么情况下选哪一个;
  • 一个企业知识库问答系统,从文档入库到给出答案,中间经过哪些环节,每个环节出问题时的表现是什么;
  • Dify 这类编排工具能省掉哪些工作,又会在哪些地方限制你;
  • 如果要给一个真实业务做 Agent,第一步该定义什么,哪些地方必须设失败兜底。

如果这几个问题你现在答不上来,说明缺口正好在这门课覆盖的范围内;如果大部分能答,那你可以直接跳到 RAG 和 Agent 的实操部分,把前面的环境搭建当复习。

尚硅谷企业大模型部署与开发实战

????????????????????

??????

???????????????????????????????????????????????

? ?????

?????????????????????????????????????????????????????

?��?????

? ????????????
? Dify??Ollama??Xinference???????
? ????????????��??????????

�γ�Ŀ¼

? 03-????
    AutoDL??????.pdf  [2.3 MB]
    ???.txt  [114.6 KB]
? 02-????
    02-????.exe  [157.0 MB]
? 01-?��?
    ?????-??1?????????????????.pdf  [8.5 MB]
    ?????-??2???????????????Agent&RAG.pdf  [2.3 MB]
? 04-???
    09-????1??Dify??????????????.mp4  [57.6 MB]
    02-???????????????????.mp4  [6.9 MB]
    05-????Agent?????5?????????.mp4  [20.4 MB]
    13-????2??Dify???Ollama????????????????Qwen3.mp4  [31.5 MB]
    11-????2??AutoDL?????Ollama??????.mp4  [42.8 MB]
    17-AutoDL?????????????????????????.mp4  [38.3 MB]
    16-????3??Dify???Xinference???????????????????_?????????.mp4  [33.4 MB]
    15-????3??Xinference?????????_?????????.mp4  [60.2 MB]
    18-????????1??????????.mp4  [32.7 MB]
    04-????RAG????????????.mp4  [37.9 MB]
    19-????????2????????????????.mp4  [52.8 MB]
    07-????1????????????docker.mp4  [68.0 MB]
    12-????2??Ollama?????Qwen3?????.mp4  [35.2 MB]
    08-????1??Docker??????Dify.mp4  [101.0 MB]
    14-????3??AutoDL???????????Xinference.mp4  [54.8 MB]
    20-????????3?????????????RAG??.mp4  [91.5 MB]
    01-?????????????.mp4  [22.2 MB]
    10-????2??AutoDL??????Ollama???????.mp4  [65.2 MB]
    03-?????????4??????????.mp4  [19.5 MB]
    06-????1??????????????????.mp4  [81.0 MB]

??????

  • AI??????
  • ??????????
  • ??????????

ѧϰ�ջ�

?????????????
?????????????
???????AI???????

????????

????????????????