RAG 与 Agent 性能调优 50 讲:全链路工程实践指南
在构建企业级 RAG 与 Agent 应用时,开发者常陷入“模型能力强大,但检索效果低下”的困境。幻觉频发、召回率低、格式错乱等问题,本质并非大模型本身的能力瓶颈,而是底层数据处理管道与检索架构存在严重断点。本课程《RAG 与 Agent 性能调优 50 讲》正是针对这一核心痛点,提供了一套从多源文档解析到混合检索引擎选型的全栈解决方案,帮助开发者跨越从“demo 可用”到“生产可用”的鸿沟。
本课程对技术基础门槛要求适中,适合具备 Python 开发经验、熟悉 LLM 基本概念并有一定向量数据库使用经历的工程师或算法工程师。学习者无需从零开始理解 Transformer 原理,重点在于掌握如何将 AI 能力工程化落地。建议学习顺序遵循数据流向:首先攻克文档解析与预处理(第 1-8 讲),建立对非结构化数据清洗的直觉;其次深入切片策略与术语管理(第 4-5 讲),解决语义割裂难题;最后聚焦检索架构与引擎选型(第 9-10 讲及后续),掌握提升召回率的核心技术。这种由底向上的学习路径,有助于构建系统性的知识体系。
课程开篇直击多源文档解析的行业难题。面对 PDF、Word、图片混杂的非结构化数据,讲师深入剖析了跨页表格的自动对齐与合并技术,展示了如何通过结构化输出打破内容壁垒。针对 OCR 识别中常见的错漏频发问题,引入了结合 LLM 纠错的清洗策略,让图像文本也能被精准使用。此外,通过版面区域检测与文本矫正,解决了图像切分不合理导致的语义冗余或信息丢失问题,为后续处理奠定了高质量的数据基础。这一阶段的重点在于打造可配置、可扩展的自动化预处理流水线,将杂乱数据转化为标准输入。
在核心检索环节,课程提供了详尽的技术选型指导。讲师对比了 FAISS、HNSW 和 BM25 等主流向量检索引擎的性能特征与适用场景,帮助用户根据业务对延迟和准确率的权衡做出理性选择。针对多阶段召回不准的顽疾,课程详细拆解了混合检索架构的设计思路,强调通过关键词匹配与向量语义检索的互补,大幅提升召回的覆盖率与精准度。同时,针对垂直领域的术语混淆问题,提出了构建精准术语词库的方法,从根源上提升检索的一致性。
完成本课程后,学习者将能够独立设计并部署高性能的 RAG 检索系统。具体产出包括:掌握处理复杂 PDF 和扫描件数据的预处理管线构建能力;理解滑动窗口、动态重叠切片等先进策略的实现细节;具备根据业务需求选型和调优向量检索引擎的实战经验;以及能够诊断并解决检索链路中的语义割裂、召回率低等常见故障。
对于资料包的使用,建议不要仅将其作为视频播放列表,而应结合代码仓库进行对照学习。课程提供的预处理脚本、切片策略实现代码以及检索引擎配置模板,是理解抽象概念的最佳载体。建议在学习每一讲后,尝试修改代码参数(如调整重叠率、切换召回算法),观察其对最终检索结果的影响,从而将理论知识内化为肌肉记忆。
课程目录
未分组
- 01|如何统一多源文档格式?破解PDF、Word、图片等混杂内容解析难题
- 02|跨页表格怎么自动对齐合并?实现结构化输出的关键技术实战
- 03上|领域术语总混淆?构建精准术语词库,提升检索一致性
- 03下|领域术语总混淆?构建精准术语词库,提升检索一致性
- 04上|切片语义割裂怎么办?基于滑动窗口+关键词的语义段落识别
- 04下|切片语义割裂怎么办?基于滑动窗口+关键词的语义段落识别
- 05|固定切片召回率低?动态重叠切片机制显著提升覆盖率
- 06|OCR文本错漏频发?结合LLM纠错,让图像文本也能精准使用
- 07|图像切分不合理?文本图像矫正和版面区域检测保障信息完整且不冗余
- 08|打造可配置、可扩展的自动化预处理流水线
- 09|FAISS、HNSW还是BM25?如何选择最适合业务的向量检索引擎?
- 10|多阶段召回总不准?设计高效混合检索架构提升覆盖率与精度
- 11|HNSW参数调优难?掌握SQ8量化压缩技术,实现速度与准确率平衡
- 12|用户查询太模糊?用查询扩展提升语义匹配能力
- 13|稀疏查询召回差?HyDE伪文档生成技术解决冷启动问题
- 14|多路召回融合难?动态阈值机制确保高质量结果优先排序
- 15|政策文档检索总是漏关键点?构建高精度垂直领域检索系统
- 16|如何科学调节切片长度与滑动窗口?结合倒排索引与向量索引对比优化
- 17|模型忽略关键实体怎么办?注意力权重分配机制引导生成聚焦重点
- 18|生成内容出错?构建事实验证链+溯源标注方案有效抑制幻觉
- 19|资源有限还想微调大模型?掌握LoRA参数高效方法适配垂直领域
- 20|轻量级部署术语准确率低?Adapter网络微调实现低开销优化
- 21|提示词效果不稳定?上下文融合Prompt工程显著提升生成质量
- 22|多个模型不知选哪个?设计多模型路由机制智能选择最优生成器
- 23|长文本生成结构混乱?使用记忆网络与分段生成,确保长文内容逻辑清晰、结构完整
- 24|金融问答系统生成不准?端到端流程优化提升结果可靠性
- 25|Agentic RAG原理与多阶段任务分解机制详解
- 26|工具调用效率优化:基于Top Agent与Tool Agent的协同调度架构
- 27|如何让Agent智能选工具?Gumbel-Softmax决策算法实现自动选择
- 28|Agent记不住历史信息?Memory Transformer实现长期记忆建模
- 29|动态任务规划支持复杂推理与执行,实战构建合规审查系统
- 30|图文混合文档解析难?OCR+LLM三阶段提取与联合索引构建
- 31|文本与图像怎么一起检索?跨模态Embedding融合实现图文召回
- 32|自然语言怎么转SQL?Text2SQL生成与Schema自适应策略
- 33|如何用向量数据库搜索图像?基于Milvus的图像嵌入与相似性检索实践
- 34|CRAG自修正机制提升文档匹配精度与召回稳定性
- 35|多模态任务怎么做评估?详解跨模态检索与生成的质量评价方法
- 36|模型推理效率低?vLLM+量化技术加速模型推理
- 37|成本太高?基于请求热度的冷热模型分层部署策略
- 38|高频请求扛不住?多级缓存架构+Redis集群设计保障性能
- 39|服务扩容手动?Kubernetes弹性伸缩+负载均衡实现自动化运维
- 40|告别黑盒!用LangSmith打造大模型调用链追踪与观测工具
- 41|测试用例维护难?LangSmith自动化测试实现持续验证
- 42|多租户客服系统状态混乱?会话隔离与上下文跟踪机制实现精准响应
- 43|医疗诊断模型F1值低?构建高精度RAG系统提升糖尿病相关问答准确性
- 44|Dify联合RAGFlow:全面升级语义理解与动态召回能力
- 45|工具前沿:MCP连接智能与世界的“神经末梢”
- 46|工具前沿:智能体与RPA的组合,打造企业自动化新范式
- 47|工具前沿:Human-in-the-Loop在智能体系统中的关键作用与LangGraph实践
- 48|RAG设计范式驱动下的text2SQL实践
- 49|从被动响应到主动思考:Agentic RAG构建可自主决策的知识智能系统
- 50|技术点分布与架构汇总
- 开篇介绍
- 期中编程作业
- 结束语 & 结课测试






