从论文速览到技术深潜:补齐 Agent 领域认知缺口

很多同学在了解 AI Agent 时,容易陷入两个极端:要么只看概念性综述,知道“它能自主完成任务”却说不清机制;要么一头扎进具体论文,看懂了单点技术(如 RL 微调、视觉推理),却拼不出全景图。这门课程正是为了解决这个断裂而设计的。它不只是一份论文清单,而是通过“综述+代表性工作+细分场景”的结构,带你把 Agent 领域的脉络理清楚。内容覆盖从基于大语言模型的通用 Agent 架构,到 GUI/UI Agent 这一当前最活跃的落地场景,再到自动驾驶、具身智能带来的跨领域启示。你将在其中看到 Insight-V 如何解决视觉长链条推理,ATLaS 和 DigiQVEM 如何用不同路径提升泛化性,以及 Mobile-Agent-V3、MONDAY 等最新框架如何构建多智能体协作与数据合成。

适合谁?先读哪几块?

如果你正准备面试 Agent 相关岗位,或在做技术选型时缺乏理论支撑,这门课能帮你快速建立判断力。建议的学习顺序如下:先看「基于大语言模型的 AI Agents」三部分内容,这是地基,帮你理解规划、记忆、工具调用等核心组件如何组合;接着进入 GUI Agent 综述(2025),建立领域整体认知;然后挑选你感兴趣的子方向深挖,比如对交互智能感兴趣,可重点读 UI-TARS 的长期记忆与反思机制、OS-Genesis 的数据合成思路;若关注端到端能力,则看 InfiGUI-R1 的推理式决策演进。不要试图一次性消化所有论文,而是带着问题去读:这篇解决了什么现有方法的缺陷?它在 Agent 系统里对应哪个模块?

学完能做什么?资料如何配合练习

完成学习后,你应该能够独立回答以下问题:当前主流 GUI Agent 的技术路线有哪些?它们在训练效率、泛化能力、推理深度上各有什么取舍?如何为一个复杂任务设计包含感知、规划、执行的 Agent 系统?此外,你还能针对某个细分方向(如视觉推理或多智能体协作)写出有观点的综述或技术博客。配合练习方面,建议边读边整理对比表格,记录每篇论文的核心方法、实验设置和局限性;对于提到的数据集(如 MONDAY 自动构建的轨迹数据),可尝试复现其构建逻辑,哪怕是用小规模示例验证。资料包中的综述部分提供框架,论文分享提供细节,两者互为印证,避免只见树木不见森林。

课程目录

基于⼤语⾔模型的 AI Agents—Part 1
基于⼤语⾔模型的 AI Agents—Part 2
基于⼤语⾔模型的 AI Agents—Part 3
AI Agent 论文分享:Insight-V—探索 VLM 的长链条视觉推理能力
GUI Agent 技术分享:ATLaS—同时提升训练效率和模型泛化性
GUI Agent 技术分享:DigiQVEM—使用 RL 提升模型的泛化能力
GUI Agent 最新技术:自动驾驶与具身智能技术能带来哪些启示?
GUI Agent 最新技术:InfiGUI-R1—从反应式执行向推理式决策的进阶之路
GUI Agent 最新技术:Mobile-Agent-V3GUI-OWL—新的多智能体框架与智能体模型
GUI Agent 最新技术:MONDAY—从视频自动构建 GUI Agents 轨迹数据
GUI Agents 最新技术综述(2025)
GUI Agents(智能体)技术综述
UI Agent 技术分享: UI-TARS—利用长期记忆和反思调整迭代优化模型
UI Agent 论文分享:OS-Genesis—自动合成高质量且多样化的训练数据
UI Agent 论文分享:PC-Agent—提升模型认知能力以便更好完成复杂任务