从论文堆里打捞核心价值

很多同学看 AI 技术文章,容易陷入两个极端:要么只看新闻标题的热闹,知道“大模型火了”,却说不清为什么;要么一头扎进 arXiv 的论文海洋,面对几百页的 PDF 和满篇公式直接劝退。这门课程解决的正是这个“断层”问题:它不教你如何从零复现算法,而是教你如何“精读”顶级会议的高质量论文,把那些晦涩的学术成果翻译成可理解、可落地的技术认知。 课程选取 2017 年 KDD、EMNLP、ICCV、NIPS 等国际顶级会议的最佳研究论文、应用数据科学论文作为样本。这些论文是经过同行评审的“优中选优”,代表了当时学术界对核心问题的最新思考。通过逐篇精读,你会接触到非凸优化、分布检验、深度强化学习在视觉问答中的应用等硬核话题。这不是泛泛而谈的科普,而是带着你走一遍“发现问题-建模思路-实验验证”的完整科研逻辑,帮你建立对 AI 技术演进的底层判断力。

适合谁学,以及怎么学最有效

这门课适合已经具备一定编程基础、但对 AI 理论体系感到碎片化的学习者。如果你正在备考机器学习相关岗位,或者在转岗过程中发现简历上的项目缺乏理论支撑,这里的案例可以作为很好的补充素材。它不适合完全零基础的小白,因为你至少需要理解什么是梯度下降、什么是神经网络的基本结构,否则跟上节奏会比较吃力。 建议的学习路径是从你感兴趣的方向切入。如果你对自然语言处理感兴趣,优先看 EMNLP 系列的精读;如果对计算机视觉有需求,ICCV 的部分是重点;而想理解算法背后的数学严谨性,NIPS 和 KDD 的论文则是必选项。开篇词部分会帮你建立一个 360 度的信息助理视角,了解如何高效追踪前沿动态,这部分建议先看完,再进入具体的论文精读。

配套练习与能力验收

光看不练假把式。课程的资料包里通常配有论文原文、相关的代码实现以及详细的解读笔记。建议你准备一个笔记本,每看完一篇精读,尝试回答三个问题:这篇论文解决了什么具体问题?它的核心创新点在哪里?如果让我来改进,我会从哪里入手? 学完这门课后,你应该能够独立完成以下事情:快速浏览一篇新发表的顶会论文,在 15 分钟内判断其研究价值和适用场景;能够用通俗的语言向同事解释清楚一个复杂的 AI 模型(如视觉问答系统或分布检验方法)的原理;在面对新技术谣言时,能够依据学术界的真实进展进行辟谣或验证。这种“论文精读力”是 AI 从业者从执行者转向思考者的关键一步,也是你在技术迭代中保持竞争力的核心护城河。

课程目录

开篇词 (1讲)

  1. 开篇词 _ 你的360度人工智能信息助理

人工智能国际顶级会议 (31讲)

  1. 001 _ 聊聊2017年KDD大会的时间检验奖
  2. 002 _ 精读2017年KDD最佳研究论文
  3. 003 _ 精读2017年KDD最佳应用数据科学论文
  4. 004 _ 精读2017年EMNLP最佳长论文之一
  5. 005 _ 精读2017年EMNLP最佳长论文之二
  6. 006 _ 精读2017年EMNLP最佳短论文
  7. 007 _ 精读2017年ICCV最佳研究论文
  8. 008 _ 精读2017年ICCV最佳学生论文
  9. 009 _ 如何将“深度强化学习”应用到视觉问答系统?
  10. 010 _ 精读2017年NIPS最佳研究论文之一:如何解决非凸优化问题?
  11. 011 _ 精读2017年NIPS最佳研究论文之二:KSD测试如何检验两个分布的异同?
  12. 012 _ 精读2017年NIPS最佳研究论文之三:如何解决非完美信息博弈问题?
  13. 013 _ WSDM 2018论文精读:看谷歌团队如何做位置偏差估计
  14. 014 _ WSDM 2018论文精读:看京东团队如何挖掘商品的替代信息和互补信息
  15. 015 _ WSDM 2018论文精读:深度学习模型中如何使用上下文信息?
  16. 016 _ The Web 2018论文精读:如何对商品的图片美感进行建模?
  17. 017 _ The Web 2018论文精读:如何改进经典的推荐算法BPR?
  18. 018 _ The Web 2018论文精读:如何从文本中提取高元关系?
  19. 019 _ SIGIR 2018论文精读:偏差和“流行度”之间的关系
  20. 020 _ SIGIR 2018论文精读:如何利用对抗学习来增强排序模型的普适性?
  21. 021 _ SIGIR 2018论文精读:如何对搜索页面上的点击行为进行序列建模?
  22. 022 _ CVPR 2018论文精读:如何研究计算机视觉任务之间的关系?
  23. 023 _ CVPR 2018论文精读:如何从整体上对人体进行三维建模?
  24. 024 _ CVPR 2018论文精读:如何解决排序学习计算复杂度高这个问题?
  25. 025 _ ICML 2018论文精读:模型经得起对抗样本的攻击?这或许只是个错觉
  26. 026 _ ICML 2018论文精读:聊一聊机器学习算法的“公平性”问题
  27. 027 _ ICML 2018论文精读:优化目标函数的时候,有可能放大了“不公平”?
  28. 028 _ ACL 2018论文精读:问答系统场景下,如何提出好问题?
  29. 029 _ ACL 2018论文精读:什么是对话中的前提触发?如何检测?
  30. 030 _ ACL 2018论文精读:什么是“端到端”的语义哈希?
  31. 复盘 7 _ 一起来读人工智能国际顶级会议论文

搜索核心技术 (28讲)

  1. 031 _ 经典搜索核心算法:TF-IDF及其变种
  2. 032 _ 经典搜索核心算法:BM25及其变种(内附全年目录)
  3. 033 _ 经典搜索核心算法:语言模型及其变种
  4. 034 _ 机器学习排序算法:单点法排序学习
  5. 035 _ 机器学习排序算法:配对法排序学习
  6. 036 _ 机器学习排序算法:列表法排序学习
  7. 037 _ “查询关键字理解”三部曲之分类
  8. 038 _ “查询关键字理解”三部曲之解析
  9. 039 _ “查询关键字理解”三部曲之扩展
  10. 040 _ 搜索系统评测,有哪些基础指标?
  11. 041 _ 搜索系统评测,有哪些高级指标?
  12. 042 _ 如何评测搜索系统的在线表现?
  13. 043 _ 文档理解第一步:文档分类
  14. 044 _ 文档理解的关键步骤:文档聚类
  15. 045 _ 文档理解的重要特例:多模文档建模
  16. 046 _ 大型搜索框架宏观视角:发展、特点及趋势
  17. 047 _ 多轮打分系统概述
  18. 048 _ 搜索索引及其相关技术概述
  19. 049 _ PageRank算法的核心思想是什么?
  20. 050 _ 经典图算法之HITS
  21. 051 _ 社区检测算法之“模块最大化 ”
  22. 052 _ 机器学习排序算法经典模型:RankSVM
  23. 053 _ 机器学习排序算法经典模型:GBDT
  24. 054 _ 机器学习排序算法经典模型:LambdaMART
  25. 055 _ 基于深度学习的搜索算法:深度结构化语义模型
  26. 056 _ 基于深度学习的搜索算法:卷积结构下的隐含语义模型
  27. 057 _ 基于深度学习的搜索算法:局部和分布表征下的搜索模型
  28. 复盘 1 _ 搜索核心技术模块

推荐系统核心技术 (22讲)

  1. 058 _ 简单推荐模型之一:基于流行度的推荐模型
  2. 059 _ 简单推荐模型之二:基于相似信息的推荐模型
  3. 060 _ 简单推荐模型之三:基于内容信息的推荐模型
  4. 061 _ 基于隐变量的模型之一:矩阵分解
  5. 062 _ 基于隐变量的模型之二:基于回归的矩阵分解
  6. 063 _ 基于隐变量的模型之三:分解机
  7. 064 _ 高级推荐模型之一:张量分解模型
  8. 065 _ 高级推荐模型之二:协同矩阵分解
  9. 066 _ 高级推荐模型之三:优化复杂目标函数
  10. 067 _ 推荐的Exploit和Explore算法之一:EE算法综述
  11. 068 _ 推荐的Exploit和Explore算法之二:UCB算法
  12. 069 _ 推荐的Exploit和Explore算法之三:汤普森采样算法
  13. 070 _ 推荐系统评测之一:传统线下评测
  14. 071 _ 推荐系统评测之二:线上评测
  15. 072 _ 推荐系统评测之三:无偏差估计
  16. 073 _ 现代推荐架构剖析之一:基于线下离线计算的推荐架构
  17. 074 _ 现代推荐架构剖析之二:基于多层搜索架构的推荐系统
  18. 075 _ 现代推荐架构剖析之三:复杂现代推荐架构漫谈
  19. 076 _ 基于深度学习的推荐模型之一:受限波兹曼机
  20. 077 _ 基于深度学习的推荐模型之二:基于RNN的推荐系统
  21. 078 _ 基于深度学习的推荐模型之三:利用深度学习来扩展推荐系统
  22. 复盘 2 _ 推荐系统核心技术模块

广告系统核心技术 (19讲)

  1. 079 _ 广告系统概述
  2. 080 _ 广告系统架构
  3. 081 _ 广告回馈预估综述
  4. 082 _ Google的点击率系统模型
  5. 083 _ Facebook的广告点击率预估模型
  6. 084 _ 雅虎的广告点击率预估模型
  7. 085 _ LinkedIn的广告点击率预估模型
  8. 086 _ Twitter的广告点击率预估模型
  9. 087 _ 阿里巴巴的广告点击率预估模型
  10. 088 _ 什么是“基于第二价位的广告竞拍”?
  11. 089 _ 广告的竞价策略是怎样的?
  12. 090 _ 如何优化广告的竞价策略?
  13. 091 _ 如何控制广告预算?
  14. 092 _ 如何设置广告竞价的底价?
  15. 093 _ 聊一聊“程序化直接购买”和“广告期货”
  16. 094 _ 归因模型:如何来衡量广告的有效性
  17. 095 _ 广告投放如何选择受众?如何扩展受众群?
  18. 096 _ 如何利用机器学习技术来检测广告欺诈?
  19. 复盘 4 _ 广告系统核心技术模块

自然语言处理及文本处理核心技术 (19讲)

  1. 097 _ LDA模型的前世今生
  2. 098 _ LDA变种模型知多少
  3. 099 _ 针对大规模数据,如何优化LDA算法?
  4. 100 _ 基础文本分析模型之一:隐语义分析
  5. 101 _ 基础文本分析模型之二:概率隐语义分析
  6. 102 _ 基础文本分析模型之三:EM算法
  7. 103 _ 为什么需要Word2Vec算法?
  8. 104 _ Word2Vec算法有哪些扩展模型?
  9. 105 _ Word2Vec算法有哪些应用?
  10. 106 _ 序列建模的深度学习利器:RNN基础架构
  11. 107 _ 基于门机制的RNN架构:LSTM与GRU
  12. 108 _ RNN在自然语言处理中有哪些应用场景?
  13. 109 _ 对话系统之经典的对话模型
  14. 110 _ 任务型对话系统有哪些技术要点?
  15. 111 _ 聊天机器人有哪些核心技术要点?
  16. 112 _ 什么是文档情感分类?
  17. 113 _ 如何来提取情感“实体”和“方面”呢?
  18. 114 _ 文本情感分析中如何做意见总结和搜索?
  19. 复盘 3 _ 自然语言处理及文本处理核心技术模块

计算机视觉核心技术 (13讲)

  1. 115 _ 什么是计算机视觉?
  2. 116 _ 掌握计算机视觉任务的基础模型和操作
  3. 117 _ 计算机视觉中的特征提取难在哪里?
  4. 118 _ 基于深度学习的计算机视觉技术(一):深度神经网络入门
  5. 119 _ 基于深度学习的计算机视觉技术(二):基本的深度学习模型
  6. 120 _ 基于深度学习的计算机视觉技术(三):深度学习模型的优化
  7. 121 _ 计算机视觉领域的深度学习模型(一):AlexNet
  8. 122 _ 计算机视觉领域的深度学习模型(二):VGG & GoogleNet
  9. 123 _ 计算机视觉领域的深度学习模型(三):ResNet
  10. 124 _ 计算机视觉高级话题(一):图像物体识别和分割
  11. 125 _ 计算机视觉高级话题(二):视觉问答
  12. 126 _ 计算机视觉高级话题(三):产生式模型
  13. 复盘 5 _ 计算机视觉核心技术模块

数据科学家与数据科学团队养成 (25讲)

  1. 127 _ 数据科学家基础能力之概率统计
  2. 128 _ 数据科学家基础能力之机器学习
  3. 129 _ 数据科学家基础能力之系统
  4. 130 _ 数据科学家高阶能力之分析产品
  5. 131 _ 数据科学家高阶能力之评估产品
  6. 132 _ 数据科学家高阶能力之如何系统提升产品性能
  7. 133 _ 职场话题:当数据科学家遇见产品团队
  8. 134 _ 职场话题:数据科学家应聘要具备哪些能力?
  9. 135 _ 职场话题:聊聊数据科学家的职场规划
  10. 136 _ 如何组建一个数据科学团队?
  11. 137 _ 数据科学团队养成:电话面试指南
  12. 138 _ 数据科学团队养成:Onsite面试面面观
  13. 139 _ 成为“香饽饽”的数据科学家,如何衡量他们的工作呢?
  14. 140 _ 人工智能领域知识体系更新周期只有5~6年,数据科学家如何培养?
  15. 141 _ 数据科学家团队组织架构:水平还是垂直,这是个问题
  16. 142 _ 数据科学家必备套路之一:搜索套路
  17. 143 _ 数据科学家必备套路之二:推荐套路
  18. 144 _ 数据科学家必备套路之三:广告套路
  19. 145 _ 如何做好人工智能项目的管理?
  20. 146 _ 数据科学团队必备的工程流程三部曲
  21. 147 _ 数据科学团队怎么选择产品和项目?
  22. 148 _ 曾经辉煌的雅虎研究院
  23. 149 _ 微软研究院:工业界研究机构的楷模
  24. 150 _ 聊一聊谷歌特立独行的混合型研究
  25. 复盘 6 _ 数据科学家与数据科学团队是怎么养成的?

热点话题讨论 (7讲)

  1. 151 _ 精读AlphaGo Zero论文
  2. 152 _ 2017人工智能技术发展盘点
  3. 153 _ 如何快速学习国际顶级学术会议的内容?
  4. 154 _ 在人工智能领域,如何快速找到学习的切入点?
  5. 155 _ 人工智能技术选择,该从哪里获得灵感?
  6. 156 _ 近在咫尺,走进人工智能研究
  7. 内参特刊 _ 和你聊聊每个人都关心的人工智能热点话题

结束语 (1讲)

  1. 结束语 _ 雄关漫道真如铁,而今迈步从头越