← COMP5511 全部讲次
T01 · 第 1 周

T01 Tutorial 1:论文怎么找、怎么读、怎么从别人的缺口里长出自己的题

这节课不讲知识点讲方法,兑现场景是期末 project——当 checklist 用,选题时回来照着走一遍。

一句话版

这节 tutorial 不讲 AI 知识点,讲的是找论文、读论文、从读到的东西里长出研究问题的一套方法,兑现场景是期末 project 而不是笔试。

题目地图

三十六页,四段结构是一条流水线而不是四个并列话题:前三段都是输入侧,最后一段是输出侧,真正难的也是最后一段。

段落回答的问题直接产出
p.4–12How to find a paper论文在哪儿,什么样的值得读一份可靠的检索路径
p.13–21Paper structure八个部分各自装什么自己写报告时的章节模板
p.22–28How to read a paper拿到一篇怎么读每篇四行的论文笔记
p.29–35How to do research读完怎么长出自己的问题project 的选题

p.35 是真作业不是演示:四个方向(对话系统 / 图神经网络 / 推荐系统 / AI for Science)选一个,查清年份和会议出处,挑一篇近期顶会的,读出它的 background 和 problem。这道题把四段串成了完整链路,下面的完整例题就走它。

概念卡

1. 等级与引用量(Venue Ranking)

人话定义:引用量、发表场所是筛选线索,不是能否引用的硬门槛;要核对方法、证据与评审状态。

例子:课件 p.11 那张表里,顶会和期刊标 Good,预印本和 workshop 标 ?。这个问号表示需要进一步核查,不能据此断言 workshop 都没有同行评审。三个榜单口径也不同——Google top publications 按 h5-index 排,看的是影响力;CORE 是专家评级 A*/A/B/C;CCF 目录分 A/B/C 类,在中文语境里最通用。

常见误解

拿引用数当质量证明 → 预印本的引用可以很高,但预印本身份本身不证明经过评审;可能另有正式发表版本。写 project 时优先引顶会近三年的论文,比引十年前的综述更能体现跟得上进展(p.8、p.11)。

2. Introduction 的五模块(Introduction Structure)

人话定义:引言不是背景铺垫,是一条从「领域在做什么」推到「所以我们做了什么」的逻辑链,共五个模块。

例子:这条链是——Background(领域现状)→ What is broken / missing(缺什么)→ Goals(本文目标)→ Methods(怎么做到)→ Contributions(贡献)。第二环是全篇最值钱的一句话:作者已经替你把这个领域的缺口写成了一句话。读十篇论文的 Introduction 抄下十句「缺什么」,选题范围就出来了,这比读十篇 Method 划算得多(p.16)。

常见误解

把 Related work 当成可跳过的凑字数章节 → 它是论文之间的路由表。找到一篇对味的,它的 related work 就是这个方向的入门书单,比自己关键词乱搜准得多;其中「和本文的关系」那一块通常就写着本文自称的创新点(p.17)。

3. 四遍读法(Multiple Passes)

人话定义:读论文不是从第一页读到最后一页,是分多趟,每趟只解决一个问题。

例子:第 1 遍读标题、摘要、图,回答「这篇跟我有关吗」,无关就此打住;第 2 遍读引言、结论、图,其余略读,到这一步已经能写出文献综述里的那一句;第 3 遍通读并跳过数学,弄清方法怎么做;第 4 遍全文细读,跳过看不懂的部分,只有要复现或要在它基础上改进才需要走到这里。大部分论文读到第 3 遍就够了(p.23–28)。

常见误解

把逐字读当成认真 → 论文的价值分布极不均匀,大多数论文对你只值五分钟。前两遍就是筛子,作用是把时间省给真正重要的那几篇。逐字读的人最后读得最少,因为耐心在第一篇上就耗光了(p.23)。

4. Research gap 与 limitations(Research Question)

人话定义:研究问题不是凭空想出来的,是从别人明说的缺口和局限里捡出来的。

例子:找题两步从宽到窄——第一步读近期综述,在里面找 future research directions,一篇好综述抵五十篇论文,先建地图;第二步读相关子领域的近期顶会论文,找 research gaps,因为综述通常滞后一到两年,最新的缺口只在原始论文里。这两个短语就是要在 PDF 里检索的关键词(p.31–32)。

常见误解

以为好题目等于没人做过的题 → 完全没人碰的方向往往是因为做不了或没价值。常规打开方式是在现有解法的 limitations 上前进一步。另一处是顺序反了:先学了个新模型再找地方套,写出来的东西没人关心,正确顺序永远是先有问题再有方法(p.30、p.33)。

逐题拆解

第一段:三个来源按阶段用,三个工具按问题分(p.5–12)。来源按阶段排:最早期用在线社区探路(预印本讨论比正式发表早几个月到一年,社区讨论可提供线索,但论文的 limitations 与原始实验同样要读),中间用搜索引擎按关键词定位,定了方向之后到顶会顶刊取经过评审的可靠结论。会议按四类记比背十二个名字有用:机器学习三大(NeurIPS / ICML / ICLR)、视觉三大(ICCV / CVPR / ECCV)、自然语言(ACL / EMNLP / NAACL / COLING)、综合 AI(AAAI / IJCAI)。标准动作是 Scholar 找到 → DBLP 核出处并导 BibTeX → 学校图书馆下全文,校外访问先把代理配好。

第二段:八个部分按信息密度排,不按阅读顺序排(p.14–21)。Abstract 是五要素压缩包(背景、问题、方法、结果、结论),每个要素一两句——这个槽位表可以直接拿来写自己报告的摘要。Method 那节课件把 “Reason of this design” 单列出来是有意的:只看懂模型结构不算读懂,要看懂每个设计选择在解决什么问题。Experiment 盯两处警报:baseline 选得太弱太旧(跟三年前的方法比赢了不算赢),以及只报总分不做消融。Conclusion 要和 Introduction 首尾闭环,自己写报告时把这两节抽出来连着读,对不上就说明中间跑题了。

第三段:读的时候脑子里挂着四个问题(p.28)。原文列的顺序是「作者想达成什么 / 方法的关键要素 / 你自己能用什么 / 还想追哪些参考文献」,但按重要性重排是第三问排第一——它是唯一直接产出的问题。建议建一个论文笔记文件,每读一篇填这四行;四行比读书笔记短得多,一个学期攒下来就是 project 的文献基础。

第四段:课件推荐两种入门路径(p.34)。跨领域移植(把别的领域成熟的解法搬过来,新颖性高,但要论证为什么能搬)和改进现有方法(在本领域现有模型上改,稳,但提升幅度要够),这不是对全部研究方式的穷举。最后那句 Imitate top-tier conference papers 是写作建议:挑两三篇方向内的顶会论文,照着它的章节安排和论证节奏写报告。

课件里的坑

  • [课件有误] p.33 和 p.35 右下角的页码都印着 28,是模板没改干净,不影响内容,但按页码索引会找错地方(p.33、p.35)。
  • [课件留白] p.33 那个范例里的 KDD 和 WWW 不在 p.7 的会议清单上。原因是每个子领域有自己的顶会,p.7 那张表只覆盖通用 AI 和几个大方向;做推荐系统或数据挖掘就投 KDD / WWW。照着 p.7 找推荐系统的论文会找得很别扭(p.7、p.33)。
  • [课件留白] p.33 点到了 cold-start 和 hallucination 两个词但没解释。冷启动是新用户或新物品没有历史行为数据、推荐系统无从下手;幻觉是大模型一本正经地生成不存在的内容,在推荐场景里就是推了不存在的商品(p.33)。
  • [补充] p.10 那两个中文社区是给起步阶段用的:先用中文把概念搞懂再回去啃原文,比硬读快得多。但别停在二手解读上,写 project 时引用必须回到英文原文(p.10)。
  • [补充] p.21 说致谢一般跳过,但经费来源偶尔有信息量——大公司资助的论文,结论正好对该公司产品有利时,读实验部分要多一分警惕(p.21)。

课后 10 分钟:考点复习

这 10 分钟怎么用:合上页面,先默写三条——四遍读法每遍读什么、哪一遍允许跳过数学、找题两步分别检索哪个关键词;再把下面的「变式题」做一遍;最后回查两处最容易错的地方——拿引用量当质量证明、以为好题目是没人做过的题。三步做完再往下看答案。

必背

  1. 引用先看相关性与证据质量,再核发表和评审状态;预印本未必评审,workshop 是否评审要查具体征稿规则,排名和引用量都不是质量保证。
  2. 三个检索工具分工不同:Scholar 搜得广并能顺着 Cited by 往后追,DBLP 出处最准且直接给 BibTeX,学校图书馆负责下到正版全文。
  3. 论文八个部分里 Introduction 信息密度最高,其中「现在还缺什么」那一句直接就是选题线索。
  4. 读 Method 要读 why 不只读 what:每个设计选择在解决什么问题,比模型有几层更值得写进笔记。
  5. 看实验盯两处:baseline 是不是选得太弱太旧,以及有没有做消融实验说明提升来自哪个部件。
  6. 四遍读法的本质是给放弃留出口:第一遍只读标题摘要图,用来判断要不要继续;第三、四遍明确允许跳过数学和看不懂的部分。
  7. 读完记录「这个我自己能用在哪」或「为什么不适用」;排除不合适的方法同样是有效收获。
  8. 找题两步从宽到窄:先读近期综述拿 future directions,再读子领域顶会论文找 research gaps;目标是在别人的 limitations 上前进一步,不是找无人区。

完整例题

把 p.35 那道作业演示读法,但不替代作业要求的近期论文。选「对话系统」方向,一路走到填完 p.28 的四个问题,用一篇经典论文当历史样本:Vaswani 等人的 Attention Is All You Need,2017 年发表在 NeurIPS(当时叫 NIPS)。

步骤动作这一步的产出
1Scholar 按关键词搜到候选一串标题,质量未判
2DBLP 核年份与出处确认是 NeurIPS 2017 正会论文,等级够
3四遍法第 1 遍:标题、摘要、图判断相关,继续
4四遍法第 2 遍:引言、结论、图读出 background 与 problem
5填 p.28 的四个问题四行笔记,可直接进 project

逐步说明:

  1. 第 2 步不能省。搜索引擎会把预印本和正会论文混排,这篇同时存在 arXiv 版本和 NeurIPS 版本,引用时要引后者。DBLP 的价值就在这里:它给的元数据是会议正式收录的那一版,还能直接导出 BibTeX。
  2. 第 3 步花不到五分钟。标题里的 attention 和摘要里的「不用循环也不用卷积」已经足够判断相关性,这一遍的作用只有决定要不要继续。
  3. 第 4 步读出的 background 和 problem:序列模型此前依赖循环结构逐个时间步计算,导致训练无法在序列长度方向并行、长距离依赖也难以建立。这就是引言里那句「现在还缺什么」,作业要的就是它。
  4. 第 5 步的四行笔记:作者想达成什么——去掉循环和卷积,只用注意力做序列转换;方法的关键要素——自注意力、多头、位置编码、编码器解码器堆叠;我自己能用什么——若 project 做对话系统,这是几乎所有后续模型的共同底座,方法章节绕不开它;还想追哪些文献——顺着 Scholar 的 Cited by 找近三年引用它的对话系统论文,那里才有当下的 research gap。

这道题不写实验数字:作业要的是 background 和 problem,实验数字属于第 4 遍的范围,这一轮用不上。

变式题(先自己做)

搜「推荐系统的冷启动」,检索结果里有四条候选:

  • A:2022 年 arXiv 预印本,被引 480 次,从未正式发表
  • B:2024 年 AAAI 正会论文,被引 26 次
  • C:2023 年某顶会 workshop 的短文,被引 11 次
  • D:2014 年某期刊综述,被引 2100 次

(1) 写 project 时引用优先级怎么排,理由是什么?(2) 这四条各自该用哪个工具核实出处?(3) 按四遍读法,D 应该读到第几遍,为什么?(4) 如果目标是找出一个能做的 research question,读完这四条之后下一步该去找什么?

提示

第 (1) 问先把「有没有经过同行评议」和「新不新」两把尺子分开用,再合起来排。第 (3) 问回想综述在找题两步里的位置——它给的是地图不是细节。第 (4) 问注意课件那句「不是找无人区」。

参考答案与自检(非官方评分标准)

自检要点:① 区分相关性、评审状态、时效性和证据质量,不靠引用数硬排;② 说明 D 的年代局限,但不把旧等同于错;③ 阅读深度按任务决定;④ 从近期研究的局限中形成可验证的问题。

(1) 仅凭四条元数据,不能排出可靠的总顺序。找近期方法可先读 B;梳理历史可用 D;A、C 也可能高度相关。核实 C 的实际评审流程、A 的版本状态,再比较方法与实验;引用预印本时如实标注。

(2) B 和 C 用 DBLP 核会议名、年份和正式页码,顺手导 BibTeX;D 是期刊论文,DBLP 同样能核,拿不到全文就走学校图书馆的机构订阅;A 只有 arXiv 版本,DBLP 收录的也只是预印本条目,要另外确认它后来有没有以别的标题正式发表过——Scholar 的版本聚合能看出这一点。

(3) 为先建立领域地图,可先读到第 2 遍,查看引言、结论和图。若要引用其具体论断、比较方法或评价综述质量,就继续精读并回查原始论文;“两遍就够”不是通用规则。

(4) 下一步是读检索时点附近、专门研究冷启动的论文,在它们的 limitations 和 future work 里找 gap。因为 D 给的方向已经滞后,而 B 这类最新论文会明说自己还没解决什么。目标不是找一个没人碰过的题——没人碰往往是因为做不了或没价值——而是在现有解法的局限上前进一步。

闪卡自测

1. 一篇预印本被引 500 次,一篇正会论文被引 30 次,写 project 先引哪篇?

不能仅凭引用数或发表身份决定。相关性相近时可先读正会版本,但仍须核实方法与证据;关键预印本可以引用并标明状态(p.8、p.11)。

2. 想看某位学者这三年发表了什么用哪个工具?想找引用了这篇的后续工作呢?

前者用 DBLP,它按作者完整列出发表记录且元数据准确;后者用 Scholar 的 Cited by 反向追踪(p.12)。

3. 四遍读法里哪一遍的作用是筛掉论文?第 3 遍允许跳过什么?

第 1 遍——只读标题、摘要、图,判断相关性,无关就此打住。第 3 遍明确允许跳过数学(p.23–28)。

4. 找 research question 的两步,各自要在文里检索哪个关键词?

第一步在近期综述里找 future research directions,第二步在子领域顶会论文里找 research gaps(p.31–32)。

5. 为什么目标是找现有方法的 limitations,而不是找没人做过的题?

完全没人碰的方向往往是因为做不了或没价值。在别人的局限上前进一步才是研究的常规打开方式(p.33)。

6. Introduction 的五个模块里哪一句最直接指向选题?

「What is broken / missing」那一句——作者已经把这个领域的缺口写成了一句话(p.16)。

7. 读 Experiment 时该盯哪两处警报?

baseline 是不是太弱太旧,以及有没有做消融实验。前者让赢来得可疑,后者让提升说不清来自哪个部件,两处都在 Discussion 里查(p.19)。

8. 读完一篇论文,最该能回答的是哪个问题?

「这个我自己能用在哪」。它有助于连接 project;记录不适用原因或弄清背景也有价值(p.28)。

下一步

先把 p.35 那道作业真做一遍,四个方向别随便挑,挑你可能拿来做 project 的那个——这一遍的产出可以直接变成 project 的第一篇文献,整套流程走下来大约一小时。同时把学校图书馆的校外访问配好,否则第一次下全文就会卡在付费墙上。然后建一个论文笔记文件,每读一篇填四行。数学跟不上时不必硬啃推导,四遍读法第 3 遍本来就允许跳过;先把概率和线性代数的底子补上,再回来读那些公式会顺得多。

下一讲 →
L02 L02 Search Techniques:在陌生大楼里找出口,从瞎推门到看着指南针走

个人整理的学习笔记,不是官方材料;数字与结论以课件和讲师为准。