AI 文献综述实操:从 100 篇 PDF 到 1 万字综述

ScienceSoft 科研方法评论阅读模式

先说结论,赶时间的看到这里就可以去干活了。

AI 能在文献综述里帮你省掉大约一半的时间,但它省的从来不是“思考”那部分,而是“搬运”那部分⁠——找齐、去重、读摘要、抽字段、列成表、把句子捋顺。

真正值钱的三件事它替不了你:这篇该不该纳入、这些研究之间到底是什么关系、这个领域下一步该往哪走。

所以这篇不讲“AI 一键生成综述”这种话。我给你一条我自己跑得通的完整链路:100 篇 PDF,8 步,落到 1 万字。每一步干什么、用什么工具、prompt 怎么写、在哪一步必须自己上手,全写清楚。

最后一步最重要,也最没人做——引用核查。这一节我会给你一组很难看但必须看的数字。


先划清边界:别让 AI 干它干不了的活

环节 AI 能干到什么程度 你必须接手的部分
找文献 语义检索、查漏、顺藤摸瓜 定检索式、定纳排标准、拍板纳入
读文献 抽字段、填表、答“这篇说了啥” 判断质量、识别方法与样本的硬伤
建结构 给聚类、给提纲候选 决定按什么逻辑分节⁠(这是综述的灵魂)
写正文 起草、改写、过渡句、语言润色 批判性评述、指出矛盾、指出空白
引文献 给候选、给格式 逐条核对存在性与内容⁠(不可外包)

一句话:让 AI 当助理,别当作者。⁠ 综述的价值在于你把 100 篇读成了 1 万个字后面的那个判断,不在于这 1 万个字是谁敲的。


第 1 步:收——先把 100 篇管起来(别急着喂给 AI)

绝大多数人一上来就干错事:把 100 个 PDF 一股脑拖进某个对话框。别这样,先花 30 分钟做库。

用 Zotero 建一个专题库,⁠做三件事:

  1. 去重:⁠导入后 Zotero 的「重复条目」会自动标出,重点检查同一篇的预印本和正式发表版⁠——这俩标题几乎一样但内容可能已经改过。
  2. 重命名:⁠右键附件 → 「从父条目重命名文件」。文件名变成 作者_年份_关键词.pdf,⁠后面所有步骤都不会乱。
  3. 打标签 / 建子文件夹:⁠按你脑子里初步的 3-5 个方向分一下,不用准,后面会重分。

为什么必须先做这一步:⁠后面所有工具都靠文件名和元数据认文档。文件名是 1-s2.0-S123456789.pdf⁠ 这种,AI 抓出来的作者年份就是瞎猜的,你的证据表从第一行开始就是错的。

免费账户自带 300 MB 同步空间,100 篇 PDF 一般情况下够用;不够就把附件存本地或走 WebDAV。


第 2 步:筛——100 篇砍到 40 篇,这一步别偷懒

1 万字装不下 100 篇的细读。综述的密度来自取舍,不是来自堆量。

三条并联的筛法:

① 自己扫一遍标题和摘要(约 50 分钟,别省)⁠ 30 秒一篇,只问两个问题:跟我这次要回答的问题有关吗?它的方法/数据我敢引用吗?分成「必读 / 可能 / 不要」三堆。

② 用语义检索查漏(AI 在这步最值钱)⁠ 你手动检索会漏,AI 也会漏,而且两者漏的不是同一批。

有个 2026 年的受控研究很说明问题:让领域专家和三款 AI 各自为同一个课题建文献清单,结果两边的重合度不到 6%。换句话说,AI 找出来的绝大多数是你没找到的,你找到的绝大多数它也没找到⁠——这不是谁更准的问题,是两组视角互补。

所以正确用法是:拿你的检索式再跑一遍 Consensus 或 Elicit 的语义检索,把新面孔单独列一栏,人工过一遍。它是查漏的,不是替代数据库检索的。

③ 处理“同一工作的多个版本”⁠ 预印本 + 会议版 + 期刊版同时存在时,引期刊版,⁠必要时补一句预印本。三篇都引 = 把一篇算成三篇,这是综述里最常见的灌水式失误。


第 3 步:拆——做一张证据表,而不是一堆摘要

这是整条链路里性价比最高的一步,⁠也是最多人跳过的一步。

跳过的人会得到 100 段“本文提出了一种基于……的方法,实验表明……”的摘要堆。做表的人会得到一张能直接排版成正文的结构。

表头这样设⁠(后面每一步都在用这张表):

编号 作者(年份) 研究问题 方法/模型 数据与样本 核心结论 局限 我用它证明什么

最后一列是灵魂。填不出这一列的文献,说明你其实不需要它,⁠直接从 40 篇里再砍掉。

怎么填:⁠不要一次性丢 40 篇。分批,一次 8-10 篇,用下面这个 prompt(Gemini Notebook / Kimi / ChatGPT 都能跑):

``` 你是文献提取助手。对附件中每一篇论文,输出一行, 严格按下面 8 个字段填写,用 Markdown 表格输出:

编号 | 作者(年份) | 研究问题 | 方法/模型 | 数据与样本 | 核心结论 | 局限 | 可引用的具体发现

硬性要求:

  1. 所有内容必须来自论文正文,不许推测、不许补充背景知识;
  2. "核心结论"必须是论文自己报告的结果,不是你的评价;
  3. "局限"优先抄作者在 Limitations 或 Discussion 里自己写的;
  4. 论文里没写的字段,写"未报告",不许编;
  5. 年份和作者照抄 PDF 首页,不要改写。

如果某篇你没有把握,在最后单独列出来并说明不确定的地方。 ```

第 5 条很关键——允许它说「我不知道」,它就不会硬编。

这一步不要指望一遍到位。表填完,你自己通读一遍,把明显跑偏的格子改掉。这张表将是你后面 1 万字的骨架,值得花两小时。


第 4 步:聚——让 AI 给聚类,但主题由你定

把填好的证据表(只给“研究问题 + 方法 + 核心结论”三列就够)丢给 AI:

``` 下面是一张文献证据表。请做两件事:

  1. 把这些研究聚成 3-5 个主题,给出每个主题的:
  • 主题名(10 字以内)
  • 包含哪些编号
  • 这个主题内部,各研究之间是一致、互补,还是互相矛盾
  1. 指出哪些编号之间的结论存在冲突,具体冲突在哪。

只使用表中提供的信息,不要引入外部知识。 不确定的地方明确说"不确定"。 ```

然后你必须做一件事:把 AI 给的聚类推翻重排。

AI 聚类的默认逻辑是关键词相似度,⁠它倾向于把“用了同一个方法”的放一堆。而一篇好综述的分节逻辑通常是按问题、按争议、按时间线、按层级⁠——这四种都不是关键词逻辑。

常见的四种分法,选一种:

  • 按问题:⁠这个领域被拆成哪几个子问题
  • 按争议:⁠主流观点 vs 反对意见(最容易写出彩)
  • 按时间线:⁠方法演进的三代
  • 按层级:⁠理论 / 方法 / 应用 / 评价

判断标准很简单:⁠如果你的某一节里全是“A 做了…… B 做了…… C 做了……”,那这一节是按作者分的,是罗列;如果每一节都能写出一个主张,⁠那才是对的。


第 5 步:架——先定字数分配,再写提纲

1 万字怎么分,先切好,不然后面一定头重脚轻:

部分 字数 干什么
引言 800-1000 背景、为什么需要这篇综述、你的综述和已有综述有什么不同
方法(可选) 1000-1500 检索式、数据库、纳排标准、篇数。叙述性综述可省,系统综述必写
主体 3-4 节 每节 1500-2000 每节一个主张,节内比较、找矛盾
讨论与展望 1000-1500 领域级的判断,不是各节摘要的复读
结论 400-600 3-5 条可带走的结论

引言里那句“和已有综述有什么不同”,是审稿人第一个看的地方。⁠ 写不出来,说明你这篇的必要性还没想清楚,先回去想,别往下写。


第 6 步:写——一节一节地写,别一次性生成全文

这是最多人翻车的一步。把提纲丢进去说“请写一篇 1 万字的综述”,你会得到一篇非常流畅、非常正确、非常没有信息量⁠的东西:每段都对,读完什么也没记住。

正确做法:每节一次对话,只喂本节要用的那几篇。

``` 你正在帮我写一节综述正文,要求如下:

【本节主题】xxx 【本节主张】xxx(一句话,本节所有内容都要围绕它) 【本节可用的文献】编号 3、7、12、18、22(内容见附件表格对应行) 【目标字数】1500 字左右 【读者】本领域的硕士以上研究者

写作要求:

  1. 开头第一句直接给结论,不要"随着……的发展"式铺垫;
  2. 必须比较文献:哪几项一致、哪几项矛盾,矛盾可能的原因是什么;
  3. 每个论断后面标注引用编号,格式 [编号];
  4. 不要罗列式写作(禁止"A 研究了……B 研究了……"的连续堆砌);
  5. 只用我给的文献,不要引入表中没有的文献;
  6. 没有把握的地方写"【待核】",不要编。

```

三个细节值得照抄:

  • 【本节主张】这一行最重要。给 AI 一句话的主张,它的输出会从“介绍”变成“论证”。
  • 禁止罗列⁠要明说。不说的话,默认输出就是罗列。
  • 标明编号而不是让 AI 自己找。引用由你指定,这一步就把幻觉掐掉了大半。

写完之后,过渡句和语言润色可以放心交给 AI⁠(ChatGPT 免费版的纯文字对话现在不限次,做这个刚好),但评述和判断必须是你自己写的。


第 7 步:查——引用逐条核对,这步没有捷径

现在说那组难看的数字。

第一组,2023 年发表在 Scientific Reports 的审计:⁠研究者把 ChatGPT 生成的 636 条参考文献逐条去比对书目数据库,结果是——GPT-3.5 生成的引用里 55%⁠ 对应的文献根本不存在,GPT-4 是 18%。

这组数字很多人知道。但同一篇论文里的第二个数字几乎没人提:⁠在那些确实存在⁠的引用里,GPT-3.5 有 43%、⁠GPT-4 有 24%⁠ 存在实质性错误——作者错、年份错、期刊错、页码错。

这才是真正的坑:⁠你搜一下标题,文献存在,你以为过了。但它的作者或年份是错的,或者那篇论文根本没说过你这句话。“存在性检查”过了,不代表引用是对的。

第二组,2026 年 4 月的预印本⁠(尚未同行评议,但规模很大):研究者拿 10 个商用模型和深度研究 agent 测了 22 万条引用链接,结果是 3%-13% 属于幻觉、5%-18% 根本打不开。有两个结论特别值得记住:

  • 深度研究(Deep Research)模式幻觉率比普通检索增强的对话更高,⁠因为它生成的引用更多。引用数量不等于可靠性。
  • 给模型一个“能去查链接是否打得开”的工具之后,打不开的引用降到 1% 以下。⁠ 也就是说,这毛病非常好抓——只要真的有人去查。

第三组,2026 年 5 月的预印本:⁠扫描 arXiv、bioRxiv、SSRN、PubMed Central 上 250 万篇论文的 1.11 亿条参考文献,保守估计仅 2025 年一年就有约 14.7 万条不存在的参考文献⁠进入了已发表文献。另外一项测试发现,让模型自己判断自己的引用对不对,平均准确率只有 38%⁠——所以“让 AI 自己检查一遍”基本等于没检查。

那怎么办:三步,10 分钟能查完 40 条

第 1 问:它存在吗?⁠ 把 AI 给的参考文献整批按 DOI 导入 Zotero(或任何文献管理器的“按标识符添加”)。抓得回元数据的先放行,抓不回来的全部标红。这一步能秒掉绝大多数编造条目。

第 2 问:它真的说了这句话吗?⁠ 打开原文,直接看被引的那一段。重点查数字:样本量、准确率、年份。AI 最爱在数字上漂移。

第 3 问:引的是原始出处吗?⁠ 避免“转引的转引”。看到 A 引用了 B 的某个结论,去把 B 找出来引 B,别引 A 里的那句话。

顺手一个建议:⁠从第 3 步开始,所有引用只从你自己的 Zotero 库里取,用插入引文(Ctrl+Alt+A 之类)生成。只要引用是从库里出来的,它就不可能是编的⁠——这是唯一能从根本上消灭幻觉引用的办法,也是前面第 1 步为什么必须先建库。


第 8 步:改——把“罗列”改成“综述”

通读一遍,专门找这三类句子动手:

① “A 认为…… B 认为…… C 认为……”⁠ → 改成判断句:“在 X 问题上,多數研究支持 Y(A;B;C),但在 Z 条件下结论出现分化(D;E)。”

② 只有介绍、没有评价⁠ → 每介绍完一组研究,补一句:方法上有什么共同的局限?样本有没有偏?结论的适用边界在哪?

③ 讨论部分是各节摘要的复读⁠ → 讨论要站在领域层面⁠说话:这个方向为什么卡住了?缺的是什么类型的数据?哪三个问题最值得做?

改完这三类,1 万字里真正属于你的部分才算立住了。


100 篇 PDF 到底喂给谁:工具分工表

额度复核于 2026-10-02。免费档的具体数字相对稳,付费价务必现场核对。

工具 这一步用它干啥 免费档 注意
Zotero 收、去重、重命名、导出、插引用 免费,300 MB 同步 全程的地基,引用只从这里出
Gemini Notebook⁠(原 NotebookLM,2026-07 更名) 分批读 PDF、跨文档问答 100 个笔记本 / 每本 50 个源⁠ / 单源 50 万字或 200 MB 只依据你上传的源回答,⁠做综述最稳的一种;100 篇要拆成 2 个笔记本;用量按算力计,5 小时刷新、另有周上限
Kimi 长文分批读、中文起草 单次最多 50 个文件、⁠单个 ≤100 MB 百万上下文需最高档会员,⁠普通长对话用 K2.6 的 128K 也够
ChatGPT 改写、过渡句、润色 免费版纯文字对话不限次(2026-08 起) 文件上传、图片、语音仍各自限额度,⁠别以为无限了就狂传 PDF;默认模型 GPT-5.6 Luna
DeepSeek 批量结构化输出(走 API 最省钱) 按 token 计费 旧模型名 deepseek-chat⁠ / deepseek-reasoner⁠ 已于 2026-07-24 下线,别再用旧名调
Consensus 语义检索查漏、看证据倾向 10 条 Pro 消息 / 月 + 3 次 Deep Review / 月 Pro $12/月(年付 $144)、Deep $45/月(年付 $540);学生教师凭校园邮箱可打折
SciSpace 证据表提取、PDF 划选解释 Basic 约 100 credits / 月 Deep Review 只在 Advanced 档,⁠免费档没有;别被宣传页误导
Elicit 结构化提取、系统综述筛选 Basic:搜索不限次 + 2 份自动报告 / 月 + 2 列提取 系统综述工作流(可筛 5000 篇)在 Pro 及以上;价格分学术 / 工业两套,⁠看官网

给不想花钱的人一条最短路径:⁠Zotero + Gemini Notebook(拆 2 个笔记本)+ Kimi,三步下来覆盖到第 6 步,一分钱不用花。Consensus 和 SciSpace 的免费档用在第 2 步查漏,也够。


最后两件必做的事

一、用 AI 了,就得写出来

这一块这两年变了,而且很多人还不知道。

ICMJE《推荐规范》2025 年 1 月版的口径:⁠AI(大语言模型、聊天机器人、图像生成工具)不能列为作者,⁠因为它无法对内容的准确性、完整性和原创性负责;用了就必须在 cover letter 和稿件里说明⁠——写在致谢或方法部分都行。

如果你做的是系统综述,⁠还有一份专门针对这件事的新清单:PRISMA-trAIce,⁠2025 年 12 月 10 日发表在 JMIR AI⁠(Holst 等,doi:10.2196/80247)。它是 PRISMA 2020 的扩展,覆盖标题、摘要、引言、方法、结果、讨论全结构(方法部分就占了 10 条),要求你写清楚:用了哪个工具什么版本、用在哪一步、输入是什么、prompt 是什么、人是怎么复核的、AI 的表现怎么评估的,⁠连 PRISMA 流程图都要把 AI 筛掉的和人筛掉的分开计数。

注意它的身份:⁠作者自己明确说这是一份提案⁠(living guideline),正在征求社区共识,还不是正式背书的强制规范。同类的还有 Cochrane、Campbell、JBI 等机构参与的 RAISE 指南⁠(2024 年首稿,2025 年 6 月更新到 v2)。

实操建议很简单:先用不用它,都把这几项留个记录⁠——工具名+版本、用在哪几步、prompt 存档、人工复核了多少条。真被问起来,你能拿出来就行。

二、投稿前再过一遍目标刊的 AI policy

各刊差异极大:有的允许 AI 润色语言但禁止生成正文和图;有的要求在方法里写明;有的直接全禁。投稿前把目标刊的 AI policy 页面读一遍,⁠比什么都保险。


收个尾

整条链路再压缩一遍:

  1. 收:⁠Zotero 建库、去重、重命名
  2. 筛:⁠自己扫一遍 + AI 查漏,100 → 40
  3. 拆:⁠8-10 篇一批,填证据表,砍掉填不出“用它证明什么”的
  4. 聚:⁠AI 给聚类,你按问题/争议/时间线/层级重排
  5. 架:⁠先切字数,再写提纲,先想清楚“和已有综述有什么不同”
  6. 写:⁠一节一对话,只喂本节文献,指定引用编号
  7. 查:⁠三步核查,引用只从自己的库里出
  8. 改:⁠把罗列改成评述,讨论站到领域层面

AI 让你更快,但不会让你更懂。⁠ 综述里真正值钱的那一两句判断,还是得你自己读出来。

weinxin
我的微信公众号
分享科研软件、科研方法,为你的科研助力。
ScienceSoft
  • 本文由 发表于 7 10 月, 2026 22:23:10
  • 转载请务必保留本文链接:https://www.sciencesoft.cn/ai-%e6%96%87%e7%8c%ae%e7%bb%bc%e8%bf%b0%e5%ae%9e%e6%93%8d%ef%bc%9a%e4%bb%8e-100-%e7%af%87-pdf-%e5%88%b0-1-%e4%b8%87%e5%ad%97%e7%bb%bc%e8%bf%b0/
评论  0  访客  0
匿名

发表评论

匿名网友 填写信息

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen:

确定