先说结论,赶时间的看到这里就可以去干活了。
AI 能在文献综述里帮你省掉大约一半的时间,但它省的从来不是“思考”那部分,而是“搬运”那部分——找齐、去重、读摘要、抽字段、列成表、把句子捋顺。
真正值钱的三件事它替不了你:这篇该不该纳入、这些研究之间到底是什么关系、这个领域下一步该往哪走。
所以这篇不讲“AI 一键生成综述”这种话。我给你一条我自己跑得通的完整链路:100 篇 PDF,8 步,落到 1 万字。每一步干什么、用什么工具、prompt 怎么写、在哪一步必须自己上手,全写清楚。
最后一步最重要,也最没人做——引用核查。这一节我会给你一组很难看但必须看的数字。
先划清边界:别让 AI 干它干不了的活
| 环节 | AI 能干到什么程度 | 你必须接手的部分 |
|---|---|---|
| 找文献 | 语义检索、查漏、顺藤摸瓜 | 定检索式、定纳排标准、拍板纳入 |
| 读文献 | 抽字段、填表、答“这篇说了啥” | 判断质量、识别方法与样本的硬伤 |
| 建结构 | 给聚类、给提纲候选 | 决定按什么逻辑分节(这是综述的灵魂) |
| 写正文 | 起草、改写、过渡句、语言润色 | 批判性评述、指出矛盾、指出空白 |
| 引文献 | 给候选、给格式 | 逐条核对存在性与内容(不可外包) |
一句话:让 AI 当助理,别当作者。 综述的价值在于你把 100 篇读成了 1 万个字后面的那个判断,不在于这 1 万个字是谁敲的。
第 1 步:收——先把 100 篇管起来(别急着喂给 AI)
绝大多数人一上来就干错事:把 100 个 PDF 一股脑拖进某个对话框。别这样,先花 30 分钟做库。
用 Zotero 建一个专题库,做三件事:
- 去重:导入后 Zotero 的「重复条目」会自动标出,重点检查同一篇的预印本和正式发表版——这俩标题几乎一样但内容可能已经改过。
- 重命名:右键附件 → 「从父条目重命名文件」。文件名变成
作者_年份_关键词.pdf,后面所有步骤都不会乱。 - 打标签 / 建子文件夹:按你脑子里初步的 3-5 个方向分一下,不用准,后面会重分。
为什么必须先做这一步:后面所有工具都靠文件名和元数据认文档。文件名是 1-s2.0-S123456789.pdf 这种,AI 抓出来的作者年份就是瞎猜的,你的证据表从第一行开始就是错的。
免费账户自带 300 MB 同步空间,100 篇 PDF 一般情况下够用;不够就把附件存本地或走 WebDAV。
第 2 步:筛——100 篇砍到 40 篇,这一步别偷懒
1 万字装不下 100 篇的细读。综述的密度来自取舍,不是来自堆量。
三条并联的筛法:
① 自己扫一遍标题和摘要(约 50 分钟,别省) 30 秒一篇,只问两个问题:跟我这次要回答的问题有关吗?它的方法/数据我敢引用吗?分成「必读 / 可能 / 不要」三堆。
② 用语义检索查漏(AI 在这步最值钱) 你手动检索会漏,AI 也会漏,而且两者漏的不是同一批。
有个 2026 年的受控研究很说明问题:让领域专家和三款 AI 各自为同一个课题建文献清单,结果两边的重合度不到 6%。换句话说,AI 找出来的绝大多数是你没找到的,你找到的绝大多数它也没找到——这不是谁更准的问题,是两组视角互补。
所以正确用法是:拿你的检索式再跑一遍 Consensus 或 Elicit 的语义检索,把新面孔单独列一栏,人工过一遍。它是查漏的,不是替代数据库检索的。
③ 处理“同一工作的多个版本” 预印本 + 会议版 + 期刊版同时存在时,引期刊版,必要时补一句预印本。三篇都引 = 把一篇算成三篇,这是综述里最常见的灌水式失误。
第 3 步:拆——做一张证据表,而不是一堆摘要
这是整条链路里性价比最高的一步,也是最多人跳过的一步。
跳过的人会得到 100 段“本文提出了一种基于……的方法,实验表明……”的摘要堆。做表的人会得到一张能直接排版成正文的结构。
表头这样设(后面每一步都在用这张表):
| 编号 | 作者(年份) | 研究问题 | 方法/模型 | 数据与样本 | 核心结论 | 局限 | 我用它证明什么 |
|---|
最后一列是灵魂。填不出这一列的文献,说明你其实不需要它,直接从 40 篇里再砍掉。
怎么填:不要一次性丢 40 篇。分批,一次 8-10 篇,用下面这个 prompt(Gemini Notebook / Kimi / ChatGPT 都能跑):
``` 你是文献提取助手。对附件中每一篇论文,输出一行, 严格按下面 8 个字段填写,用 Markdown 表格输出:
编号 | 作者(年份) | 研究问题 | 方法/模型 | 数据与样本 | 核心结论 | 局限 | 可引用的具体发现
硬性要求:
- 所有内容必须来自论文正文,不许推测、不许补充背景知识;
- "核心结论"必须是论文自己报告的结果,不是你的评价;
- "局限"优先抄作者在 Limitations 或 Discussion 里自己写的;
- 论文里没写的字段,写"未报告",不许编;
- 年份和作者照抄 PDF 首页,不要改写。
如果某篇你没有把握,在最后单独列出来并说明不确定的地方。 ```
第 5 条很关键——允许它说「我不知道」,它就不会硬编。
这一步不要指望一遍到位。表填完,你自己通读一遍,把明显跑偏的格子改掉。这张表将是你后面 1 万字的骨架,值得花两小时。
第 4 步:聚——让 AI 给聚类,但主题由你定
把填好的证据表(只给“研究问题 + 方法 + 核心结论”三列就够)丢给 AI:
``` 下面是一张文献证据表。请做两件事:
- 把这些研究聚成 3-5 个主题,给出每个主题的:
- 主题名(10 字以内)
- 包含哪些编号
- 这个主题内部,各研究之间是一致、互补,还是互相矛盾
- 指出哪些编号之间的结论存在冲突,具体冲突在哪。
只使用表中提供的信息,不要引入外部知识。 不确定的地方明确说"不确定"。 ```
然后你必须做一件事:把 AI 给的聚类推翻重排。
AI 聚类的默认逻辑是关键词相似度,它倾向于把“用了同一个方法”的放一堆。而一篇好综述的分节逻辑通常是按问题、按争议、按时间线、按层级——这四种都不是关键词逻辑。
常见的四种分法,选一种:
- 按问题:这个领域被拆成哪几个子问题
- 按争议:主流观点 vs 反对意见(最容易写出彩)
- 按时间线:方法演进的三代
- 按层级:理论 / 方法 / 应用 / 评价
判断标准很简单:如果你的某一节里全是“A 做了…… B 做了…… C 做了……”,那这一节是按作者分的,是罗列;如果每一节都能写出一个主张,那才是对的。
第 5 步:架——先定字数分配,再写提纲
1 万字怎么分,先切好,不然后面一定头重脚轻:
| 部分 | 字数 | 干什么 |
|---|---|---|
| 引言 | 800-1000 | 背景、为什么需要这篇综述、你的综述和已有综述有什么不同 |
| 方法(可选) | 1000-1500 | 检索式、数据库、纳排标准、篇数。叙述性综述可省,系统综述必写 |
| 主体 3-4 节 | 每节 1500-2000 | 每节一个主张,节内比较、找矛盾 |
| 讨论与展望 | 1000-1500 | 领域级的判断,不是各节摘要的复读 |
| 结论 | 400-600 | 3-5 条可带走的结论 |
引言里那句“和已有综述有什么不同”,是审稿人第一个看的地方。 写不出来,说明你这篇的必要性还没想清楚,先回去想,别往下写。
第 6 步:写——一节一节地写,别一次性生成全文
这是最多人翻车的一步。把提纲丢进去说“请写一篇 1 万字的综述”,你会得到一篇非常流畅、非常正确、非常没有信息量的东西:每段都对,读完什么也没记住。
正确做法:每节一次对话,只喂本节要用的那几篇。
``` 你正在帮我写一节综述正文,要求如下:
【本节主题】xxx 【本节主张】xxx(一句话,本节所有内容都要围绕它) 【本节可用的文献】编号 3、7、12、18、22(内容见附件表格对应行) 【目标字数】1500 字左右 【读者】本领域的硕士以上研究者
写作要求:
- 开头第一句直接给结论,不要"随着……的发展"式铺垫;
- 必须比较文献:哪几项一致、哪几项矛盾,矛盾可能的原因是什么;
- 每个论断后面标注引用编号,格式 [编号];
- 不要罗列式写作(禁止"A 研究了……B 研究了……"的连续堆砌);
- 只用我给的文献,不要引入表中没有的文献;
- 没有把握的地方写"【待核】",不要编。
```
三个细节值得照抄:
- 【本节主张】这一行最重要。给 AI 一句话的主张,它的输出会从“介绍”变成“论证”。
- 禁止罗列要明说。不说的话,默认输出就是罗列。
- 标明编号而不是让 AI 自己找。引用由你指定,这一步就把幻觉掐掉了大半。
写完之后,过渡句和语言润色可以放心交给 AI(ChatGPT 免费版的纯文字对话现在不限次,做这个刚好),但评述和判断必须是你自己写的。
第 7 步:查——引用逐条核对,这步没有捷径
现在说那组难看的数字。
第一组,2023 年发表在 Scientific Reports 的审计:研究者把 ChatGPT 生成的 636 条参考文献逐条去比对书目数据库,结果是——GPT-3.5 生成的引用里 55% 对应的文献根本不存在,GPT-4 是 18%。
这组数字很多人知道。但同一篇论文里的第二个数字几乎没人提:在那些确实存在的引用里,GPT-3.5 有 43%、GPT-4 有 24% 存在实质性错误——作者错、年份错、期刊错、页码错。
这才是真正的坑:你搜一下标题,文献存在,你以为过了。但它的作者或年份是错的,或者那篇论文根本没说过你这句话。“存在性检查”过了,不代表引用是对的。
第二组,2026 年 4 月的预印本(尚未同行评议,但规模很大):研究者拿 10 个商用模型和深度研究 agent 测了 22 万条引用链接,结果是 3%-13% 属于幻觉、5%-18% 根本打不开。有两个结论特别值得记住:
- 深度研究(Deep Research)模式幻觉率比普通检索增强的对话更高,因为它生成的引用更多。引用数量不等于可靠性。
- 给模型一个“能去查链接是否打得开”的工具之后,打不开的引用降到 1% 以下。 也就是说,这毛病非常好抓——只要真的有人去查。
第三组,2026 年 5 月的预印本:扫描 arXiv、bioRxiv、SSRN、PubMed Central 上 250 万篇论文的 1.11 亿条参考文献,保守估计仅 2025 年一年就有约 14.7 万条不存在的参考文献进入了已发表文献。另外一项测试发现,让模型自己判断自己的引用对不对,平均准确率只有 38%——所以“让 AI 自己检查一遍”基本等于没检查。
那怎么办:三步,10 分钟能查完 40 条
第 1 问:它存在吗? 把 AI 给的参考文献整批按 DOI 导入 Zotero(或任何文献管理器的“按标识符添加”)。抓得回元数据的先放行,抓不回来的全部标红。这一步能秒掉绝大多数编造条目。
第 2 问:它真的说了这句话吗? 打开原文,直接看被引的那一段。重点查数字:样本量、准确率、年份。AI 最爱在数字上漂移。
第 3 问:引的是原始出处吗? 避免“转引的转引”。看到 A 引用了 B 的某个结论,去把 B 找出来引 B,别引 A 里的那句话。
顺手一个建议:从第 3 步开始,所有引用只从你自己的 Zotero 库里取,用插入引文(Ctrl+Alt+A 之类)生成。只要引用是从库里出来的,它就不可能是编的——这是唯一能从根本上消灭幻觉引用的办法,也是前面第 1 步为什么必须先建库。
第 8 步:改——把“罗列”改成“综述”
通读一遍,专门找这三类句子动手:
① “A 认为…… B 认为…… C 认为……” → 改成判断句:“在 X 问题上,多數研究支持 Y(A;B;C),但在 Z 条件下结论出现分化(D;E)。”
② 只有介绍、没有评价 → 每介绍完一组研究,补一句:方法上有什么共同的局限?样本有没有偏?结论的适用边界在哪?
③ 讨论部分是各节摘要的复读 → 讨论要站在领域层面说话:这个方向为什么卡住了?缺的是什么类型的数据?哪三个问题最值得做?
改完这三类,1 万字里真正属于你的部分才算立住了。
100 篇 PDF 到底喂给谁:工具分工表
额度复核于 2026-10-02。免费档的具体数字相对稳,付费价务必现场核对。
| 工具 | 这一步用它干啥 | 免费档 | 注意 |
|---|---|---|---|
| Zotero | 收、去重、重命名、导出、插引用 | 免费,300 MB 同步 | 全程的地基,引用只从这里出 |
| Gemini Notebook(原 NotebookLM,2026-07 更名) | 分批读 PDF、跨文档问答 | 100 个笔记本 / 每本 50 个源 / 单源 50 万字或 200 MB | 只依据你上传的源回答,做综述最稳的一种;100 篇要拆成 2 个笔记本;用量按算力计,5 小时刷新、另有周上限 |
| Kimi | 长文分批读、中文起草 | 单次最多 50 个文件、单个 ≤100 MB | 百万上下文需最高档会员,普通长对话用 K2.6 的 128K 也够 |
| ChatGPT | 改写、过渡句、润色 | 免费版纯文字对话不限次(2026-08 起) | 文件上传、图片、语音仍各自限额度,别以为无限了就狂传 PDF;默认模型 GPT-5.6 Luna |
| DeepSeek | 批量结构化输出(走 API 最省钱) | 按 token 计费 | 旧模型名 deepseek-chat / deepseek-reasoner 已于 2026-07-24 下线,别再用旧名调 |
| Consensus | 语义检索查漏、看证据倾向 | 10 条 Pro 消息 / 月 + 3 次 Deep Review / 月 | Pro $12/月(年付 $144)、Deep $45/月(年付 $540);学生教师凭校园邮箱可打折 |
| SciSpace | 证据表提取、PDF 划选解释 | Basic 约 100 credits / 月 | Deep Review 只在 Advanced 档,免费档没有;别被宣传页误导 |
| Elicit | 结构化提取、系统综述筛选 | Basic:搜索不限次 + 2 份自动报告 / 月 + 2 列提取 | 系统综述工作流(可筛 5000 篇)在 Pro 及以上;价格分学术 / 工业两套,看官网 |
给不想花钱的人一条最短路径:Zotero + Gemini Notebook(拆 2 个笔记本)+ Kimi,三步下来覆盖到第 6 步,一分钱不用花。Consensus 和 SciSpace 的免费档用在第 2 步查漏,也够。
最后两件必做的事
一、用 AI 了,就得写出来
这一块这两年变了,而且很多人还不知道。
ICMJE《推荐规范》2025 年 1 月版的口径:AI(大语言模型、聊天机器人、图像生成工具)不能列为作者,因为它无法对内容的准确性、完整性和原创性负责;用了就必须在 cover letter 和稿件里说明——写在致谢或方法部分都行。
如果你做的是系统综述,还有一份专门针对这件事的新清单:PRISMA-trAIce,2025 年 12 月 10 日发表在 JMIR AI(Holst 等,doi:10.2196/80247)。它是 PRISMA 2020 的扩展,覆盖标题、摘要、引言、方法、结果、讨论全结构(方法部分就占了 10 条),要求你写清楚:用了哪个工具什么版本、用在哪一步、输入是什么、prompt 是什么、人是怎么复核的、AI 的表现怎么评估的,连 PRISMA 流程图都要把 AI 筛掉的和人筛掉的分开计数。
注意它的身份:作者自己明确说这是一份提案(living guideline),正在征求社区共识,还不是正式背书的强制规范。同类的还有 Cochrane、Campbell、JBI 等机构参与的 RAISE 指南(2024 年首稿,2025 年 6 月更新到 v2)。
实操建议很简单:先用不用它,都把这几项留个记录——工具名+版本、用在哪几步、prompt 存档、人工复核了多少条。真被问起来,你能拿出来就行。
二、投稿前再过一遍目标刊的 AI policy
各刊差异极大:有的允许 AI 润色语言但禁止生成正文和图;有的要求在方法里写明;有的直接全禁。投稿前把目标刊的 AI policy 页面读一遍,比什么都保险。
收个尾
整条链路再压缩一遍:
- 收:Zotero 建库、去重、重命名
- 筛:自己扫一遍 + AI 查漏,100 → 40
- 拆:8-10 篇一批,填证据表,砍掉填不出“用它证明什么”的
- 聚:AI 给聚类,你按问题/争议/时间线/层级重排
- 架:先切字数,再写提纲,先想清楚“和已有综述有什么不同”
- 写:一节一对话,只喂本节文献,指定引用编号
- 查:三步核查,引用只从自己的库里出
- 改:把罗列改成评述,讨论站到领域层面
AI 让你更快,但不会让你更懂。 综述里真正值钱的那一两句判断,还是得你自己读出来。











评论