用AI做数据提取:草稿交给机器,数值回原文核实
纳入研究定下来了,数据提取开始。翻开第一篇,见到有用的就往下抄——抄到第三四篇你会发现,每一行覆盖的条目都不一样。 这种返工是数据提取的经典翻车现场,原因也很简单:数据提取不是“写摘要”,而是“按同一格式,从每篇论文里提取事先定好的条目”。本文梳理整个流程,以及AI真正帮得上忙的位置。
发布日期: 2026-07-22
翻开论文之前,先设计提取表
第一件事不是读,而是设计表格——先把列定下来。
基础的一套:作者、年份、国家、研究设计、研究对象(数量与特征)、干预或暴露、对照、结局及其定义、主要结果(效应量与置信区间)、随访期、缺失数据、局限性。从综述问题需要什么倒推,在翻开第一篇论文之前把列固定下来。
先拿两三篇试提
表格在手,别急着铺开全量,先拿两三篇试一试。列定义含糊、各篇格式不一的问题都会在这里暴露。
在这个阶段修订表格设计,就能避开之后推倒重来的灾难。团队协作的话,正好借试提统一录入规则。
让AI起草表格
列一旦固定,AI就变得非常好用。对每篇论文说一句“按这个格式提取这些条目”,几分钟内提取表的草稿就出来了。
对着草稿核对修改,和对着空格手工填写,负担完全是两回事。AI的角色是“先把格子填上”,而不是“保证格子里的内容正确”。抓住这条界线,速度和准确率就能兼得。
数值核实三件事:单位、分母、方向
审草稿时,每个数值都要特别盯住三点。
单位(百分比还是例数,月还是年);分母(ITT人群、实际分析人群,还是仅完成者);方向(效应量偏向干预组还是对照组)。AI草稿最容易在这三处滑倒,而其中任何一处出错,都足以掉转综述的结论。务必对照原文和图表,必要时连同补充材料一起核实。
要进Meta分析的数值,再加一级谨慎
提取的数据若要送入Meta分析,就把核对标准再提一档:核查各研究的效应量类型、时点和分析人群定义是否对应,并记下数值是读自图还是读自文字。
能否合并、如何换算,属于统计学判断——拿不准时,请咨询统计专家、导师或团队。这是AI和本文都替代不了的领域。
记下每个数值的出处
一个实用的小习惯:在提取表的每个单元格或每一行里注明出处位置——Table 2、第6页、补充材料。
之后的核对和团队互查,就不必反复在同一篇论文里翻找。几十个条目乘上几十项研究,这个小习惯能省出好几天。
用 Paperfy 打底
在 Paperfy 中,每篇纳入论文的AI摘要、图表与PDF同在一页,提取时定位“原文在哪里”快得多。
把确认过的内容写进摘要——比如“分母为ITT,Table 2确认”——提取的依据就留在论文页上,后续复核和偏倚风险评价可以直接复用。
本文要点
- 翻开论文之前,提取表的列已经固定。
- 两三篇试提之后,修订了表格和录入规则。
- 数值的单位、分母、方向都在原文中核实过。
- 每个数值的出处(表格/页码)都有记录。
每一次提取的依据,都留在论文页上
在 Paperfy 中,AI摘要、图表和原文同在一页,论文还带着你在提取时留下的核实笔记。
论文筛选
浏览这个主题
按同一工作流阅读相关指南,从入门到实际使用。
接下来阅读
这些文章可以继续补充同一个工作流程。