168 项研究评估 AI 如何辅助系统综述:哪些环节可靠,哪些仍需人工把关

📌 One-Sentence Summary
Galen Adam 博士梳理了 168 项关于 AI 辅助系统综述的评估:随机试验识别和主动学习筛选已有较强的实用证据,自动检索、研究选择与证据判断则仍需针对具体课题验证,并由研究者监督。
📝 Summary
Brown University 研究者 Galen Adam 博士介绍了一项由 AHRQ 资助、持续更新的快速综述,绘制 AI 和机器学习工具在系统综述全流程中的证据图谱:从 PICO 问题设定、检索式构建,到文献筛选、数据提取、偏倚风险评估、证据合成与报告。当前版本纳入了截至 2026 年 4 月检索到的 168 项研究。随机试验识别和利用主动学习安排筛选顺序,获得的支持最清晰;但回顾性召回率曲线不能直接给出安全的停止规则,自动摘要筛选的表现也随模型、提示词和课题显著变化。数据提取在描述性字段上优于数值结果,复杂的偏倚评估框架仍很棘手。Adam 解释了为什么评价指标不一致、提示词敏感、模型持续变化,以及人工参考标准本身薄弱,都会限制结论的外推。她还介绍团队的实际流程:用已知论文及 PubMed 检索结果前 500 条为筛选模型提供种子,此后持续筛选,直到连续 400 篇摘要均被排除。内部建模显示该方法可捕获 99.3% 的相关研究,但节省的工作量因课题而异,从几乎没有到约 60% 至 75%。她建议在真实综述内部开展一次工具验证:以该课题的留出数据测试工具、检查错误,并由综述作者对遗漏承担最终责任。
💡 Main Points
AI 在不同综述任务上的表现差异很大
随机试验识别和有人参与的摘要排序,证据强于自动构建检索式或自主排除摘要。提取描述性字段,也比提取连续型数值结果更可靠。
回顾性召回率高,不等于知道何时可以停止筛选
主动学习研究显示,审阅者筛查约一半文献后可找回大量相关记录,但团队还需要一套前瞻性的停止规则。已发表的经验规则往往节省不了多少工作,或表现不稳定。
针对课题本身验证,比依赖模型排行榜更重要
提示词、模型版本和综述课题都会改变结果。Adam 建议从实际综述中留出数据,先检查错误并改进流程,再把工具用于其余记录。
困难的证据判断仍需要人工裁决
复杂的偏倚风险框架和 GRADE 证据确定性判断,尚不能可靠地完全自动化。模型与人工意见不一致,有时也会暴露人工判断的不一致,但最终决定仍由研究者负责。
具体的筛选流程可以省力,但效果并不均匀
Adam 团队用已知研究和 PubMed 前 500 条匹配结果为模型提供种子,再筛选到连续 400 篇摘要均被双人排除。内部建模报告的捕获率为 99.3%,节省的时间则因课题而有很大差异。
💬 Key Quotes
然而,回顾性曲线不能告诉研究者,在正在进行的综述中何时可以安全地停止。
没有任何工具能取代系统综述团队的专业知识。
综述作者仍须对遗漏的研究负责;说是模型漏掉了,并不会转移这份责任。
我们需要标准化评估,也需要让可信结果的传播速度快于传统发表周期所允许的速度。
📊 Article Meta
AI Screening: 90
Featured: Yes
Source: Cochrane Complementary Medicine
Author: Cochrane Complementary Medicine
Category: 人工智能
Language: 英文
Read Time: 11 min
Word Count: 2700
Tags:
AI 与智能应用 , 机器学习 , 学习方法 , 科技评论 , AI 工作流
Play Full Video
暂无评论,快来抢沙发~