近日,北京大学心理与认知科学学院甘怡群教授课题组在我国生命科学领域最具影响力的综合性中文期刊之一《中国科学:生命科学》,发表题为《大语言模型增强系统综述效率跃迁:关键流程、技术实现与范式革新》的论文。
系统综述是生命科学、医学及心理学等领域证据整合的“金标准”,但其传统流程高度依赖人工投入,导致成本较高与更新滞后。大语言模型(Large Language Models,LLMs)凭借强大的文本理解、生成与推理能力,为系统综述的范式革新提供了巨大潜力。在此背景下,如何将LLMs有效地集成至系统综述是当前研究关注的前沿热点。甘怡群教授课题组在前期实践基础上,聚焦文献筛选、数据提取及偏倚风险评估三个关键步骤,系统梳理了大语言模型(Large Language Models,LLMs)作为系统综述中“第二研究者”的可行性,厘清了LLMs带来的潜在挑战并剖析其成因(例如,对文献筛选的分析如表1所示)。
表1 LLMs文献筛选性能差异的主要影响因素
Table 1 Main Factors Associated with Variability in LLM-Assisted Literature Screening Performance
| 影响因素 | 具体表现 | 方法学解释 | 应用启示 |
|---|---|---|---|
| 任务复杂度 [11, 18] | 研究是否涉及复杂干预、多重结局、混合设计或跨领域概念等 | 任务越复杂,模型越难保持稳定判断,容易出现因幻觉导致的过度纳入、错误排除或“不确定”比例升高 | 复杂筛选应优先采用保守筛选策略,保留“不确定”类别并由人工复核 |
| 学科/主题差异[8, 11] | 医学文献的术语通常较标准化;心理学、教育学等领域多依赖构念解释和情境判断 | 不同学科在术语一致性、理论构念和纳排标准清晰度上存在差异,导致LLM对纳入和排除标准的理解难度不同 | 不建议将某一学科中LLMs的筛选策略直接推广至其他学科,应进行领域特异性校准 |
| 样本规模[11, 18] | 纳入文献比例过低会放大漏判对召回率的负面影响 | 文献筛选通常是低阳性率任务,少数漏筛可能会显著改变召回率的估计结果 | 需同时报告总筛选量、纳入文献比例等,不建议仅报告总体准确率 |
| 提示词设计[18-20] | 提示词设计是否合理;是否采用相应的策略优化提示词 | 提示词决定模型如何理解筛选任务、如何处理边界样本以及如何输出判断结果 | 在正式筛选前进行提示词迭代,必要时采用提示词工程或按标准逐项判断策略等 |
| 模型类型[8, 21, 22] | 不同模型如DeepSeek、GPT的输出结果存在不一致 | 不同模型在指令遵循、领域知识、上下文处理和结构化输出能力等诸多方面存在差异 | 模型选择应基于任务特异性的实证评估,而非单纯依赖其市场热度或参数体量 |
为实现大语言模型在系统综述中稳定、可重复地嵌入,研究者需要在方法学层面进行系统性技术准备,课题组在前期使用经验基础上结合前沿研究,提出一个面向系统综述的LLMs技术实现流程,形成了“输入—处理—输出”的闭环工作流,解决了LLMs在文献筛选、数据提取等环节中输出不稳定、难追溯的问题。
图1 大语言模型应用于系统综述的技术流程
基于已有实践,综合权衡人力与时间成本,以“不牺牲准确率与可靠性前提下最大化释放LLM潜力”为核心原则,本研究团队创新性提出“人机协同大语言模型增强系统综述范式”(Human-in-the-Loop LLM-Enhanced Systematic Review Paradigm)。该范式通过构建“模板化提示词 → 跨模型小样本校准 → 人机协同 → 专家决策 → 全流程透明记录”的闭环机制(见图2),实现了方法学的规范化运作。该范式明确了人类专家的裁决主体责任,将LLMs工程化为“第二研究者”,通过“模板化提示—模型校准—人机协作—专家复核”的闭环机制,在保持严谨性的同时实现了效率的跃迁。

图2 人机协同大语言模型增强系统综述范式
这一范式的提出,标志着系统综述从“手工劳作”迈入了“智能协同”的新阶段。它将原本耗时数月的人工筛查压缩至数小时,极大缓解了人力紧缺与效率瓶颈;更重要的是,通过引入“专家监督、机器执行”的机制,既消除了人工长时间作业产生的疲劳误差,又以全流程透明记录破解了传统综述“黑箱操作”的难题。这不仅让覆盖全学科的海量文献综述成为可能,更为需要持续追踪最新证据的“动态系统综述”提供了技术引擎,有望全面加速生命科学及心理学领域的知识迭代。该文与此前课题组在Clinical Psychology Review发表的青少年心理健康AI评估元分析一脉相承,是方法学创新从实践基础到理论范式的提升。
中央财经大学社会与心理学院刘金梦助理教授(原北京大学博雅博士后)为本文第一作者,北京大学心理与认知科学学院丁晓彤博士后为本文第二作者。甘怡群教授为通讯作者。
论文链接:https://www.sciengine.com/SSV/doi/10.1360/SSV-2026-0034
论文引用:刘金梦, 丁晓彤, 甘怡群. 大语言模型增强系统综述效率跃迁:关键流程、技术实现与范式革新[J]. 中国科学: 生命科学, 在线优先出版. DOI: 10.1360/SSV-2026-0034.
Jinmeng Liu, Xiaotong Ding, Yiqun Gan. Large Language Models Enhancing Systematic Review Efficiency Leap: Key Processes, Technical Implementation, and Paradigm Innovation[J]. SCIENTIA SINICA Vitae, Advance online publication. DOI: 10.1360/SSV-2026-0034.
2026-09-21