虎嗅

AI催生生物医学科研危机?顶尖科学家差点被AI假文献蒙骗

该文章尚未提供 Русский 解读,以下为中文版内容。

核心内容总结

哥伦比亚大学顶尖科学家Maxim Topaz团队通过筛查250万篇生物医学论文发现:AI普及后,虚假引文(引用不存在的文献)在2023年到2026年初涨幅超12倍(从每万篇4条到56.9条),且98.4%的问题论文未被更正或撤稿。这些假引文多由AI生成,逼真难辨,尤其在综述论文中泛滥(比其他类型高57%),会层层传导误导临床决策和政策制定。团队呼吁行业在论文投稿前加入自动化引文核验,但落地面临体制和成本障碍。

详细解读

1. 从“中招”到调研:顶尖AI专家也被AI假文献骗了

Topaz自己就是研究医疗AI的专家,却差点栽在AI手里。他用AI工具润色一篇评论时,特意核对了所有引文,但AI还是偷偷加了一条完全不存在的假文献——直到期刊编辑质疑才发现。这件事让他后怕:连常年和AI打交道的人都中招,普通研究者更难防。于是他牵头调研,填补了“虚假引文流入正式论文比例”的空白——毕竟参考文献是科研的根基,根基烂了,整个科研大厦都不稳。

2. 虚假引文暴增12倍:98%问题论文仍在害人

团队筛查了247万篇论文、1.25亿条参考文献,得出两个惊人结论:

  • 增长快:2023年每万篇论文仅4条假引文,到2026年初飙到56.9条,涨幅超12倍。时间点刚好对应AI大模型普及(2022-2023年)+论文发表周期(100-200天),说明AI是主要推手。
  • 无人管:98.4%的问题论文没被更正或撤稿,还在公开数据库里被其他论文引用。以前行业以为这是“个别作者品行差”,现在发现是普遍现象——存量文献污染已经很严重。

团队能做这么大规模筛查,多亏Topaz的跨学科背景:临床知识帮他们区分“无心笔误”和“恶意造假”,数据科学技术实现自动化核验(多层级流程+人工校验,准确率91%)。

3. AI假引文更“坑”:从“写错”到“无中生有”

以前的引文错误多是“粗心”:比如页码写错、观点引用错,但文献本身是真的。AI生成的假引文则是“无中生有”——格式规范(像模像样的标题、作者、日期),作者还是业内真实专家,主题也贴合论文内容,普通同行评审根本看不出来。

危害升级了:以前是“证据质量差”,现在是“没有证据”。比如你写论文说“某药有效”,引用的文献根本不存在,那你的结论就是空中楼阁——直接切断了科学论证的链条。

4. 综述论文最危险:误导医生开药方、政策定方向

综述论文是引文造假的重灾区(每万篇16.7条假引文,比其他类型高57%),原因有三:

  • 参考文献多:一篇综述可能引用上百篇文献,假引文容易混进去;
  • 依赖AI:写综述要梳理大量文献,研究者最爱用AI辅助,刚好给了AI植入假引文的机会;
  • 位置关键:综述是临床指南的基础(比如医生看的诊疗指南,很多是基于综述写的)。如果综述里有假引文,错误会层层传导——医生根据指南开的药、政策制定的医疗方案,都可能失去科学支撑。

5. 行业该行动了:投稿前核验最紧迫,但落地难

Topaz团队提出4项建议,其中最紧迫但最难落地的是“投稿前加自动化引文核验”

  • 技术成熟:他们的系统准确率91%,已经能用;
  • 阻力在哪:出版商不愿花钱改流程(要投入资金调整审稿步骤),体制惯性大。

最难的是清理存量文献:几百万篇旧论文逐一筛查,成本太高,没人愿意担责。

Topaz最担心的是“恶性循环”:假论文被后续论文引用,甚至用来训练AI,造假内容会越传越多。他呼吁全球立刻行动——不是禁止AI,而是把“引文核验”变成投稿的必经步骤,让未经审核的AI内容进不了学术体系。

一句话总结

AI让造假变容易,但只要在投稿前加一道自动化核验的“关卡”,就能堵住大部分假引文——关键是行业愿不愿意迈出这一步。否则,生物医学科研的可信度会越来越低,最终受害的是患者和整个医疗体系。