AI生成14万条“虚假参考文献”……论文激增,验证却停滞不前
AI学习数据,科学信任人类

编者注“科学视野(Science Scope)”栏目如同“瞄准镜(scope)”一词所示,聚焦特定科技现象进行放大观察,并深入分析其意义与未来。

生成式人工智能(AI)生成的不存在的参考文献,开始被纳入实际科学论文。随着AI撰写论文、协助审稿的时代开启,科学界担忧,延续约300年的“人来撰写、人来验证”信任体系可能受到动摇。


牛顿看到苹果落下,想到了万有引力定律。爱因斯坦通过脑海中的思想实验建立了相对论。那么,生成式AI又是看着什么来从事科学研究的?

ChatGPT生成图片

ChatGPT生成图片

View original image

AI不会观察自然,而是学习数千万篇论文和数据,生成最看似合理的答案。它原本是为协助研究而出现的工具,却在短短两三年间改变了论文撰写、审稿乃至出版生态。如今科学界的问题已不再是“AI能把论文写得多好”,而是“在AI时代如何相信科学”。


AI已进入实验室


生成式AI已不再只是少数研究人员的实验性工具。国际学术出版界已以AI应用为前提制定新规则。


出版《自然》(Nature)等数千种学术期刊的全球最大国际学术出版商施普林格·自然(Springer Nature)允许使用AI进行语句润色和翻译等工作,但不承认AI为论文作者,因为AI无法对研究结果承担责任。


全球学术信息与出版企业爱思唯尔(Elsevier)也提出原则:必须透明披露生成式AI的使用情况,研究内容及结论的最终责任须由研究人员承担。该公司尤其强调,AI生成的参考文献可能虚假或不准确,研究人员必须亲自核验。


国际知名期刊《自然》和《科学》(Science)也并未禁止使用AI本身,但连续警告称,AI生成不存在的参考文献,或将不符合事实的内容写得煞有介事的“幻觉(Hallucination)”,可能损害研究可信度。

[科学视野] AI写论文、AI审稿……科学信任受动摇 View original image

研究结果也证实了AI的使用。2025年发表于国际学术期刊《科学进展》(Science Advances)的一项研究中,德国图宾根大学神经信息学研究所博士Dmitry Kobak的研究团队分析了2010年至2024年收录于医学论文数据库PubMed的1510万篇生物医学论文摘要。研究团队发现,ChatGPT公开后,特定表达和文体迅速增加;据此推测,2024年发表的生物医学论文摘要中,至少13.5%可能获得了大型语言模型的协助。


问题仅在一年后便变得严重得多。2026年公开的一项研究中,美国康奈尔大学信息科学系研究员Zhao Zhengwei与教授In Yan的团队分析了全球研究人员最先公开或分享论文的在线论文发布与共享平台。全球最大在线论文公开平台arXiv的创始人Paul Ginsparg也参与了这项合作研究。


研究团队分析了物理学领域的“arXiv”、生命科学领域的“bioRxiv”、社会科学领域的“SSRN”,以及由美国国立卫生研究院运营的生物医学论文数据库“PubMed Central”等平台公开的约250万篇论文和1.11亿条参考文献。结果显示,仅2025年就可能有至少14.6932万条不存在的“虚假参考文献”被纳入其中。


这意味着AI生成的虚假参考文献已渗入真实学术文献。AI如今已不仅能撰写论文,甚至开始生成作为科学知识基础的参考文献。


问题不在AI,而在验证


AI替代英语润色、文献检索和摘要撰写,大幅缩短了论文初稿的写作时间,并提高了研究生产力。然而,论文真伪、数据可信度、统计分析的适当性以及参考文献准确性,仍须由人类验证。


科学界的困扰正由此开始。《自然》今年分析称,AI生成的虚假参考文献正被纳入多个学科的实际论文,仅凭现有同行评审和编辑流程,尚不足以将其充分筛除。

[科学视野] AI写论文、AI审稿……科学信任受动摇 View original image

论文撤稿数量也在迅速增加。据论文撤稿监督机构“Retraction Watch”统计,2023年全球撤稿论文超过1万篇,创下历史最高水平。


更大的问题是验证体系的局限性。以全球最大科学出版商施普林格·自然为例,近一年接收的稿件超过310万篇,论文数量激增。但同行评审体系无法跟上这一速度,研究人员的审稿负担正日益加重。


人手不足,AI开始参与审稿


由于验证速度无法赶上论文产出速度,最先触及极限的正是科学界核心验证程序——“同行评审(Peer Review)”体系。


同行评审大多依赖近乎无偿的自愿参与,“审稿人不足”长期以来一直被视为顽疾。更糟的是,如前所述,投稿量呈爆发式增长,而能够阅读并核验这些论文的专业研究人员严重不足,审稿周期不断拉长,研究人员的疲劳程度也达到极限。


最终,仅依靠人工验证已难以为继,AI开始进入审稿流程。部分学术出版商已引入AI系统,预先检查统计错误、抄袭、参考文献以及图像篡改等问题。近期,AI起草同行评审意见、研究人员再加以修改完善的案例也在增加。围绕AI可在审稿过程中使用到何种程度的讨论,也已正式展开。


对此的反对声音也不少。加拿大蒙特利尔大学生态学教授Timothy Poisot收到疑似由生成式AI撰写的审稿意见后,在个人博客写道:“ChatGPT不是我的同行(ChatGPT is not my peer)。”他批评称:“我投稿是期待同行研究者的意见,而不是为了获得AI的意见。一旦这一承诺被打破,同行评审的社会契约也将崩塌。”


比AI更大的问题是“验证速度”


科学界将收取报酬代写研究成果,或利用伪造数据和图像批量生产论文的代写造假网络称为“论文工厂(Paper Mill)”。这是近年国际学术出版界最为警惕的研究伦理问题之一。

[科学视野] AI写论文、AI审稿……科学信任受动摇 View original image

国际学术出版界担忧,生成式AI可能进一步提升这类“论文工厂”的生产力。过去,制作一篇论文需要大量时间和人力;但生成式AI能够学习既有论文,在短时间内生成稿件、插图、图表乃至参考文献。即便不制作新的实验数据,也更容易通过组合既有研究,制造出表面上完成度很高的论文。


当然,AI并非论文工厂的制造者。但专家一致指出,AI创造了让论文工厂以更低成本和更短时间生产更多论文的环境,也相应加重了学术出版界的验证负担。


运营全球最大撤稿论文数据库的Retraction Watch联合创始人Ivan Oransky一直将撤稿论文增加评价为“科学自我纠正的过程”。不过,若论文生产速度压倒验证速度,科学的自净功能也可能达到极限,这一担忧正日益加剧。


韩国也制定AI研究伦理标准


韩国国内也正全面推进生成式AI使用标准的制定。韩国研究财团于今年6月发布《面向大学研究人员的生成式AI研究伦理指南》。其核心内容是,AI不能成为论文作者;如使用生成式AI,必须透明披露使用事实。指南还明确,研究结果准确性和研究伦理责任始终由研究人员承担,且在论文审稿过程中,不得因使用AI而损害被审论文的保密性。


欧盟(EU)近期也在有关生成式AI在研究现场应用的指南中表示:“AI只是支持研究人员专业能力的工具,不能取代研究人员的判断和责任。”这明确了即便在AI时代,研究责任主体终究仍是人。

国际学术期刊《自然》今年4月警告,生成式人工智能生成的“虚构引文”被纳入实际论文,正威胁科学文献的可信度。自然网站供图

国际学术期刊《自然》今年4月警告,生成式人工智能生成的“虚构引文”被纳入实际论文,正威胁科学文献的可信度。自然网站供图

View original image

成均馆大学新材料工程系教授Won Byungmook表示:“科学荣誉与评价只能建立在可验证的研究成果和严格的研究伦理之上。随着生成式AI让论文撰写和资料整理变得更加容易,虚假引用、来源不明和推卸责任的风险也在同步上升。”他接着强调:“只有加强AI使用披露、原始资料保存和独立验证程序,才能守住对科学的信任。”


得益于AI,论文得以更快完成,未来的产量还将增加。但科学不会因论文数量而进步。新知识必须经由某个人的观察和实验,以及另一位研究人员的验证,才能真正成为科学。



AI学习数据,但科学是超越数据、以信任人为基础的体系。即便在AI时代,最终必须守护的也不是算法,而是信任。


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。