AI辅助写作正在让参考文献管理从“查找—阅读—引用”的线性过程,变成一种高度依赖生成式工具的新流程。这带来的效率提升是真实的:AI可以快速整理想法、建议检索方向、生成符合格式规范的文献条目。但当大型语言模型被要求提供具体参考文献时,它有时会生成看似结构完整、作者与期刊名称合理、DOI编号齐全,却在实际数据库中并不存在的条目。这类现象通常被称为引文幻觉或幻觉引用。问题的严重性并不仅停留在学生作业层面。根据The Lancet发表的一项综述研究,在其核查的9710万条已发表生物医学论文的参考文献中,约4046条被判定为疑似伪造,且伪造发生率在2023年至2025年间呈现出12倍的上升趋势。这项数据提示,虚假引文已经不只是个别AI使用不当的后果,而是正在向已发表文献渗透的系统性风险。

对于正在撰写论文的高校学生和研究生而言,这意味着一个直接的行动要求:不能默认AI给出的文献是真实存在的,也不能因为条目格式完整就放弃核验。本文从AI产生幻觉引文的典型场景出发,梳理识别信号、核验步骤与工具选择,并给出过程留痕的建议,帮助读者在借用AI效率的同时守住学术诚信的底线。

AI幻觉引文的典型场景与生成机制

大型语言模型在文献生成上的错误并非简单的搜索失败,而是源于其底层工作机制。模型的核心任务是生成与上下文在统计上最吻合的文本序列,而不是从权威数据库中检索并确认某一文献是否真实存在。当模型被要求“列出相关参考文献”时,它会根据训练语料中常见的标题结构、作者姓名组合、期刊命名习惯和出版年份模式,合成出高度逼真的条目。正因如此,幻觉引文通常具有一个共同特征:单独看条目本身几乎挑不出格式错误,但一旦放入数据库检索,便无法命中。

有研究团队在顶级机器学习会议如NeurIPS和ICLR的已接收论文中同样发现了AI幻觉引文的存在。这说明即使是学术训练较充分的作者,也可能在快速写作或后期补文献阶段,未能识别出AI生成的虚假条目。这类引文往往混入真实文献之间,依靠人工浏览参考文献列表很难被一眼识别。真正有效的判断,只能来自系统性的核验流程,而非对条目表面的格式检查。

识别虚假参考文献的常见信号

在进入数据库核验之前,先对AI生成的文献列表做一轮人工排查,可以过滤掉最明显的异常条目。以下信号值得特别注意:

作者与期刊信息不匹配。 幻觉引文经常把某位真实学者的名字与错误的机构或期刊组合在一起。例如一篇声称发表于某知名期刊的文章,其作者实际研究领域与该期刊的发表范围明显不符。遇到这种情况,即使条目本身格式正确,也应当标记待核验。

期刊名称、卷号与页码之间存在矛盾。 AI生成的文献条目可能出现期刊存在、卷号存在,但页码范围与该卷实际出版内容不吻合的情况。更隐蔽的情况是,期刊名称本身是真实存在的,但已经被更名或停刊,而AI给出的条目仍在使用旧称或已废弃的编号规则。

DOI编号格式正确但无法解析。 幻觉引文有时会附带看似合规的DOI,但当在DOI解析系统或Crossref中查询时,该编号并不存在,或指向完全不相干的另一篇文章。DOI的存在感会让人产生可信的错觉,因此它恰恰是需要重点核验的对象。

过度“完美”的标题与主题匹配。 AI倾向于生成与研究主题高度吻合、标题措辞异常贴合的文献条目。真实的文献检索结果通常带有一定的不规则性,标题表述方式多样,研究角度未必与用户的问题完全一致。如果AI给出的每一条文献都像是为当前论文量身定做的,这本身就是一个提示信号。

核验流程:以原始数据库为准

识别信号只能帮助建立怀疑,核验的最终依据必须来自原始学术数据库和官方来源。基本原则是:AI输出或AI自带的链接均不能作为文献真实性的证明,必须回到可独立查询的权威平台进行确认。

第一步:逐条提取关键字段

对每一条待核验的参考文献,提取出以下字段:作者全名、文章标题、期刊或出版机构名称、出版年份、卷号、期号、页码、DOI或ISBN。字段越完整,核验所需判断的信息量越大,但也要注意,幻觉引文往往在字段完整性上做得很好,因此字段齐全本身不构成可信度证明。

第二步:在权威数据库中执行检索

优先使用的核验入口包括Crossref、PubMed、Semantic Scholar和OpenAlex等学术数据库。Crossref适合核验DOI和基本的书目元数据,PubMed适用于生物医学与生命科学领域,Semantic Scholar和OpenAlex则可以覆盖更广泛的学科范围。核验时的操作不是把AI给出的条目原样粘贴,而是使用提取出的标题关键词加第一作者的姓进行检索,查看是否能在数据库中命中一条真实存在的记录。

这一步中可能出现三种结果。第一,条目完全找不到对应记录,这基本可以判定为幻觉引文。第二,找到了标题近似的真实文献,但作者、期刊或出版年份与AI给出的版本存在差异,这说明AI可能在真实文献基础上进行了错误的重组。第三,条目能够完整匹配,则该文献可保留,但仍需进一步确认其内容是否确实支持论文中的论述。

第三步:优先使用多源交叉验证

单个数据库可能存在收录范围有限、索引延迟或元数据错误的情况。对于重要程度较高的引用,尤其是作为论文核心论据支撑的文献,建议至少在两个独立数据库中确认。当前已经有一些专门的引文核验工具尝试自动化完成这一过程,例如开源工具CheckIfExist通过对CrossRef、Semantic Scholar和OpenAlex进行多源验证,为用户提供即时反馈。这类工具的价值在于,它把“逐条人工检索”的负担部分自动化,但核验结果仍然依赖于底层数据库的覆盖质量,不能替代人工对文献内容相关性的最终判断。

需要警惕的是,部分商业化的引文核验服务在免费层级设置了每日或每月的验证次数限制。在日常写作中,如果过度依赖某一种工具,可能在关键时刻遇到验证额度不足的困境。更稳妥的做法是学会直接使用基础数据库的检索功能,把专用工具作为辅助而非唯一依赖。

可信来源优先:核验之后再引用

核验流程解决的是“文献是否存在”的问题,而引用质量还需要回答“文献是否可信”以及“是否真的支持当前论述”。这两个问题同样影响学术诚信的完整实现。

优先选择可追溯的原始出处。 如果AI摘要中提到某项研究发现,但未给出可核验的原始文献,应回到文献检索阶段,查找最初发表该项研究的一手文献。直接引用AI的转述而不追溯到原始来源,既增加了引用错误的风险,也削弱了论文论证的可靠性。官方统计资料、政府报告、权威机构发布的规范文件,同样应当通过其官方发布平台确认最新版本,而不是依赖AI的记忆输出。

核对文献内容与实际引用位置的一致性。 一条真实存在的文献,也可能被安排在并不合适的位置。核验完成后,仍需要回到论文正文,检查该文献是否真的支撑当前的论点,引述内容是否与原文表述一致。AI辅助整理文献时常犯的错误,是把真实文献与错误的论点配对,形成“出处真实、支撑错误”的隐性引用问题。这类问题不容易被查重系统识别,却直接影响论文的学术质量。

过程留痕:让核验可追溯

学术规范不仅要求最终结果正确,也要求研究过程可追溯。在使用AI辅助检索和引用管理时,保留核验记录尤其重要。因为当审稿人、导师或学术诚信委员会对某一文献提出质疑时,能够展示“该文献经XX数据库于XX日期核验通过”的记录,是证明作者尽到合理审查义务的关键材料。

具体操作可以从三个方面入手。第一,建立一份文献核验表,至少包含文献条目、核验数据库、核验日期、命中状态和最终处理决定。对于未通过核验或信息不一致的条目,简要记录处理方式,如删除、替换或修正。第二,保存核验过程中的关键截图,尤其是数据库检索结果页面。截图应包含检索词和命中记录,以便事后追溯。第三,如果使用AI工具生成过文献建议或答案,保留当时的提示词与输出内容。当日后出现引用争议时,这些记录可以帮助厘清哪些内容是AI生成、哪些经过了人工核验。

留痕的意义不在于制造繁重的行政负担,而在于改变引用管理的默认状态:从“相信AI的可靠性”切换为“随时准备证明自己的文献来源经得起检验”。这种习惯的建立,本身就是学术诚信建设的一部分。

把AI定位为辅助而非权威

回到问题的起点:AI工具在文献检索和引用管理中并非没有价值,关键在于使用者如何划定它的角色边界。AI擅长的是基于已有材料的整理、归纳、格式转换和思路发散,但它不具备检索权威数据库并确认文献真实性的可靠能力。把AI输出的文献条目视为“待核验的候选清单”,而不是“可以直接纳入参考文献列表的最终结果”,是避免幻觉引文进入论文的第一道防线。

对于高校学生和研究生来说,最有效的保护不是拒绝使用AI,而是建立起一套不依赖AI自我声明的核验习惯。每一条进入论文的参考文献,都应能在原始数据库中独立确认其存在;每一个关键论据,都应能追溯到真实且可获得的原始来源;每一次由AI参与的文献整理,都应留下足以说明核验过程的记录。按此思路操作,AI可以提高写作效率,却不会替代作者对文献真实性的最终责任。

值得注意的是,截至检索日期,关于生成式AI在学术写作中的使用边界、披露要求以及期刊投稿中的AI合规政策仍在持续更新中。不同学科、不同期刊对AI参与文献检索和引文生成的具体规范可能存在差异,作者在投稿前应当以目标期刊或学位授予单位的最新官方文件为准,并如实声明AI的使用范围。学术诚信不是一套静止的规则,而是一个需要结合外部环境变化持续校准判断与实践的过程。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。