一项针对ICML 2026投稿的大规模随机对照实验显示,评审政策中是否允许使用大语言模型(LLM),对论文最终得分与录用结果的影响几乎可以忽略不计。该研究基于arXiv公开论文对24 661篇投稿进行分析,发现不同政策组之间的评分差异仅为0.002分,且在统计上不显著。这一结果表明,允许有限度的AI辅助评审,并未如部分研究者担忧的那样系统性地改变评审结果。
核心数据:政策分组未带来实质评分变化
该实验采用随机化设计,将投稿与评审者分配至不同LLM使用政策组。数据显示,在允许有限LLM使用与禁止LLM使用的条件下,论文平均得分分别为3.31分和3.32分,差异仅为0.01分;经统计检验,p值为0.56,远高于常规显著性阈值,说明这一微小差异更可能来自随机波动而非政策本身的作用。
录用决定同样呈现高度一致。在允许有限LLM使用的组中,73.0%的论文被拒稿或撤稿,24.4%作为常规论文录用,2.6%作为亮点论文录用;在禁止LLM使用组中,对应比例分别为73.5%、24.4%和2.1%。决策分布几乎完全重叠,卡方统计量χ²(2)=1.18,效应量Cramér’s V仅为0.01。
研究同时考察了评审者信心这一维度,同样未发现政策分组带来的显著差异。这意味着,无论评审者是否被允许借助LLM,其给出的分数、给出的决策以及对自己判断的确定性,都处于同一水平。
政策背景:ICML 2026的双轨LLM框架
上述实验实施于ICML 2026的评审环节。与ICML 2025全面禁止评审者使用LLM不同,ICML 2026引入了双政策框架:作者和评审者各自选择允许有限LLM使用或不使用,并据此进行匹配。具体规则还包括:选择不使用LLM的作者,其评审阶段同样必须遵守不使用LLM的规定。
ICML 2026官方FAQ对政策执行做出了进一步说明。在政策A(严格禁止LLM)下,将投稿内容整体或部分输入LLM均属违规,无论目的为何;同时,区别于无意使用,若评审者将投稿输入LLM并实际采用其输出,将被视为超出无意行为的范围。
在作者侧,ICML 2026同期明确了LLM不得列为作者、严禁通过提示注入操纵评审结果等规则。值得注意的是,用于检测LLM使用的提示(例如由主办方插入的提示)不被视为违规,但以操纵获得更好评审结果为目的的提示注入则被明确禁止。这些细则构成了ICML 2026在LLM评审治理上的完整政策链条。
另一动态:NeurIPS 2026引入“贡献声明”
在ICML 2026双轨政策实验进行的同时,NeurIPS 2026也在投稿与评审流程中推出了一项新举措——“贡献声明”。该举措要求作者对论文中各部分工作的来源与性质进行说明,以回应学术界对LLM参与研究过程后贡献归属日益增长的关切。检索日期为2026年7月,具体执行细节需以NeurIPS官方最新文件为准。
从投稿者角度看,这一系列变化传递出的信号较为明确:顶会在LLM使用问题上的治理思路正在分化,有的采用“允许但受限并匹配”的双轨设计,有的则尝试通过声明机制强化贡献透明度。对于正在准备投稿的研究者而言,逐条核对会议官方政策、确认本人与评审者所处政策组别,仍是降低流程风险最直接的方式。


