使用AI工具辅助论文写作时,最容易忽略的风险往往不在最后的成稿,而在最初的上传动作。一旦把包含个人身份、研究参与者信息或未公开科研内容的数据输入第三方AI系统,后续的删除、撤回和流向控制都会变得困难。《学术出版中AIGC使用边界指南3.0》对隐私与数据安全提出了明确原则:能不上传的敏感数据就不上传,必须使用的数据应做最小化处理和去标识化,并且要保留判断与处理记录。下面从论文写作的五个阶段,给出具体判断方法和留痕动作。

先建立两类基本判断:什么要拦下,什么可放行

判断一份材料能否上传,不取决于它是否“看起来敏感”,而取决于它是否能够直接或间接指向具体个人,以及是否承载尚未公开的科研内容。可先问三个问题:

  1. 这份材料里有没有姓名、证件号、联系方式、学号、工号、地址、生物特征、设备标识等直接标识符?
  2. 即使去掉直接标识符,是否仍可通过年级、专业、导师、机构、疾病信息、收入区间、地理位置等组合识别出具体个人?
  3. 材料中是否包含尚未发表的实验方案、未公开数据、合作单位未授权共享的内容、受合同或伦理审查限制的信息?

前两项只要有一项为“是”,就应进入不可上传或必须去标识化处理的范围;第三项为“是”时,默认不上传,除非已经获得明确授权或许可。

阶段一:选题与开题

常见风险:把导师未公开的研究设想、课题组内部讨论记录、合作单位的初步数据,连同真实人员信息一起粘贴给AI做选题梳理。

不可上传:未公开的科研内容,包括导师或团队尚未发表的假设、预实验数据、申报书草稿、评审意见、合作单位要求保密的数据。

可上传:已公开发表的文献信息、公开数据库中的研究趋势、自己用通用语言描述且不含人员标识和未公开细节的问题框架。

操作方式:如果必须让AI帮助梳理思路,先把内部资料改写成不含具体机构、项目编号、可识别人员信息的通用问题描述。例如,不写“某医院2023年收集的××患者数据”,而写“某类慢性病患者的随访依从性可能受哪些因素影响”。同时记录改写日期和改写规则,形成“上传材料处理记录”。

阶段二:文献整理与引文管理

常见风险:把带有学校账号信息的文献管理导出文件、完整登录凭证或图书馆访问记录上传;把包含未发表论文信息的引文列表交给AI处理。

不可上传:学校或机构的统一认证账号密码、包括长期令牌在内的访问凭证;含未公开论文、内部报告或审稿意见的引文条目;带有完整个人联系方式的学者通讯录。

可上传:已发表文献的题录信息,如标题、作者、期刊、年份、DOI;已经公开的摘要和出版信息。

判断步骤:上传前检查文件是否带有登录凭证、数据库订阅账号信息或包含他人的非公开联系方式。若不确定,可以只用公开题录;若必须批量处理,先清除凭据列、联系方式和内部字段,并记录清除了哪些字段。

阶段三:数据收集与分析

这是风险最集中的阶段。研究参与者数据、个人身份信息和未公开科研内容三者常常同时出现。

不可上传:未经去标识化的研究参与者数据,包括问卷原始记录、访谈笔录、实验测量值、医疗记录、财务信息、地理位置轨迹、音视频记录,以及任何与签署知情同意书时承诺的用途不一致的数据。知情同意书未授权用于AI工具的数据,也不能因匿名化不彻底而直接上传。

可上传的替代做法:将分析目标转化为不依赖个体级数据的形式,例如上传数据结构的描述、变量类型、缺失值模式、统计方法选择问题,或使用公开的示例数据集测试分析代码。如果校内提供合规的本地化或私有部署AI平台,应在确认数据不出校园环境的前提下,按学校规定使用。

去标识化操作:删除姓名、联系方式、身份证号、学号、住址等直接标识符;对出生日期只保留年份或年龄段;对机构信息只保留到必要的类别层级;对自由文本中出现的具体人名、地名、单位名做泛化处理。去标识化不等于匿名化,若数据仍有通过组合信息识别出个人的可能,仍需按敏感数据处理。

留痕动作:建立数据脱敏日志,记录每一步删除或替换了哪些字段、使用什么规则、处理后是否还有间接识别风险、最终判断依据。伦理审查或投稿时,这份日志可以作为合规处理的过程证明。

阶段四:论文撰写与修改

常见风险:把整篇包含研究方法、实验数据和未发表结论的论文草稿上传到公开AI平台做润色。即使文本里没有姓名,研究本身可能尚未公开,或投稿前需保持未披露状态。

不可上传:包含未发表原创结果、关键实验数据、创新方法细节或特定研究设计的完整稿件;可能泄露合作单位未授权信息的段落;带真实署名和单位信息的完整投稿版本。

可上传:经改写和删减后的通用性问题,例如“这段方法学描述的逻辑是否清晰”“这句话是否存在英文表达问题”。可以把具体细节剥离后,只上传单一段落或句式,但前提是该段落不暴露未公开核心内容,也可用虚构数据替换后请AI检查语言。

操作方式:需要提高语言表达时,优先使用句子级、段落级的问题描述,而不是整篇投喂。若不得不处理包含研究内容的段落,先摘出存在问题的句子,确认句中不含可识别的实验数据、个人标识或未公开结论,再上传。保留修改对照和问题描述记录,标注哪些内容经过AI工具处理。

阶段五:投稿前准备

常见风险:把包含作者信息、单位排名、利益冲突声明、致谢名单和个人联系方式的投稿文件,或期刊系统截图、审稿意见、返修信上传到AI工具。

不可上传:作者真实姓名、单位、职称、联系方式、致谢对象的个人信息、审稿人身份信息、未公开的同行评审意见、期刊系统的登录信息。

可上传:已发表文献的格式核对信息、公开的期刊投稿须知、不涉及敏感信息的模板问题;如果只需检查格式,可以上传去掉作者信息和致谢后的结构框架,但要确认正文部分不再含有可识别的作者信息。

留痕动作:对于允许披露AI使用情况的期刊,在投稿信或声明部分按期刊要求说明AI工具的使用阶段和用途,如“用于语言润色和结构建议,未用于生成原始数据或研究结论”。记录AI工具名称、使用时间和使用范围,与最终提交的披露表述保持一致。

一份可执行的自查清单

在每次点击上传之前,可以按以下顺序完成判断:

  1. 是否包含个人身份信息或研究参与者数据?
  2. 是:先脱敏,重新判断是否仍有识别风险;若无法脱敏,不上传。
  3. 否:继续下一步。
  4. 是否包含未公开科研内容?
  5. 是:确认是否获得明确授权;未获授权则改写或不上传。
  6. 否:继续下一步。
  7. 是否包含学校或期刊系统的账号、凭据、审稿信息或内部评审意见?
  8. 是:一律不上传。
  9. 否:继续下一步。
  10. 上传范围是否已经最小化?
  11. 若可只传段落、句式或描述性问题,不传完整文件。
  12. 是否已经记录本次处理?
  13. 记录上传时间、材料类型、脱敏规则或改写方式、使用目的。

如果某一步无法给出肯定回答,安全做法是暂时不上传,先改换成可接受的替代方式,再继续推进写作。判断的核心不是“一次上传会不会立刻出问题”,而是“一旦上传,自己是否还能对数据流向和使用边界保持清晰可控”。

需要注意的是,《学术出版中AIGC使用边界指南3.0》提供的是原则性框架,不同高校、科研机构、伦理委员会和期刊可能有更严格或更具体的要求。实际操作应以所在单位现行规定、知情同意书约定和期刊最新政策为准,本清单作为自查工具,不替代任何正式合规审查。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。