展开知识库目录

研究材料能不能上传 AI:先核对伦理、知情同意和敏感数据边界

研究材料能否交给 AI,不能只看有没有姓名。先核对伦理批件、知情同意、数据分类、合同和平台处理方式,再决定不上传、使用脱敏最小样例还是经批准处理。

先看上传以后才意识到的问题

访谈稿删了姓名就上传 AI,总结里却仍能认出受访者是谁

研究者把教师访谈稿中的姓名替换成编号,认为已经匿名,于是上传到一个未经过机构批准的在线 AI 工具。文本里仍保留学校、院系、职务、具体项目和罕见经历,熟悉该单位的人可以轻易重新识别;原知情同意书也只写了研究团队分析,没有说明第三方平台处理。

删除直接标识符不等于匿名,更不等于自动获得新的处理权限。上传前要同时检查研究伦理、知情同意、法律与合同、机构数据分类、平台保存和训练政策以及跨境问题。任何一项依据不清楚,都应停在确认阶段,改用虚构样例、字段定义、汇总数据或经批准的本地环境。

  • 判断材料属于哪类风险
  • 确定审批与同意是否覆盖当前用途
  • 选择最小必要、可审计的处理方式
先按数据而不是任务分类

同样是“让 AI 总结”,输入不同,决定可以完全相反

材料类型主要风险默认动作继续前必须确认
已公开且允许使用的资料版权、许可、版本和错误传播可在许可和工具政策范围内处理来源、许可、是否含仍受保护的个人信息
未公开论文、基金稿或合作材料保密、知识产权、优先权和合同未获明确授权不上传外部服务所有者、合作协议、期刊或基金保密要求
普通个人信息超出同意用途、泄露、重识别先做最小化和去标识,再核对批准环境处理目的、同意范围、数据接收者和删除机制
敏感个人信息或医疗、未成年人等高风险数据对个人权益造成更高风险没有明确伦理与机构批准时停止外传必要性、单独或特别同意要求、访问控制和影响评估
去标识但可链接资料通过地点、时间、罕见事件或密钥重新识别仍按受限数据处理,不称为完全匿名重识别风险、密钥隔离、允许接收者和组合数据
虚构样例或聚合统计仍可能复制真实细节或泄露小群体优先用于测试流程是否真正虚构、聚合单元是否足够、输出能否反推个体

本表是上传前的风险筛查,不构成法律或伦理审批意见;具体要求以研究所在地、机构和项目文件为准。

依次核对五道门

工具好不好用排在最后,先确认有没有权利把材料交给它

  1. 01

    回到伦理批件和研究方案

    确认当前研究、数据类型、分析方式、协作者和第三方处理是否在批准范围内。新增 AI 处理若改变风险或数据流,按机构流程咨询是否需要修正或重新审查。

  2. 02

    逐条核对知情同意

    查看参与者被告知的数据用途、接收者、保存期、撤回、二次使用和跨境安排。研究参与同意不能被自动解释为同意所有新工具。

  3. 03

    确认数据所有权与合同

    检查医院、学校、企业、合作单位、资助方和期刊的保密及数据处理条款;项目成员能访问不等于可以交给外部服务。

  4. 04

    审查平台的数据流

    核对服务提供者、部署地区、保存期限、日志、模型训练、子处理者、删除、权限与审计。不要只凭‘企业版’‘不训练’等营销短语下结论。

  5. 05

    把输入缩到完成任务所需的最少

    能用字段名、虚构行、局部片段或汇总数解决时,不上传整库。去标识后还要做重识别风险检查,删除与任务无关的时间、地点和罕见描述。

  6. 06

    记录批准、输入、输出和删除

    保存工具与版本、审批依据、输入类型、访问者、用途、输出复核人、保存位置和删除证据。AI 输出仍可能泄露或错误,不能直接进入临床、人事或纪律决定。

不能上传时任务仍可继续

把方法问题和真实数据处理拆开,通常能找到更低风险的路径

只需要设计方法

使用字段字典和虚构样例

让工具根据变量含义、类型和人工构造的几行数据提供代码框架,不提交真实记录。生成后在批准环境中由研究者运行和核对。

需要处理真实材料

转到获批的本地或受控环境

根据机构要求使用本地模型、受控计算区或签有合适协议的服务,并限制访问、日志和导出。工具部署位置本身不能替代伦理批准。

仍无法确定边界

暂停并提交具体数据流图

向伦理、数据保护、法务或信息部门说明输入、接收者、地区、保存、输出和删除,而不是只问‘能不能用某某 AI’。

上传按钮前的最终确认

任一项没有文件依据,就不要用真实材料试试看

本篇依据

伦理、法律和机构要求需要同时满足,不能相互替代