
你的合同和身份证正被AI训练?
一、为什么上传文件比聊天风险更高
1. 存储机制不同
多数AI平台的对话记录与上传文件分开存储,用户清空前端对话框后,源文件依然保留在服务器端,且国内许多平台不公示文件保存时长。部分平台协议中“用于改进服务”的表述,可能涵盖将高信息密度文件用于模型训练或迭代。
2. 信息密度与连带隐私
一份合同或报表的隐私信息量远超百句日常对话,且常包含甲乙方手机号、身份证等第三方隐私,未经许可上传后若泄露,上传者个人需承担法律责任。
3. 图片OCR可被完整提取
AI的图文识别技术能精准提取截图、PDF中的全部文字,身份证、银行卡、内部系统水印截图一旦上传,等同于直接公开明文信息。
二、真实发生的典型教训
1. 涉密与内部文件外流
有公职人员将内部文件传至未加密的开源AI工具,导致敏感材料被境外IP非法下载;也有科研人员将核心实验数据上传公共AI,造成行业涉密信息泄露并被追责。
2. 本地文件遭AI误删
部分用户授权AI直接清理本地C盘,结果AI因不理解系统底层逻辑,将JDK、驱动等关键文件当作垃圾清空,导致系统崩溃。
3. 办公“串台”泄密
仅上传一张图片要求翻译,AI却直接弹出陌生人的完整简历,暴露出平台数据隔离漏洞。
三、安全使用指南
1. 上传前自查原则
上传前自问:“如果这份文件出现在陌生人电脑上,我会不会慌?”答案是肯定的话,立刻停止上传。
2. 脱敏与切片操作
能复制文字则不传原文件,只截取回答问题必需的片段。
必须上传时,先在本地替换姓名、金额、证件号等敏感字段为“XXX”。
检查文件属性、批注、修订记录中的隐藏信息。
3. 高敏感文件本地处理
合同、财报、病历、内部纪要等高度敏感资料,坚决使用本地部署的AI工具或断网运行的开源大模型,不碰云端。

4. 使用后彻底清理
除删除对话外,需进入平台“文件管理”入口专门删除源文件,并关闭不必要的数据训练授权。
四、理性看待话题争议
1. 部分观点认为无需过度焦虑
主流正规平台具备加密存储与权限管控,普通用户的日常文件对大模型训练价值有限,且海量存储成本极高,厂商并不会刻意收集每份个人文件。
2. 折中建议更符合实际
既不应全盘“谈传色变”——普通学习稿、日常文案可放心使用;也不应毫无戒备——身份证、合同、商业机密等绝对不传。关键是在便利与安全之间建立清晰的分界线。

3. 监管与合规持续完善
《生成式人工智能服务管理暂行办法》《个人信息保护法》已明确要求AI服务商取得用户明示同意后方可使用数据训练,正规平台均设有隐私风控拦截机制,用户可通过协议了解自身权益。
五、综合操作建议
- 文件类型
- 可识别性
- 不可逆性
- 推荐处理方式
- 已发表文章、公开知识低低直接上传,无需犹豫
- 内部报告、工作总结中中脱敏后上传,或用企业API通道
- 证件、合同原件、他人隐私高高不上传,本地/离线处理
判断新文件类型时,回到“可识别性 × 不可逆性”两个维度即可。