光年亲历录
24小时前来自 科技看点

DeepSeek聊天数据是否会被用于模型训练?

关于DeepSeek不同聊天框内容是否共享以及聊天数据是否用于模型训练的问题,官方明确表示对话内容默认不跨会话共享,但数据可能在严格去标识化处理后用于模型优化,用户可通过设置主动退出。

一、官方对“聊天框内容共享”的回应

DeepSeek官方多次明确回应:不同聊天框的内容不共享。

官方AI回复指出,每个独立对话(聊天框)之间完全隔离,一个对话中的内容不会被另一对话看到或引用。

唯一例外情况是,如果用户主动开启了“联网搜索”或“深度思考”模式,这些功能可能在当前对话中参考部分上下文信息,但依然不会跨对话共享。

用户在同一账号下切换设备(如网页版和App)时,历史记录会同步以方便连续对话,但这仅限于用户自身的账号,并非跨用户共享。

二、聊天数据是否用于模型训练

DeepSeek官方在《模型原理与训练方法说明》中明确交代了数据使用规则:

  • 项目
  • 说明
  • 数据来源训练数据大多来自公开网络或与第三方合作,模型不会主动收集个人信息,并会通过技术手段清洗隐私内容
  • 对话数据使用对话数据可能被用于微调,但官方会严格进行去标识化、加密处理,确保无法回溯到具体个人
  • 用户控制权用户可以主动退出数据用于训练的授权,官方提供了相关开关
  • 隐私政策所有对话数据按隐私政策处理,不同用户之间的数据严格隔离

三、用户对“内容共享”的实际反馈

尽管官方声明内容不共享,部分用户确实反馈遇到“记忆串门”现象:

有用户在不同对话窗口中设定不同角色名和剧情,却发现模型在同一账号下的回复中“记起了”另一窗口的小设定。

也有用户表示“完全没这感觉”,认为每次对话的模型性格都不相同,并未发现内容互通。

有用户特别测试后指出,在不同对话中询问同样的问题,得到模型关于“训练数据日期”的回答不一致,因此怀疑不同窗口可能调用了不同版本或不同参数的模型。

四、技术层面的解释

有技术博主分析指出,所谓“记忆串门”现象可能并非真正的跨会话数据共享,而是模型训练数据记忆提取问题。

某些特定输入会让模型“误以为”自己仍处在训练流程中,从而复述训练时记忆的数据片段,而不是看到其他用户的实时对话。

这种现象称为“训练数据记忆提取”(Training Data Extraction),是所有大模型都可能存在的技术特征,并非DeepSeek独有。

部分用户反馈中,模型回复中出现了“当天的日期”,这很可能是因为每个会话的系统提示词中写有当天日期,模型在续写时自然带入,而不是读取了其他用户的实时会话。

五、用户可采取的隐私保护措施

基于官方说明和行业通用做法,用户可采取以下步骤保护个人数据:

关闭数据优化授权:在DeepSeek设置中找到“数据用于优化体验”或类似开关,将其关闭。

定期清理对话记录:对隐私敏感的内容,可在使用后进入对话管理页面手动删除记录。

避免上传高度敏感信息:建议不要在对话中透露身份证号、银行卡密码等个人信息。

区分训练数据和对话临时数据:模型训练使用的是脱敏后的数据分析,不会暴露个人身份或具体聊天内容给其他人。

敏感内容脱敏处理:如需上传文件或讨论机密信息,先替换其中的姓名、电话等关键信息。

六、行业视角与规范要求

从行业整体来看,AI服务商的数据处理规则有普遍共性:

所有主流大模型都基于“Transformer+RLHF”技术架构,各家差异主要在于训练数据来源和对齐方式。

用户与AI的对话框属于“对话临时数据”,与模型训练用的“训练数据”是两套分离的系统,不会混为一体。

2025年9月1日起,《人工智能生成合成内容标识办法》正式生效,DeepSeek已第一时间响应,并发布了《模型原理与训练方法说明》,公开模型的训练机制与数据来源。

官方建议用户可随时查阅隐私政策,了解具体的数据处理规则。