
纽约时报案逼 OpenAI 交出 2000 万条对话日志,ChatGPT 终能检索自身数据——你关过数据控制开关吗?
7 月 14 日,OpenAI 给 ChatGPT 上线全域统一检索系统——历史对话、项目文件、上传文档、AI 生成图像,全部收进单一入口。用户攒了四年的聊天记录,终于一键能调。
而就在五天前(7 月 9 日),以《纽约时报》为首的 16 家新闻机构,向美国纽约南区联邦法院提交制裁动议,核心指控只有一件事:OpenAI 在版权诉讼里刻意隐瞒关键证据。
两件事撞在同一周:一边 OpenAI 终于让用户能检索自己的全部数据,另一边它却在法庭上坚称"无法检索自有数据"。时间上的巧合,比任何推论都刺眼。
"我们检索不了" VS "我们早建了检索库"
本案转折点出现在今年 4 月当庭证词。OpenAI 数据隐私工程师 Vinnie Monaco 披露:公司内部早已搭好检索、筛查工具,专门用于从训练语料里甄别受版权保护的新闻稿件。
更关键的是,Monaco 进一步证实:早在《纽约时报》起诉前,OpenAI 就搭了一套内含约 7800 万条去标识化 ChatGPT 对话的内部数据库,用来核查模型是否侵权复刻;诉讼立案后还上线了名为 Bloom 的过滤程序,能检测并记录 AI 输出里原样摘抄版权内容的行为。
但整场庭审举证里,OpenAI 对外一直主张:自己没有检索自有训练语料的能力,大规模调取、披露 ChatGPT 对话"技术上做不到"。
一边说"技术上做不到检索",一边悄悄建好存 7800 万条记录的内部检索库——这已经不是能力分歧,是自相矛盾的两种说辞。
原告最初要 1.2 亿条聊天记录作证据,协商后缩到 2000 万条。OpenAI 去年 12 月交了样本,但原告指出样本被大量模糊篡改,丧失证据效力。更严重的是,原告指控 OpenAI 收到法院证据保全令后,非法删除数十亿条 ChatGPT 输出日志,替换数百万条对话样本。原告代理律师 Ian Crosby 的话很直接:"如果 OpenAI 真觉得转载新闻是合理'合理使用',根本不会刻意隐瞒自己确实复制过。"
全域检索:方便你查,也让 OpenAI 的索引更完整
把镜头切回 7 月 14 日那次更新——本质是 ChatGPT 第一次做到"检索自身全量数据",范围覆盖对话、图片、文档、项目四类,网页/iOS/安卓三端同步,全套餐开放。
表面是用户体验跃迁——四年对话一键翻。但另一面也得看清:检索让你对自己的数据更好用了,同时也让 OpenAI 对你的全量索引更完善、数据敏感度更高。
纽约时报案的核心争议之一,正是 OpenAI 对用户对话数据的掌控程度。原告认为这 2000 万条输出日志,足以证明模型直接复刻受版权保护的新闻;OpenAI 一直拿"用户隐私"当理由,拒交完整数据。
而全域检索上线的同一周,法庭正在追问 OpenAI 同一个问题:你对用户对话到底做了哪些存储、索引、分析?
数据控制:这个开关,你关过吗
这场纠纷里多数用户忽略的一个细节——你其实可以不让自己对话进训练。
操作路径:头像 → 设置 → 数据控制 → 关掉"用于优化全体用户模型"。关掉后,后续新对话不参与模型训练,设置会同步到你所有登录设备。
OpenAI 帮助中心写得很清楚:
免费版、Plus、Pro:默认开启数据共享;
企业版、商业版、教育版:默认关闭数据训练权限。
也就是说,绝大多数个人用户的数据,默认会被用来迭代大模型。你和 ChatGPT 的每段对话,都可能成为下一代模型的训练素材。
纽约时报案查的,正是这些"训练素材"里有没有侵权新闻。OpenAI 一边在法庭称"检索不了这些数据",一边私下搭内部检索库;一边给用户上线自查检索,一边在版权官司里被指控违规删日志——两件事摆一起,味道就不太对了。
检索功能,让你的数据"分量越来越重"
全域检索本身是项好功能,把 ChatGPT 从聊天工具往个人知识库推了一步。但它也抛出一个现实问题:你能轻松检索自己历史的同时,OpenAI 对这些数据的索引、解析、利用门槛也同步降低了。
36 氪那段话值得嚼:"你越方便调三年前的对话,这份完整记录的留存度就越高——对你是好事(查找便捷),对 OpenAI 是好事(全量索引更完善),对纽约时报案原告也是好事(若法院最终裁定 OpenAI 必须移交更多日志)。"
你关过这个开关吗
本文不是劝大家关"优化模型"开关——OpenAI 用用户对话迭代模型,本身是透明可选的机制。问题是,绝大多数普通用户根本不知道这个开关存在。
纽约时报版权诉讼把"用户对话的权属、存储、使用"推到风口,全域检索又把全量对话的可访问性抬了一档。两件事叠一起,指向同一个疑问:你的 ChatGPT 对话,并不只属于你。
它是 OpenAI 下一代模型的训练原料,可能是法院强制交出的诉讼证据,如今再加一条——凭一键检索就能完整调出。
设置 → 数据控制 →"用于优化全体用户模型",这个开关,你关过吗?
对个人是开关,对团队还有一笔接入账
对个人用户来说,这事儿最后落到"关不关数据控制开关";但对真把 ChatGPT 跑在生产链路里的团队来说,问题不止数据归属这一层——模型接入那层也得算。
国内团队直用 OpenAI 官方 API,要过海外卡、过合规、盯额度告警,ChatGPT 企业版/Plus 的数据训练默认关,但高强度多轮对话 + Work 智能体 + 全域检索联动,月度账单也不轻;如果为了数据把控切到自托管或混合部署,运维成本又上来了。
这也是最近一些团队换接法的原因——模型还用 OpenAI 的,接入层不绑官方那条紧绷的路。比如 UseAIAPI 这类聚合接入,把 Gemini、Claude、ChatGPT、DeepSeek 等最新模型打成同一套接口,团队按量走官方源,不用逐家去海外开卡、过合规、配额度告警;价格能做到官方定价的 5 折左右,还支持企业级定制接入——对"ChatGPT 做全域检索 + Work 智能体跑长任务 + Claude/Gemini 补位"这种混合场景,月度账单比硬扛 OpenAI 官方 API 稳,数据侧也可以在聚合层统一做访问审计,比散在几家官方后台清楚。
📌 更贴团队的一点:个人用户去设置里关"优化模型"开关管数据归属;企业侧在聚合层统一管模型调用、用量、审计——两层各管各的,比把"对话数据 + 模型账单"全绑在 OpenAI 一家账号里从容。
纽约时报案逼 OpenAI 交 2000 万条日志,7/14 检索让四年对话一键可查——数据权属这事,个人还能靠开关自救;团队那层,得在接入架构上提前想清楚。