虎嗅

OpenAI被指隐匿关键证据,《纽约时报》案的合理使用抗辩悬了?

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

纽约时报在与OpenAI的版权诉讼中,指控OpenAI隐匿关键用户对话日志、误导法院(谎称无法搜索训练数据中的版权内容)、甚至删除数十亿条记录,要求法院严厉制裁。这些日志是OpenAI“训练用版权内容属合理使用”抗辩的核心证据,若隐匿行为属实,不仅会面临法律制裁,其核心抗辩可能直接垮掉——中美法律均对诉讼中隐匿/销毁证据有严厉处罚,谷歌曾因类似行为输掉垄断官司,中国法律也有罚款、拘留甚至刑事追责的规定。

一、纽约时报为啥要“制裁”OpenAI?

简单说,OpenAI在证据环节耍了“小聪明”,被抓了现行:

  • 日志交付掺水:双方约定OpenAI提供2000万条匿名用户对话日志(用来核实ChatGPT是否用了NYT版权内容、是否输出过原文),但OpenAI交付的日志被高度编辑,根本没法用。
  • 撒谎被戳穿:OpenAI之前跟法院说“没法搜索训练数据里有没有NYT内容,成本太高还侵犯隐私”,但自家工程师不小心透露——早在诉讼前,公司内部就搜过这些内容。
  • 销毁证据:NYT指控OpenAI在诉讼后删了数十亿条对话记录,违反法院“保存证据”的命令。

NYT要求法院的制裁措施很狠:要么不认这些没用的日志,要么直接推定被藏/删的日志内容对OpenAI不利(相当于默认NYT说的是真的)。

二、这些日志为啥是OpenAI的“命门”?

OpenAI的核心抗辩是“合理使用”——“我训练ChatGPT是学语言规律,不是抄原文;输出是新内容,偶尔复现原文是技术漏洞”。但日志能直接打它的脸:

1. 训练数据里有多少NYT内容?

如果日志显示训练集里有大量完整的NYT新闻,法院会问:OpenAI是不是非用这些不可?有没有合法渠道买版权?会不会抢NYT的生意?

2. ChatGPT是不是经常输出原文?

OpenAI说“复现是罕见错误”,但如果日志证明ChatGPT经常精准复现NYT文章细节,就说明它不仅学了语言,还偷偷存了原文。商业场景下频繁输出原文,就不是“转换性使用”(新内容),而是替代NYT的内容,侵权实锤。

3. RAG模式的额外风险

ChatGPT的RAG模式会实时搜外部资料生成答案。如果日志显示它直接抓取NYT文章给用户(超出合理摘要范围),那每次输出都是新的侵权——不能只拿“训练合理”当挡箭牌。

4. OpenAI是否明知故犯?

如果日志证明OpenAI早就知道输出侵权的风险,却跟法院说“不知道”,那法院会觉得它不诚实,所有辩解都没人信。

三、国外隐匿证据的后果:谷歌的“血教训”

之前Epic公司告苹果和谷歌垄断(因为游戏绕开应用商店收费被下架):

  • 谷歌输了:法院发现谷歌聊天记录会自动删除,认定是故意毁证据,让陪审团“推定被删内容对谷歌不利”。结果陪审团判谷歌垄断。
  • 苹果赢了:苹果没被发现毁证据,即使系统更封闭,也没被判垄断。

这说明:诉讼中耍手段藏证据,可能比案件本身的事实更能决定输赢。

四、在中国隐匿证据会怎样?

中国法律也不手软:

  • 举证推定:如果一方手里有证据却不肯交,对方说这证据对它不利,法院就直接认定对方说的是真的(比如OpenAI藏日志,法院就默认日志内容支持NYT)。
  • 处罚措施:伪造、销毁证据,法院可以罚款(个人最高10万,单位最高50万)、拘留(最多15天);严重的还会构成“妨害作证罪”或“帮助毁灭、伪造证据罪”,坐牢。
  • 证人伪证:证人作虚假陈述,也会被罚款、拘留。

所以诚实交证据是诉讼的“底线”,耍小聪明会吃大亏。

五、对OpenAI的终极影响:“合理使用”抗辩可能垮掉

OpenAI不肯交完整日志,本身就说明日志对它不利。不管法院是强制它重新交,还是直接推定日志内容支持NYT,OpenAI的“训练用版权内容属合理使用”抗辩都很难站住脚。

这案子的结果不仅影响OpenAI,还会给整个AI行业敲警钟:用版权内容训练AI,不能靠“藏证据”蒙混过关,得找到合法的解决方案(比如买版权、用开源内容)。否则,再牛的技术也会栽在法律细节上。