wikiHow 起诉 OpenAI,理由是 OpenAI 用 wikiHow 的文章训练 GPT 模型,没有获得授权。这个案子在法律上不会很快出结果,但它把 AI 行业始终绕不开的问题直接摆到了台面上:大模型训练时用的大量公开网页文本,到底能不能直接拿去训练?如果内容作者主张权利,应该从哪个环节切入?
本文不准备把诉讼细节复述一遍,而是从技术、版权、数据合规三个角度拆一个问题:当一家大模型公司把全网文本爬进训练集时,版权风险到底发生在哪里,以及内容方、开发者、普通用户分别该怎么应对。
1. 先看争议焦点:训练 GPT 时用了 wikiHow 文章,问题出在“训练”这一步
1.1 wikiHow 是什么,为什么它的内容会被训练语料看重
wikiHow 是一个图文教程类网站,覆盖面很广,从修电脑、做饭、整理房间到各种生活技能,每篇文章通常有清楚的步骤说明、条目化的操作建议和配图。这类内容有两个特点:数量大,结构规整,而且“自然语言指令”密度高。
对训练大模型来说,这种内容很受欢迎。模型需要大量文本学习语言规律、指令形式和常识推断,wikiHow 这类网站相当于现成的“一步一步教你做某事”语料,和后来常见的“指令微调”数据在形态上有相似之处。所以不只是 OpenAI,很多做预训练和指令微调的团队都会把这类公开网页纳入候选数据源。
原告的主张方向也不难理解:你没有经过我同意,就把站内文章抓走、整理、放进训练集,再用来训练一个商业大模型。问题不在于某一个生成结果是否原样复制了某篇文章,而在于训练过程本身使用了这些受版权保护的内容。
1.2 数据在训练流程里究竟经历了什么,为什么会产生复制问题
要理解这个争议,先要区分“训练”和“生成”两个阶段。
训练阶段,模型要读取海量文本,把文本切分成 token,转换成向量,不断调整模型参数。这个过程中,训练集通常会被完整保存在本地硬盘上,文本会被批量加载进内存,反复读取。也就是说,即使最终模型不会逐字复述原文,训练阶段也必然会对文章做复制、存储、整理和加工。这在版权法上非常关键。
生成阶段则不一样。模型收到用户提示后,根据学到的概率分布逐步生成 token。它不是在“查数据库”,也不是把某篇文章原样抽出来。大多数时候输出的是融合了大量语料统计规律后的结果。只有在某些情况下,模型会“记住”训练语料里的长句甚至整段内容,并被用户诱导输出出来。
所以很多 AI 公司会说“模型不会记住每一篇文章”。这个说法本身没错,但它回避了训练阶段的数据复制问题。版权的争议点恰恰发生在训练阶段:你把文章放进训练集的那一刻,复制行为就已经发生了。
1.3 这起纠纷可能同时踩中版权、合同和服务条款三条线
类似诉讼通常不会只告一个“著作权侵权”,一般会混合多个法律路径。
第一是版权侵权。原告需要证明文章属于著作权法保护的作品,被告未经许可实施了复制、改编等行为。对 wikiHow 来说,单篇文章的步骤性描述有一定独创性,配图和版式也能成为独立保护对象。
第二是违反服务条款。网站通常会写明“未经授权不得抓取内容用于商业用途”。如果爬虫在抓取时已经违反了网站条款,原告可以主张违约,或者把条款作为被告“明知未经授权”的证据。
第三是数据库权利或不正当竞争。有些法域对数据库有专门保护,有些则通过反不正当竞争来回应“大量抓取他人平台数据”的行为。
多条路径一起主张,是这类案子很常见的设计。原因很简单:单打版权认定有难度,合同、条款和数据抓取行为能提供更多攻击角度。
2. GPT 训练的数据流水线:从网页到模型的几个环节,版权触点在哪
2.1 一条典型的训练数据流水线
无论用 GPT、Llama 还是其他开源模型重新训练,数据处理流程大体相似,主要几步是这样的:
- 数据采集。通过爬虫抓取公开网页,或直接下载 Common Crawl、网页转储等公开数据集。
- 数据清洗。去掉 HTML 标签、低质量文本、重复内容,过滤色情暴力内容,也可能去掉某些域名。
- 格式转换。把清洗后的文本整理成统一格式,常见做法是一行一段,或保留标题和正文结构。
- 分词与编码。把文本切分成 token,生成训练样本,这一步会构建词表或训练 tokenizer。
- 预训练。用训练样本更新模型参数,这个过程会反复读取文本内容。
- 后处理。包括监督微调、人类反馈对齐、评测筛选等。
- 部署。模型上线提供服务,用户通过 API 或对话界面调用。
版权触点最集中的是第 1 到第 4 步。采集是把网页内容变成自己的副本,清洗是把副本保留下来,格式转换和分词是把原始表达转换成另一种形式。到第 5 步训练时,模型已经在反复学习这些内容了。
2.2 每个环节的版权触点
这里用一个表格把问题说得更清楚:
| 数据流水线环节 | 是否涉及复制 | 潜在版权问题 | 常见抗辩 |
|---|---|---|---|
| 网页抓取 | 是 | 未经许可下载作品副本 | 公开可访问、robots 允许 |
| 数据清洗 | 是 | 保留、筛选、整理作品 | 技术处理必要步骤 |
| 格式转换 | 是 | 对作品进行转换和重组 | 机器读取、非人类阅读 |
| token 化 | 是 | 将文本切分并映射成数字 | 不直接暴露原文 |
| 预训练 | 是 | 反复读取并学习作品表达 | 合理使用、转换性使用 |
| 微调 | 是 | 使用特定领域数据继续学习 | 已获授权或合理使用 |
| 生成输出 | 不确定 | 可能逐字复制或高度相似 | 模型生成、非训练复制 |
其中“生成输出”是否侵权,取决于输出结果和原作品之间是否构成实质性相似,以及这种相似能否归因于训练数据。现在很多原告会专门去测模型能不能“背诵”指定文本,用来证明训练数据包含自己的作品。
2.3 公开可访问,不等于可以随便训练
一个很容易混淆的地方是:网页是公开的,搜索引擎可以抓取,用户可以直接访问,那么 AI 公司也能拿来训练吗?
从版权法角度看,公开可访问解决的是“获取途径”,不是“使用授权”。作者把文章发在网上,通常只是允许公众阅读、分享,并没有当然授权别人下载后用于训练商业模型。就像我公开演讲,不代表听众可以把录音拿去训练语音模型。技术上的可及性和法律上的授权是两回事。
当然,版权法并不是保护所有内容。事实、思路、操作方法本身不受版权保护,被保护的是具体的文字表达和独创性编排。wikiHow 的文章有很多事实性步骤,但这不等于整篇文章都不受保护。同样的操作步骤,换一种写法,照样可能有独创性。
2.4 文本、事实、表达三者的区别
大模型训练中,最难判断的其实是“模型到底学到了什么”。
如果模型学到的是“醋和小苏打可以疏通下水道”,这是一个事实或生活常识,原作者不能垄断这个知识。如果模型学到了“作者用了一种很有趣的比喻来描述疏通过程”,并且生成的文字和原文高度相似,这就可能涉及表达层面的侵权。
所以诉讼中不会因为“训练数据里有 wikiHow 文章”就直接判 OpenAI 侵权,还要看文章是否构成作品、训练行为是否复用了表达、合理使用抗辩是否成立。这也是这类案子周期很长、不确定性很高的原因。
3. “合理使用”为什么是本案最大的不确定项
3.1 合理使用的四个判断维度
在讨论 AI 训练数据侵权时,最常被拿出来救场的是“合理使用”。这个概念在美国版权法里有明确判断框架,主要看四个因素:
- 使用目的和性质。是商业使用还是非商业使用?是转换性使用还是直接替代原作品?
- 被使用作品的性质。作品是事实性内容还是高度创造性内容?
- 使用的比例。使用了多少内容?是否使用了核心部分?
- 对原作品市场的影响。是否会影响原作的市场价值、授权收入或潜在流量?
这四个因素不是“三票胜两票”的简单题,而是法官综合权衡。
3.2 在 GPT 训练场景下如何争论
放在 wikiHow 起诉 OpenAI 这个场景里,双方都会有自己的解释。
支持 OpenAI 合理使用的一方会说:模型不是把文章原样提供给用户,而是用海量文本学习语言统计规律,这是“转换性使用”,不会替代 wikiHow 的阅读流量。
支持 wikiHow 的一方会说:你是在全球范围内大规模复制网站全部文本,目的是训练一个商业产品,而且如果用户要求模型生成“某某教程”,模型输出可能在结构和内容上直接替代 wikiHow 的页面,这会损害原网站的真实广告和授权市场。
目前没有能覆盖所有 AI 训练场景的统一答案。不同法院在具体案件里,可能会得出完全不同的结论。这也解释了为什么 OpenAI 等公司在某些案件里愿意和解,而不愿意把最终判决拖到不可控。
3.3 不同法域的差异
如果你关注过 AI 版权问题,会看到各司法辖区的态度并不一致。
美国有比较灵活的合理使用制度,法官会做综合权衡。欧洲一些国家在文本和数据挖掘领域设置了一定例外,但商用场景的限制更多。部分亚洲国家和地区目前没有专门的训练数据例外条款,更多是回到传统著作权法判断。也就是说,同样一个爬虫数据集,在美国训练和在欧洲数据库里训练,法律风险可能完全不同。
对一个使用开源模型做二次训练的技术团队来说,不能默认“代码开源了,训练数据也能随便用”。模型权重开源和数据许可开放是两件事。很多开源模型只开放了模型权重,训练数据集要么不公开,要么有额外限制。
3.4 合理使用不是一句免责咒语
我在看技术社区讨论时经常看到一个误区:只要我说“这是合理使用”,好像就不用担心侵权了。
实际上合理使用是一个防御性抗辩,不是事先获得的授权。它意味着被告承认确实使用了原告作品,但主张这种使用在法律上是合理的。这个判断需要放在具体事实里做,而且每个因素都能被双方拿出大量证据拉扯。对创业团队和中小开发者来说,把整个产品押在“合理使用”上,风险很高。
更稳妥的做法,是在项目启动前就梳理清楚数据来源,明确哪些数据允许商用、哪些只能做研究、哪些需要额外授权。
4. 版权诉讼之外,内容方和开发者现在能做的合规动作
4.1 内容站长:用 robots.txt、服务条款和证据留存降低风险
如果你运营一个内容网站,不希望自己的文章被收集进大模型训练集,可以分几步处理。
第一步,在 robots.txt 里声明禁止 AI 爬虫。这里是一个通用示例:
User-agent: * Disallow: /wp-admin/ # 禁止常见的 AI 爬虫 User-agent: GPTBot Disallow: / User-agent: CCBot Disallow: / User-agent: anthropic-ai Disallow: /需要注意,robots.txt 本质是技术约定,主要靠爬虫自觉遵守。它可以在一定程度上减少抓取,但不是版权授权文件,也不能完全阻止所有爬虫绕过。
第二步,在网站服务条款里写清楚:禁止未经授权的抓取、存储、加工、训练等行为。这一步非常重要,因为它把“使用授权”和合同约束绑在一起,将来维权时可以作为证据。
第三步,保存证据。定期保留服务器访问日志、被抓取记录、网页快照。如果发现某个 IP 或爬虫在短时间内大量抓取页面,可以截图或导出日志。这些证据在投诉或诉讼中非常关键。
第四步,如果想给合法使用者留口子,可以增加一个“许可申请”通道,比如在页面底部写清楚联系邮箱。愿意付费授权的机器人服务商可以直接联系,而不是逼着所有抓取都走灰色路径。
4.2 开发者:给训练数据建一套“来源清单”和“许可证审计”
对做模型训练、微调、RAG 检索增强的技术团队,我建议从第一天起就做数据来源管理,而不是等收到投诉再做。
一个简单但有效的做法是:每个数据集建一个配置文件,记录来源 URL、抓取时间、许可类型、是否允许商用、联系人信息。这份清单叫 dataset card 也好,数据集清单也好,核心目的是让团队知道“这些数据是从哪来的”。
许可类型至少要分成几类:
- 完全开放,可以商用。
- 可以研究使用,但不可商用。
- 可以部分使用,但需要署名。
- 明确禁止训练或抓取。
- 来源不明,不确定权利状态。
对于“来源不明”的数据,宁可不用。很多事故都不是因为模型能力不行,而是因为团队拿着来历不明的数据直接开跑,最后产品上线前被内容方投诉。
4.3 输出侧能否追责:相似度、记忆检测和溯源
除了在输入端规避风险,还可以在输出端增加一层检测。
一种做法是相似度检测。把模型的输出结果和原始训练数据做模糊匹配,如果一段输出和某个网页高度重合,就标记为风险内容。这种方法适合内容发布平台,也可以作为生成内容的内部质检环节。
另一种做法是记忆检测。用一组“隐私探针”问题去测试模型是否背出了特定文本,比如某篇新闻的完整段落。如果模型能原样输出,说明它对特定文本产生了“记忆”,这对 RAG 应用来说可能是质量问题,对版权合规来说也是风险信号。
对很多中小团队而言,不需要训练自己的检测模型。可以先用一个简单的项目:准备一批敏感样本,批量询问模型,用相似度算法计算输出和原文的重合度。不需要精确到逐字匹配,也能发现明显问题。
4.4 授权合作和 opt-out 机制正在成为行业标配
从行业趋势看,数据授权已经不只是版权律师的话题,而是商业合作的一部分。现在已经有媒体集团、图片库、代码托管平台、学术出版商和 AI 公司签署数据授权协议,由平台方代表内容作者向模型厂商提供合法训练数据,并收取费用。
另一种是 opt-out 机制:内容方主动声明“不要把我的内容用于训练”,模型厂商在数据采集时排除这些来源。这种机制在技术上是可落地的,但效果取决于厂商是否真的遵守,以及“退出”程序是否足够简单。
对独立内容创作者来说,单个作者很难和大公司谈判。更现实的方法是:
- 在作品发布时明确版权声明。
- 在平台设置里尽可能选择“禁止 AI 爬取”的选项。
- 保存创作过程记录和发布时间。
- 发现输出内容与自己文章高度一致时,保留截图和链接。
先别急着写长篇律师函,先把证据链做清爽。
5. 这个案子真正值得关注的是什么
5.1 诉讼短期不会终结,但会改变整个行业的数据合规水位
wikiHow 起诉 OpenAI 这类案件,最值得关注的不是“谁赢了”,而是它会倒逼行业把训练数据问题从黑盒变成可讨论的流程问题。
过去几年,很多团队拿到数据集的第一反应是“能不能跑出好效果”,很少问“这些数据从哪来、允许我这么用吗”。大模型时代,数据来源和版权状态直接关系到产品能不能上线、能不能商用。一个训练时的疏忽,可能变成上线前最麻烦的法律风险。
所以我会把这类诉讼看成一次行业规范教育。它提醒所有人:大模型是一台需要大量食物才能运转的设备,但食物来源必须有票据。
5.2 对不同角色的实际影响
如果你是应用开发者,只调用大模型 API,不自己训练模型,风险相对小。你处理的是输入和输出,而不是训练集。你仍然要注意输出内容是否明显复制了某个来源、是否侵害第三方的既有权利,但训练数据版权问题主要在模型服务商那一侧。
如果你自己微调模型,或收集数据做 RAG,就要把数据来源和数据许可当重点。很多自动化采集工具把网页抓下来就灌进知识库,连出处都没存,这是很危险的。建议在采集端就把 URL、采集时间、作者、许可状态一起存下来。
如果你运营内容网站,前面说的 robots.txt、服务条款、日志留存、证据固定要尽快做好。就算目前没有发现有人拿你的内容训练,也要在技术上保留追责能力。
如果你是普通用户,用 AI 生成内容发布到公共平台之前,做个最基本的检查即可:如果生成结果明显是某篇报道或教程的复述,不要直接商用。用搜索引擎搜索关键句,看有没有一模一样的长句。不用过度担心,但也不要在明知高度重合时拿去卖钱。
5.3 后续观察清单
这个案子和其他类似案件往后推进,我会重点关注几个信号:
| 观察点 | 说明 |
|---|---|
| 原告是否要求被告披露训练数据集构成 | 如果法院允许,会有更大范围的数据合规讨论 |
| 被告是否公开列出删除的训练数据来源 | 这会影响 opt-out 机制的可信度 |
| 是否会有内容平台和模型厂商达成新授权协议 | 授权价格会成为行业基准 |
| 法院是否对“转换性使用”做明确判断 | 这会影响后续所有大模型训练诉讼 |
| 训练数据供应商是否加强数据源审计 | 数据中间商会变成新的合规节点 |
这些信号比具体某一笔赔偿金额更有长期价值。
5.4 我的态度
我的判断是,长期来看大模型训练不可能完全避开版权内容,但也不可能继续靠“全网随便爬”来维持商业产品。中间路线是清晰的:内容方保留选择权,模型厂商提供可验证的授权记录,数据中间商负责清洗和溯源,工具链帮助自动检测风险内容。
对普通开发者,我更建议把数据合规当成工程问题来做。不要只在收到律师函时才去翻数据来源,而是从项目第一天开始就保存记录、建立清单、训练前审计、输出后检测。这套流程能给的不只是安全感,也是将来面对疑问时拿得出证据的能力。
这个案子开庭后还会有持续讨论。无论结果如何,有一点可以确定:训练数据已经不是黑盒,授权和证据会成为大模型服务的基本配置。