版权与训练数据(copyright and training data)
/ KOP-ee-ryt and TRAY-ning DAY-tuh /
现代AI模型,靠吞下海量的文本、图像、代码与音乐来学习——其中大量是从开放互联网上抓取的,而这其中又有大量受「版权」保护,即创作者对其作品的复制行为加以控制的法定权利。「版权与训练数据」,就是由此引出的一团缠结的问题:未经询问,就把十亿张受版权保护的图像喂进一个模型,合法吗?由此得到的模型、或它的输出,构成侵权吗?又是谁——如果有人的话——欠了原创者什么?
这场争议里,藏着几个各不相同的法律问题,它们的答案也不一样。(1)「输入」之问:为训练模型而复制这些作品,本身算侵权,还是作为「合理使用」/「文本与数据挖掘」而被允许?(2)「记忆」之问:模型是否有时会吐出某些特定作品近乎一字不差的副本(它有时确实会),——这是个更清楚的问题。(3)「输出」之问:模型生成之物归谁所有?一张高度模仿在世艺术家风格的生成图像,会构成侵权吗?(4)「作者身份」之问:纯由AI做出的作品,究竟能不能享有版权?不同国家正给出不同的答案,而许多案子仍在诉讼之中。
它为何重要:这些答案将塑造「谁从AI获利」,以及人类创作者究竟是能拿到报酬、还是被挤出局。截至2020年代中期,诚实的现状是:悬而未决——没有全球共识,法院刚刚发出最初几份裁决,而通情达理的人们意见相左。当心任何一个方向上的笃定断言(「这显然是盗窃」/「这显然是合理使用」);法律是真的还没下定论,而「模型像人一样从中学习」只是一个修辞性的类比,并非一条已确立的法律原则。
一位小说家发现,她的书曾是某个用于训练聊天机器人的数据集的一部分,而那个机器人能详细地概述她的情节。她提起了诉讼。这桩案子逼着法院去裁定:为训练模型而复制她的书,是侵权,还是具有「转化性」的合理使用?截至2020年代中期,世界各地的法院正发出最初的、且往往彼此矛盾的答案。
同样的事实,在不同法域里被作出了不同的判断——这部法律仍在书写之中。
有两件事常被混为一谈:「用受版权保护的数据训练」,与「模型把它复制出来」。前者在法律上模糊不清、争议激烈;后者——模型吐出某个特定受保护作品近乎完全的副本——则是清楚得多的侵权风险。把二者搅在一起,会把一场「区分很要紧」的辩论搅浑。