[论文解读] Copyright in Generative Deep Learning
本文探讨了生成式深度学习(GDL)中的版权挑战,分析了在美国和欧盟法律下,使用受版权保护的作品进行训练是否合法,以及谁拥有AI生成艺术和代码的版权。研究结论认为,现行公平使用原则和文本与数据挖掘(TDM)例外条款在特定条件下允许训练,但法律清晰度仍然有限,呼吁开发者和政策制定者为未来的GDL应用采纳伦理准则和更新的立法。
Machine-generated artworks are now part of the contemporary art scene: they are attracting significant investments and they are presented in exhibitions together with those created by human artists. These artworks are mainly based on generative deep learning techniques, which have seen a formidable development and remarkable refinement in the very recent years. Given the inherent characteristics of these techniques, a series of novel legal problems arise. In this article, we consider a set of key questions in the area of generative deep learning for the arts, including the following: is it possible to use copyrighted works as training set for generative models? How do we legally store their copies in order to perform the training process? Who (if someone) will own the copyright on the generated data? We try to answer these questions considering the law in force in both the United States of America and the European Union, and potential future alternatives. We then extend our analysis to code generation, which is an emerging area of generative deep learning. Finally, we also formulate a set of practical guidelines for artists and developers working on deep learning generated art, as well as some policy suggestions for policymakers.
研究动机与目标
- 分析在美国和欧盟法律下,将受版权保护的作品作为生成式深度学习模型的训练数据进行存储和使用是否合法。
- 调查在法律 doctrine 不断演变的背景下,AI生成的艺术品和代码的版权归属问题。
- 评估现有法律框架(如公平使用和2019年欧盟版权指令)对新兴GDL应用的充分性。
- 为与生成模型合作的艺术家和开发者提供实用指南,重点在于合规与伦理使用。
- 探讨为保护AI生成内容而需制定的未来立法需求,同时平衡创新与知识产权权利。
提出的方法
- 对美国公平使用原则与2019年欧盟版权指令进行比较法律分析,重点关注文本与数据挖掘(TDM)例外条款。
- 评估在研究和商业背景下,将受版权保护的数据集存储在内存中的法律地位。
- 评估由GDL模型生成的输出可能获得版权保护的可能性,考虑其创造性使用和作者资格标准。
- 分析GitHub Copilot等代码生成系统,评估其在现行知识产权框架下的法律与伦理影响。
- 为开发者和艺术家提出实用指南,包括许可证合规、数据偏差规避以及服务条款的清晰化。
- 建议政策改革,使知识产权法与生成式AI的技术现实相适应,特别是针对自主模型输出的情况。
实验结果
研究问题
- RQ1根据美国和欧盟法律,将受版权保护的作品作为生成式深度学习模型的训练数据进行存储和使用是否合法?
- RQ2使用受版权保护的训练数据是否可被视为公平使用或合法的TDM例外?这些原则在实践中的限制是什么?
- RQ3AI生成的艺术品或代码的作者和版权拥有者应被认定为谁——开发者、用户,还是AI系统本身?
- RQ4当在公开但受许可证约束的数据集上训练模型时,开发者和艺术家如何确保遵守许可条款?
- RQ5为弥合AI能力与现有知识产权框架之间的差距,需要哪些政策与法律改革?
主要发现
- 美国的公平使用原则可能允许对受版权保护的作品进行训练,但其适用存在不确定性,且取决于创造性使用,尤其是在商业用途中。
- 2019年欧盟版权指令允许为科学研究目的进行文本与数据挖掘,但前提是权利人未明确保留该权利,这在实践中造成了法律模糊性。
- 现行法律框架不授予AI生成输出版权保护,因为其缺乏人类作者,但未来改革可能重新考虑此问题。
- GitHub Copilot的代码生成极少直接复制确切的代码片段,但该系统包含追踪机制,可检测并追溯此类情况以确保许可证合规。
- 当用户积极指导并完成AI生成的代码时,根据雇佣作品原则,其在法律上被认定为作者和版权所有者。
- 开发者应使其模型与训练数据保持差异,并在其服务条款中明确许可条款,以降低法律风险并促进伦理使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。