[论文解读] Copyright Violations and Large Language Models
本研究通过从畅销书和LeetCode编程题中提取提示,探测六种模型家族对受版权保护文本的逐字记忆情况。结果表明,更大的模型会显著重现整个文本片段,暗示存在通过未经授权分发导致的潜在版权侵权风险。
Language models may memorize more than just facts, including entire chunks of texts seen during training. Fair use exemptions to copyright laws typically allow for limited use of copyrighted material without permission from the copyright holder, but typically for extraction of information from copyrighted materials, rather than {\em verbatim} reproduction. This work explores the issue of copyright violations and large language models through the lens of verbatim memorization, focusing on possible redistribution of copyrighted text. We present experiments with a range of language models over a collection of popular books and coding problems, providing a conservative characterization of the extent to which language models can redistribute these materials. Overall, this research highlights the need for further examination and the potential impact on future developments in natural language processing to ensure adherence to copyright regulations. Code is at \url{https://github.com/coastalcph/CopyrightLLMs}.
研究动机与目标
- 探究大型语言模型(LLMs)是否能够从训练数据中逐字记忆并重现受版权保护的文本片段。
- 评估此类记忆在不同LLM家族以及不同类型受版权保护内容(文学作品与编程题)中的程度。
- 探讨模型规模、内容流行度及提示工程对逐字记忆的影响。
- 为未来关于LLM与版权合规性的法律和伦理讨论提供实证数据与方法论框架。
提出的方法
- 使用源自畅销书首行或完整描述以及LeetCode编程题的特定提示,开展探测实验。
- 采用两种探测策略:直接请求文本重现的提示,以及逐行针对性查询。
- 通过两种指标衡量逐字记忆:精确字符串匹配与语义相似度,以实现上下文感知的评估。
- 在不同规模的六种不同LLM家族中进行评估,重点关注记忆模式与可扩展性。
- 分析记忆率与源文本流行度指标(如网络流行度)之间的关系。
- 使用受控提示测试记忆是否可被激活,模拟潜在的滥用场景。

实验结果
研究问题
- RQ1大型语言模型在多大程度上能够从其训练数据中逐字重现完整的受版权保护文本片段?
- RQ2模型规模在多大程度上影响受版权保护内容的逐字记忆率?
- RQ3文本在网络上的流行度是否与LLM中更高的记忆率相关?
- RQ4提示工程是否能够激活此前被抑制的逐字记忆?
- RQ5不同LLM家族在逐字记忆受版权保护材料方面的能力有何差异?
主要发现
- 更大的语言模型在逐字记忆受版权保护文本片段方面表现出近乎线性的增长,证实模型规模与记忆能力之间存在关联。
- 如GPT-3.5等模型能够重现LeetCode的完整题目描述以及《The Boy Who Lived》等书籍的完整首行,有时准确度极高。
- 在某些情况下,模型会产生幻觉或部分错误的文本(例如,错误表述《Pinocchio》首行),表明记忆并非完美,但仍具有显著性。
- 当被要求提供特定行时,出现了虚构现象,表明模型可能将记忆内容与生成文本混合,尤其是在接收到模糊或不完整查询时。
- 提示工程被证明可以激活此前被抑制的记忆,暗示当前结果较为保守,实际记忆程度在优化条件下可能更高。
- 本研究证实,受版权保护材料的逐字记忆在多个LLM家族中具有可测量性且广泛存在,引发了关于潜在分发与版权侵权的严重担忧。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。