[论文解读] A Tale of Tails: Model Collapse as a Change of Scaling Laws
本文提出了一套理论框架,将大语言模型中的模型坍塌现象与训练数据日益合成化时缩放法则的变化联系起来。通过分析人工智能生成的数据如何截断或压缩自然数据分布的尾部,作者证明了缩放法则因幂律行为的丧失而退化,导致性能下降、技能遗忘,最终引发模型坍塌——该结论通过在 Llama2 和一个算术任务上的变换器模型上进行的大规模实验得到验证。
As AI model size grows, neural scaling laws have become a crucial tool to predict the improvements of large models when increasing capacity and the size of original (human or natural) training data. Yet, the widespread use of popular models means that the ecosystem of online data and text will co-evolve to progressively contain increased amounts of synthesized data. In this paper we ask: How will the scaling laws change in the inevitable regime where synthetic data makes its way into the training corpus? Will future models, still improve, or be doomed to degenerate up to total (model) collapse? We develop a theoretical framework of model collapse through the lens of scaling laws. We discover a wide range of decay phenomena, analyzing loss of scaling, shifted scaling with number of generations, the ''un-learning" of skills, and grokking when mixing human and synthesized data. Our theory is validated by large-scale experiments with a transformer on an arithmetic task and text generation using the large language model Llama2.
研究动机与目标
- 理解当训练数据中包含越来越多的合成数据时,大语言模型中缩放法则的变化机制。
- 研究训练分布中因合成数据导致模型坍塌的机制,例如尾部截断和尾部压缩。
- 分析模型性能的退化,包括新兴技能的丧失以及无法维持幂律缩放行为。
- 通过在 Llama2 和一个在算术任务上训练的变换器模型上的大规模实验,验证理论预测。
- 探索在混合合成数据与真实数据时,出现“顿悟”或性能恢复的条件。
提出的方法
- 对重尾输入分布(如齐夫定律)下的缩放法则进行理论分析,以及在人工智能生成导致分布被截断或压缩时其失效的机制。
- 通过 top-p(核)采样和温度缩放建模人工智能生成过程,系统性地截断或压缩下一个词的概率分布的尾部。
- 通过实证评估,使用在 Wikitext-103 片段上微调的 Llama2-7B 模型,依次生成多代合成数据,以模拟迭代式合成数据的累积。
- 通过在测试集上的交叉熵损失和困惑度来追踪性能退化,比较不同代际模型和数据混合比例下的表现。
- 引入受控的数据混合(例如 90% 合成数据,10% 真实数据),以研究恢复现象和“顿悟”效应。
- 分析序列级指标(如困惑度)的组合效应,表明尾部压缩会导致虚假的性能退化。
实验结果
研究问题
- RQ1通过大语言模型生成的合成数据如何改变后续模型的缩放法则?
- RQ2在合成数据上训练的模型中,导致缩放行为退化的机制是尾部截断还是尾部压缩?
- RQ3是否可以通过训练数据分布统计特性的变化来预测和解释模型坍塌?
- RQ4在混合合成数据与真实数据时,性能恢复(如‘顿悟’)在何种条件下会发生?
- RQ5随着模型训练逐渐转向合成数据,新兴技能(如算术推理)退化或消失的程度如何?
主要发现
- 通过 top-p 采样和温度缩放生成合成数据,会系统性地截断或压缩自然数据分布的尾部,破坏模型改进所必需的幂律缩放行为。
- 随着多代合成数据的累积,缩放法则发生退化:测试损失不再随数据规模呈现幂律衰减,导致性能停滞或下降。
- 在多代合成数据上训练的模型因关键但稀有的数据模式丢失,而表现出新兴技能(如算术推理)的丧失。
- 在 Llama2-7B 上的实验表明,性能随代际增加而明显退化,损失上升,困惑度随数据合成度提高而增加。
- 以 90% 合成数据与 10% 真实数据混合时,性能出现类似‘顿悟’的恢复,表明少量真实数据可恢复缩放行为。
- 理论分析证实,下一个词分布的尾部压缩会导致序列级指标(如困惑度)的组合性退化,即使没有直接的数据分布偏移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。