Skip to main content
QUICK REVIEW

[論文レビュー] Strong Model Collapse

Elvis Dohmatob, Yunzhen Feng|arXiv (Cornell University)|Oct 7, 2024
Complex Systems and Time Series AnalysisEconomics, Econometrics and Finance被引用数 3
ひとこと要約

本論文は、訓練データにわずか1%程度の合成データでさえも、機械学習モデルにおける性能の著しい低下を引き起こす「強いモデル崩壊」を確立した。線形回帰およびランダム射影モデルを用いて、より大きなモデルは、補間閾値を超えるまで、崩壊を悪化させる可能性があることが証明された。補間閾値を超えると、頑健性が向上する可能性があるが、合成データの割合がゼロに漸近的に近づかない限り、崩壊は持続する。

ABSTRACT

Within the scaling laws paradigm, which underpins the training of large neural networks like ChatGPT and Llama, we consider a supervised regression setting and establish the existance of a strong form of the model collapse phenomenon, a critical performance degradation due to synthetic data in the training corpus. Our results show that even the smallest fraction of synthetic data (e.g., as little as 1\% of the total training dataset) can still lead to model collapse: larger and larger training sets do not enhance performance. We further investigate whether increasing model size, an approach aligned with current trends in training large language models, exacerbates or mitigates model collapse. In a simplified regime where neural networks are approximated via random projections of tunable size, we both theoretically and empirically show that larger models can amplify model collapse. Interestingly, our theory also indicates that, beyond the interpolation threshold (which can be extremely high for very large datasets), larger models may mitigate the collapse, although they do not entirely prevent it. Our theoretical findings are empirically verified through experiments on language models and feed-forward neural networks for images.

研究の動機と目的

  • 訓練データにわずかでも合成データが含まれる場合、モデル崩壊が避けられないかどうかを調査すること。
  • 合成データによる汚染下で、モデルサイズを増加させることでモデル崩壊が緩和されるか、悪化するかを特定すること。
  • 神経ネットワークスケーリング法則の枠組み内で、データ分布のシフトに伴う一般化失敗を焦点に、モデル崩壊の理論的基盤を確立すること。
  • モデル容量とデータ混合比が長期的なモデル性能の低下に与える影響を分析すること。
  • 画像分類ネットワークおよび言語モデルを用いた実験的評価を通じて、理論的予測を検証すること。

提案手法

  • 合成データと実データを含む教師あり回帰設定を分析し、データ生成分布とモデルが学習する分布をモデル化する。
  • ランダム射影を用いてニューラルネットワークの挙動を近似し、パrametrization率 $\psi = m/n$ を用いてモデル容量を扱う。
  • 正則化が非常に小さい($\lambda \to 0^+$)極限において、主要な量(例:$\tau$, $e$, $\chi$, $\kappa$)の固定点方程式を導出することで、一般化誤差を研究する。
  • ランダム行列理論および線形代数の道具を用いて、モデルサイズと合成データ比の関数としてのテスト誤差を特徴付ける。
  • 異なる合成データ比とモデル容量の下での、モデルパラメータおよび一般化誤差の極限的挙動の解析的表現を導出する。
  • 畳み込みニューラルネットワークを用いた画像データおよび微調整済み大規模言語モデル(LLMs)を用いた実験的検証により、理論的知見を検証し、合成データ汚染下でのテスト誤差を測定する。

実験結果

リサーチクエスチョン

  • RQ1訓練データにわずか1%の合成データが含まれる場合、モデル崩壊は避けられないのか。また、データ重み付けや混合戦略によって緩和可能か。
  • RQ2合成データ汚染下で、モデルサイズはモデル崩壊への感受性にどのように影響するか。
  • RQ3モデル容量とデータサイズが一致する補間閾値(interpolation threshold)が、合成データに対するモデルの頑健性に段階的転移をもたらすか。
  • RQ4一般化誤差に関する理論的予測は、LLMs や CNN といった実世界のモデルで実証可能か。
  • RQ5合成データが非ゼロの割合で存在する場合、訓練データサイズが増大するに従って、モデル性能の漸近的挙動はいかなるものか。

主な発見

  • 訓練データにたった1%の合成データが含まれるだけで、性能の著しい低下(強いモデル崩壊)が発生し、訓練データ量を増やしても性能向上が見られない。
  • 合成データの分布が実データの分布から著しく逸脱している場合、より大きなモデルはモデル崩壊を悪化させる。
  • 補間閾値を超えると、一般化性能の向上により、より大きなモデルは崩壊を緩和する可能性があるが、完全に防止はしない。
  • 理論的分析により、合成データの割合がゼロに漸近的に近づかない限り、モデル崩壊は持続することが示された。
  • 画像モデルおよび言語モデルにおける実験的結果から、テスト誤差が合成データ比およびモデルサイズに応じて増加し、理論的予測と整合的であることが確認された。
  • 正則化なしの極限において、一般化誤差がパrametrization率 $\psi = m/n$ および合成データと実データの分布の乖離に強く依存することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。