[論文レビュー] What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions
本稿では、大規模言語モデル(LLM)の影響関数に基づくデータ評価を高速化する低ランク勾配射影法LoGraを提案する。従来のベースラインと比較して、GPUメモリを5倍削減し、スループットを最大6,500倍に向上させる。LoGraは、10億トークンのデータセットを用いてLlama3-8B-Instruct上でスケーラブルかつ高精度なデータ評価を可能にし、Logixソフトウェアフレームワークを介して最小限のコード変更で実現可能である。
Large language models (LLMs) are trained on a vast amount of human-written data, but data providers often remain uncredited. In response to this issue, data valuation (or data attribution), which quantifies the contribution or value of each data to the model output, has been discussed as a potential solution. Nevertheless, applying existing data valuation methods to recent LLMs and their vast training datasets has been largely limited by prohibitive compute and memory costs. In this work, we focus on influence functions, a popular gradient-based data valuation method, and significantly improve its scalability with an efficient gradient projection strategy called LoGra that leverages the gradient structure in backpropagation. We then provide a theoretical motivation of gradient projection approaches to influence functions to promote trust in the data valuation process. Lastly, we lower the barrier to implementing data valuation systems by introducing LogIX, a software package that can transform existing training code into data valuation code with minimal effort. In our data valuation experiments, LoGra achieves competitive accuracy against more expensive baselines while showing up to 6,500x improvement in throughput and 5x reduction in GPU memory usage when applied to Llama3-8B-Instruct and the 1B-token dataset.
研究の動機と目的
- LLM学習におけるデータ提供者への報酬または評価を実施するメカニズムの欠如に取り組み、特にデータ利用に関する法的・倫理的緊張が高まる中で対応する。
- 現代のLLMおよびその大規模な学習データセットに、特に影響関数を含むデータ評価手法を適用する上で、計算コストおよびメモリコストが非常に高騰する問題を克服する。
- 完全な勾配計算や再学習を回避する、スケーラブルで効率的かつ理論的裏付けのある影響関数用勾配射影法を開発する。
- Logixというソフトウェアパッケージを導入することで、標準的な学習コードを最小限の作業でデータ評価コードに変換可能にし、実用的なデータ評価の導入障壁を低減する。
提案手法
- バックプロパゲーション勾配の構造を活用することで、勾配射影の空間的・時間的計算量をO(nk)からO(√(nk))に削減する低ランク勾配射影アルゴリズムLoGraを導入する。
- 完全な勾配を明示的に生成せず、直接的に射影勾配を計算できるように設計することで、低GPUメモリ使用量と高いGPU利用効率を実現する。
- 減衰項をスペクトル的勾配スパース化メカニズムとして解釈することで、影響関数における勾配射影の理論的裏付けを提供し、手法への信頼性を高める。
- 減衰項の理論的解釈に基づき、LoGraのための特別なPCA初期化スキームを提案する。
- 既存のLLM学習コードを簡単にデータ評価コードに変換できるソフトウェアパッケージLogixを開発し、LLMエコシステムツールとの互換性と、他の解釈可能性手法への拡張性を兼ね備える。
- 事前学習およびファインチューニングの両設定において、影響関数にLoGraを適用し、両設定でのデータ評価を可能にする。

実験結果
リサーチクエスチョン
- RQ1影響関数は、10億パラメータのLLMおよび大規模データセットに対して、許容可能な計算コストとメモリコストでスケーリング可能か?
- RQ2データ評価の精度を損なわせることなく、影響関数における勾配射影をどのように効率化できるか?
- RQ3影響関数における勾配射影の使用に理論的裏付けはあるか? また、その裏付けをどのように活用して手法の信頼性を向上できるか?
- RQ4ソフトウェア抽象化により、データ評価システムを研究者や実務家にとってどれほど実用的かつアクセス可能にすることができるか?
- RQ5LoGraが特定した最も影響力のあるトレーニング例は、クエリされたモデル出力と比較して、質的類似性および有用性においてどの程度一致するか?
主な発見
- LoGraは、Llama3-8B-Instructと10億トークンのデータセットに適用した際、唯一スケール可能なベースラインであるEKFAC影響関数と比較して、最大6,500倍のスループット向上と5倍のGPUメモリ削減を達成した。
- LoGraは、反事後評価においても競争力ある精度を維持しており、顕著な効率向上にもかかわらず、その影響推定が信頼できることが示された。
- LoGraが特定した最も価値のあるトレーニング例は、一般的にクエリされたLLM出力と質的に類似しており、手法の解釈可能性と関連性を裏付ける。
- スペクトル的勾配スパース化とPCA初期化によるLoGraの理論的裏付けは、データ評価プロセスへの信頼性を高めた。
- Logixは、最小限のコード変更で既存の学習パイプラインへのデータ評価統合を容易にし、LLMコミュニティ全体における採用を促進した。
- データ帰属の失敗事例は、低品質なモデル出力(例:Pythia-1.4B)でより頻発しており、モデル品質が評価の信頼性に影響を与える可能性を示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。