Skip to main content
QUICK REVIEW

[論文レビュー] Data Valuation Without Training of a Model

Nohyun Ki, Ho‐Yong Choi|arXiv (Cornell University)|Jan 3, 2023
Machine Learning and Data Classification被引用数 7
ひとこと要約

本稿では、2層の過パラメータ化ニューラルネットワークにおける一般化への個々のデータインスタンスの影響を定量化する、トレーニングフリーのデータバリュエーションスコア、複雑さギャップスコア(CGスコア)を提案する。インスタンスを削除した際のデータ複雑さのギャップを測定することで、モデルトレーニングを伴わずに不規則または誤ラベルの例を同定し、最小限の精度低下で効果的なデータプリーニングを実現する。例えば、CIFAR-10では40%のプリーニングで1%未満の精度損失にとどまる。

ABSTRACT

Many recent works on understanding deep learning try to quantify how much individual data instances influence the optimization and generalization of a model. Such attempts reveal characteristics and importance of individual instances, which may provide useful information in diagnosing and improving deep learning. However, most of the existing works on data valuation require actual training of a model, which often demands high-computational cost. In this paper, we provide a training-free data valuation score, called complexity-gap score, which is a data-centric score to quantify the influence of individual instances in generalization of two-layer overparameterized neural networks. The proposed score can quantify irregularity of the instances and measure how much each data instance contributes in the total movement of the network parameters during training. We theoretically analyze and empirically demonstrate the effectiveness of the complexity-gap score in finding `irregular or mislabeled' data instances, and also provide applications of the score in analyzing datasets and diagnosing training dynamics. Our code is publicly available at https://github.com/JJchy/CG_score

研究の動機と目的

  • 繰り返しモデルトレーニングを要する従来のデータバリュエーション手法の高い計算コストに対処する。
  • 個々のデータインスタンスのモデル一般化への影響を定量化する、データ中心のトレーニングフリー手法を開発する。
  • トレーニングを伴わず、不規則または誤ラベルのインスタンスを同定することで、効率的なデータプリーニングとデータセット診断を可能にする。
  • CGスコアがデータの不規則性および学習難易度を測定できるかどうかの理論的・実験的検証。

提案手法

  • 単一インスタンスをデータセットから削除した際のデータ複雑さの変化に基づき、データ中心の指標として複雑さギャップスコア(CGスコア)を定義する。
  • 事前学習済みモデルの隠れ表現のグラム行列を用い、シュール補完を介してCGスコアを効率的に計算することで、フル行列逆行列を回避する。
  • 無限幅のニューラルトランスファーカーネル(NTK)行列の逆行列からCGスコアを導出し、インスタンスレベルの影響を捉えるために逆行列の対角要素に注目する。
  • インスタンス内類似度、クラス間相違度、およびインスタンス固有の複雑さからの寄与度を部分的に分解し、寄与要因を分析する。
  • CGスコアを用いてスコアが低いインスタンスをプリーニングの対象とし、損失曲線およびNTK部分行列の進化を用いてトレーニングダイナミクスを分析する。

実験結果

リサーチクエスチョン

  • RQ1トレーニングフリーのデータバリュエーションスコアは、過パラメータ化ネットワークにおいて不規則または誤ラベルのデータインスタンスを効果的に同定できるか?
  • RQ2CGスコアは個々のデータポイントの学習難易度およびトレーニングダイナミクスとどの程度相関するか?
  • RQ3CGスコアに従って行われるデータプリーニングは、モデルの一般化性能をどの程度維持できるか?
  • RQ4CGスコアのうち、クラス間相違度、クラス内類似度、またはインスタンス固有の複雑さのどの成分がスコア順位に最も強く寄与するか?

主な発見

  • CGスコアは、クラス固有のパターンからの逸脱を測定することで、不規則または誤ラベルのインスタンスを効果的に同定する。高スコアは学習が難しい例を示す。
  • CIFAR-10でCGスコアが低い40%のデータインスタンスをプリーニングしても、テスト精度の低下が1%未満にとどまり、一般化性能の強力な保持が示された。
  • 部分CGスコア項 $2y_i(oldsymbol{y}_{-i}^ op oldsymbol{h}_i)$ は、すべてのサブサンプリング比において、全CGスコアと強く相関(スピアマン順位相関 >0.96)している。
  • CGスコアが高いインスタンスは、低スコアのインスタンスと比較して遅延した損失の減少とNTK部分行列の進化を示し、収束が遅いことが明らかになった。
  • CGスコアは学習難易度と強く相関しており、高スコアのインスタンスは訓練過程での損失曲線および正答率曲線からも、学習が遅いことが確認された。
  • グラム行列のさまざまなサブサンプリング比においても、CGスコアは安定的かつ情報的であり、計算負荷の低減に対しても頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。