Skip to main content
QUICK REVIEW

[論文レビュー] CS-Shapley: Class-wise Shapley Values for Data Valuation in Classification

Stephanie Schoch, Haifeng Xu|arXiv (Cornell University)|Nov 13, 2022
Machine Learning and Data Classification被引用数 5
ひとこと要約

CS-Shapleyは、データポイントが自身のクラス(インハウス)への貢献と他のクラス(アウトオブクラス)への貢献を区別する、新たなクラス別シャープレー値手法を提案する。この手法は、ノイズや誤標籤されたインスタンスの検出を向上させる価値関数を用いる。理論的には2つの望ましい公理を満たし、4つの分類器と9つのデータセットにおいて、データ除去およびノイズのあるラベル検出の両面で既存手法を上回る性能を示す。さらに、ニューラルネットワークを含むさまざまなモデル間で値が転送可能である。

ABSTRACT

Data valuation, or the valuation of individual datum contributions, has seen growing interest in machine learning due to its demonstrable efficacy for tasks such as noisy label detection. In particular, due to the desirable axiomatic properties, several Shapley value approximation methods have been proposed. In these methods, the value function is typically defined as the predictive accuracy over the entire development set. However, this limits the ability to differentiate between training instances that are helpful or harmful to their own classes. Intuitively, instances that harm their own classes may be noisy or mislabeled and should receive a lower valuation than helpful instances. In this work, we propose CS-Shapley, a Shapley value with a new value function that discriminates between training instances' in-class and out-of-class contributions. Our theoretical analysis shows the proposed value function is (essentially) the unique function that satisfies two desirable properties for evaluating data values in classification. Further, our experiments on two benchmark evaluation tasks (data removal and noisy label detection) and four classifiers demonstrate the effectiveness of CS-Shapley over existing methods. Lastly, we evaluate the "transferability" of data values estimated from one classifier to others, and our results suggest Shapley-based data valuation is transferable for application across different models.

研究の動機と目的

  • 既存のシャープレーに基づくデータ評価手法が、全体の正解率を唯一の価値関数として扱うため、クラス内での役立つインスタンスと有害なインスタンスを区別できないという限界を是正すること。
  • データポイントが自身のクラスに与える貢献と他のクラスに与える貢献を明示的に測定する新たな価値関数を提案し、ノイズや誤標籤されたデータの検出を改善すること。
  • 提案されたクラス別価値関数が、分類におけるデータ評価において2つの望ましい公理を満たす(本質的に)唯一の関数であることを理論的に証明すること。
  • 多様なデータセットと分類器を用いて、CS-Shapleyの高価値データ削除およびノイズのあるラベル検出における実験的評価を実施すること。
  • シンプルなモデル(例:ロジスティック回帰)で推定されたシャープレーに基づくデータ値が、より複雑なモデル(例:ディープニューラルネットワーク)へどのように転送可能かを調査すること。

提案手法

  • データポイント $ i $ を部分集合 $ S $ に追加した際のインハウス正解率の変化を計算するクラス別価値関数 $ v_y(S \cup \{i\}) $ を導入し、アウトオブクラス正解率で重み付けする。
  • データポイントの貢献が、インハウス性能の向上とアウトオブクラス性能の低下の両方に寄与する場合に高い値をとるように価値関数を定義する。
  • この価値関数をシャープレー値フレームワークに組み込み、インハウスの有用性とアウトオブクラスの害を反映したデータ値を計算する。
  • 大規模データセット向けに、TMC-Shapley近似法を用いてシャープレー値を効率的に推定する。
  • データ値をソース分類器(例:ロジスティック回帰)で計算し、再訓練なしにターゲット分類器(例:MLP)に適用することで、転送性を評価する。
  • 高価値データ削除タスクとノイズのあるラベル検出を用いて、複数の分類器とデータセットにおける性能をベンチマークする。

実験結果

リサーチクエスチョン

  • RQ1分類におけるデータ評価のための価値関数として、インハウス貢献とアウトオブクラス貢献を区別できるものがあり、有害またはノイズのあるインスタンスの検出を改善できるか?
  • RQ2提案されたクラス別価値関数は、分類におけるデータ評価において2つの望ましい公理を満たす(本質的に)唯一の関数か?
  • RQ3CS-Shapleyは、高価値データ削除およびノイズのあるラベル検出タスクにおいて、既存のシャープレーに基づくデータ評価手法を上回るか?
  • RQ4シンプルな分類器(例:ロジスティック回帰)で推定されたシャープレーに基づくデータ値は、ディープニューラルネットワークなどのより複雑なモデルへ効果的に転送可能か?
  • RQ5ソース分類器でのデータ値の性能が、ターゲット分類器での性能を信頼性高く予測できるか?

主な発見

  • CS-Shapleyは、全9つのデータセットおよび4つの分類器において、高価値データ削除タスクで既存手法を上回り、9つのデータセットのうち8つで統計的に有意な改善を達成した。
  • ノイズのあるラベル検出においても優れた性能を発揮し、ベースライン手法よりも一貫して誤標籤インスタンスをより正確に同定した。
  • 理論的分析により、提案された価値関数が、インハウス貢献における公平性とアウトオブクラスの害に対する感受性という2つの望ましい公理を満たす(本質的に)唯一の関数であることが確認された。
  • ロジスティック回帰で推定されたシャープレーに基づくデータ値はMLPへ転送可能であり、ターゲットモデルにおける性能パターンがソースモデルと密接に一致した。
  • データ値の転送性は、モデルアーキテクチャにかかわらず一貫したデータ品質の信号をシャープレー値が捉えていることを示唆している。
  • CS-Shapleyは、ニューラルネットワークへも転送された際にも強力な性能を維持しており、実用的かつスケーラブルなモデルに依存しないデータ評価の可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。