Skip to main content
QUICK REVIEW

[論文レビュー] DU-Shapley: A Shapley Value Proxy for Efficient Dataset Valuation

Felipe Garrido-Lucero, Benjamin Heymann|arXiv (Cornell University)|Jun 3, 2023
Explainable Artificial Intelligence (XAI)参考文献 42被引用数 4
ひとこと要約

本稿では、データセット評価におけるShapley値の新しい効率的代理指標であるDU-Shapleyを紹介する。この手法は、データセットサイズに依存する効用関数の構造を活用し、集合のサイズに関する離散一様分布上の期待値としてShapley値を近似することで、計算複雑性を低減する。データ所有者の数が増加するにつれて、真のShapley値への確実収束を達成し、少数のデータ所有者でも標準的なモンテカルロ法を上回る性能を発揮する。

ABSTRACT

We consider the dataset valuation problem, that is, the problem of quantifying the incremental gain, to some relevant pre-defined utility of a machine learning task, of aggregating an individual dataset to others. The Shapley value is a natural tool to perform dataset valuation due to its formal axiomatic justification, which can be combined with Monte Carlo integration to overcome the computational tractability challenges. Such generic approximation methods, however, remain expensive in some cases. In this paper, we exploit the knowledge about the structure of the dataset valuation problem to devise more efficient Shapley value estimators. We propose a novel approximation, referred to as discrete uniform Shapley, which is expressed as an expectation under a discrete uniform distribution with support of reasonable size. We justify the relevancy of the proposed framework via asymptotic and non-asymptotic theoretical guarantees and illustrate its benefits via an extensive set of numerical experiments.

研究の動機と目的

  • データセット評価における正確なShapley値推定およびモンテカルロベースの推定の高い計算コストに対処すること。
  • 効用関数のデータセットサイズ依存性を活用することで、一般的なモンテカルロ近似の代替手段としてより効率的な手法を開発すること。
  • 提案手法の近似誤差に関する理論的保証(漸近的および非漸近的)を提供すること。
  • 経験的に、DU-Shapleyが少数のデータ所有者でも、Owen-Shapleyを含む既存のShapley値近似手法を上回ることを示すこと。

提案手法

  • DU-Shapleyは、データ所有者の数に等しいサポートサイズを持つ、集合のサイズに関する離散一様分布上の期待値としてShapley値を近似する。
  • 全部分集合の全列挙を置き換え、固定された集合サイズごとのマージナル寄与の平均化という構造的近似を採用する。
  • データセット評価における効用関数がしばしばデータポイント総数に依存することを活用し、期待されるデータセットサイズに基づく簡略化を可能にする。
  • 推定器は $ \psi_i = \frac{1}{I} \left[ w(n_i) + w(n_\mathcal{I}) - w(n_{\mathcal{I}\setminus\{i\}}) \right] + \frac{1}{I} \sum_{k=1}^{I-2} \frac{1}{\binom{I-1}{k}} \sum_{\substack{\mathcal{S} \subseteq \mathcal{I}\setminus\{i\} \\ |\mathcal{S}|=k}} \left[ w(n_\mathcal{S} + n_i) - w(n_\mathcal{S}) \right] $ で定義され、期待値を用いた簡略化版も含まれる。
  • この手法には、中間サイズの集合についての和を平均データセットサイズにおける期待効用で近似する、DU-Shapley++というバリエーションが含まれる。
  • 理論的分析により、データ所有者の数が増加するにつれて、DU-Shapleyが真のShapley値にほとんど確実に収束することが示された。
Figure 2: Monte Carlo’s expected error for limited sampling budget ( $T=I$ ) versus DU-Shapley ’s expected bias for a value function $w(n)=1-\frac{10^{k(\mathcal{I})}}{10^{k(\mathcal{I})}+n}$ where $k(\mathcal{I})=\lfloor\log(n_{\mathcal{I}})\rfloor-1$ . For each value of $I$ , we drew $100$ times t
Figure 2: Monte Carlo’s expected error for limited sampling budget ( $T=I$ ) versus DU-Shapley ’s expected bias for a value function $w(n)=1-\frac{10^{k(\mathcal{I})}}{10^{k(\mathcal{I})}+n}$ where $k(\mathcal{I})=\lfloor\log(n_{\mathcal{I}})\rfloor-1$ . For each value of $I$ , we drew $100$ times t

実験結果

リサーチクエスチョン

  • RQ1効用関数の構造を活用することで、データセット評価のためのより効率的なShapley値近似を設計できるか?
  • RQ2データ所有者の数が増加するにつれて、提案されたDU-Shapley推定器は真のShapley値に収束するか?
  • RQ3平均データセットサイズや効用関数の成長率といった主な問題パラメータに関して、DU-Shapleyの近似誤差はどのようにスケーリングするか?
  • RQ4少数のデータ所有者でも、標準的なモンテカルロ法やOwen-Shapleyといった最先端の近似手法を凌駕できるか?

主な発見

  • Exact Shapley値計算はデータ所有者数に関して指数関数的であるのに対し、DU-Shapleyは必要な効用評価回数を顕著に削減する。
  • 平均データセットサイズ、その分散、および効用関数の成長率に明示的に依存する非漸近的誤差バインディングにより、理論的裏付けが与えられている。
  • データ所有者の数が増加するにつれて、DU-Shapleyは真のShapley値にほとんど確実に収束する。これは、限られたサンプリング予算下で一般のモンテカルロ法が達成できない性質である。
  • 経験的評価では、データ所有者の数が少ない場合でも、複数のデータセット評価ベンチマークで、Owen-Shapleyを含む他のShapley値近似手法を上回る性能を示した。
  • DU-Shapley++は、計算コストをDU-Shapleyと同等に保ちながら、集合サイズごとの和を期待値に置き換えることで、近似の精度を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。