Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical and Comparative Analysis of Data Valuation with Scalable Algorithms

Ruoxi Jia, Xuehui Sun|arXiv (Cornell University)|Sep 25, 2019
Privacy-Preserving Technologies in Data参考文献 10被引用数 17
ひとこと要約

本稿では、教師あり学習におけるシャープレイ値を近似するスケーラブルなKNNベースのヒューリスティクスを提案し、モデルサイズに依存しない複雑さで効率的なデータバリュエーションを達成する。実験では、ラベルノイズ補正、データ要約、アクティブラーニングの分野で、既存手法と同等またはそれを上回る有効性を示し、顕著な高速化を実現する。

ABSTRACT

This paper focuses on valuating training data for supervised learning tasks and studies the Shapley value, a data value notion originated in cooperative game theory. The Shapley value defines a unique value distribution scheme that satisfies a set of appealing properties desired by a data value notion. However, the Shapley value requires exponential complexity to calculate exactly. Existing approximation algorithms, although achieving great improvement over the exact algorithm, relies on retraining models for multiple times, thus remaining limited when applied to larger-scale learning tasks and real-world datasets. In this work, we develop a simple and efficient heuristic for data valuation based on the Shapley value with complexity independent with the model size. The key idea is to approximate the model via a $K$-nearest neighbor ($K$NN) classifier, which has a locality structure that can lead to efficient Shapley value calculation. We evaluate the utility of the values produced by the $K$NN proxies in various settings, including label noise correction, watermark detection, data summarization, active data acquisition, and domain adaption. Extensive experiments demonstrate that our algorithm achieves at least comparable utility to the values produced by existing algorithms while significant efficiency improvement. Moreover, we theoretically analyze the Shapley value and justify its advantage over the leave-one-out error as a data value measure.

研究の動機と目的

  • 大規模な学習タスクにおける正確なおよび既存の近似シャープレイ値計算の高い計算コストを解決すること。
  • モデルサイズに依存しない複雑さを持つデータバリュエーション手法を開発し、現実世界のデータセットへのスケーラビリティを実現すること。
  • KNNで近似したシャープレイ値の有効性を、多様な機械学習応用分野において評価すること。
  • シャープレイ値がリーブ・オール・アウト誤差よりも優れたデータバリュエーション指標である理論的裏付けを提供すること。

提案手法

  • 局所性の構造を活用して、K近傍法(KNN)分類器による機械学習モデルの近似を実施し、効率的なシャープレイ値計算を実現すること。
  • KNNの局所的性質を活かして、フルモデルの再訓練を伴わずにシャープレイ値を計算し、計算複雑度をデータサイズに比例する線形関数に削減すること。
  • 各訓練例のモデルパフォーマンスへの限界寄与度をKNNプロキシを用いて推定し、これに基づいてデータバリュエーションを構築すること。
  • ラベルノイズ補正、データ要約、アクティブデータ取得などの下流タスクにKNNで近似したシャープレイ値を適用すること。
  • KNNの局所的推論に依存することで、繰り返しモデル再訓練を回避し、高速かつスケーラブルなデータバリュエーションを実現すること。

実験結果

リサーチクエスチョン

  • RQ1KNNベースのプロキシは、既存の近似手法と比較して競争力のあるデータバリュエーション有効性を達成できるか?
  • RQ2KNNで近似したシャープレイ値は、リーブ・オール・アウト誤差と比較して、理論的に優れたデータバリュエーション指標を維持できるか?
  • RQ3提案手法は、大規模データセットおよび複雑なモデルにおいて、計算効率の面でどのようにスケーリングするか?
  • RQ4KNNで近似したシャープレイ値は、どのような現実世界の機械学習応用分野で実用的有効性を示すか?

主な発見

  • KNNベースのヒューリスティクスは、ラベルノイズ補正、ウォーターマーク検出、データ要約、アクティブデータ取得、ドメイン適応の分野で、既存の近似アルゴリズムと同等以上に高い有効性を達成する。
  • 計算コストを顕著に削減し、モデルサイズに依存しない複雑さを実現することで、大規模データセットへのスケーラビリティが可能になる。
  • 理論的分析により、シャープレイ値が、望ましい公理的性質を備えるため、リーブ・オール・アウト誤差よりも優れたデータバリュエーション指標であることが確認される。
  • 実験的結果から、KNNで近似したシャープレイ値は、ノイズが多いまたは不均衡なデータ条件下でも、影響力のある訓練例を効果的に特定できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。