Skip to main content
QUICK REVIEW

[論文レビュー] Who's responsible? Jointly quantifying the contribution of the learning algorithm and training data

Gal Yona, Amirata Ghorbani|arXiv (Cornell University)|Oct 9, 2019
Machine Learning and Data Classification参考文献 38被引用数 8
ひとこと要約

本稿では、学習アルゴリズムと学習データの両方がモデル性能に与える寄与を一括して測定する原理的枠組み「拡張シャープレイ」を導入する。シャープレイ値理論を拡張し、アルゴリズムとデータを共同責任者として扱うことで、機械学習におけるより公正な責任追及を可能にし、実験的検証により、性能の低下が偏ったデータか、 flawed なアルゴリズムに起因するかを特定できることが示された。

ABSTRACT

A learning algorithm $A$ trained on a dataset $D$ is revealed to have poor performance on some subpopulation at test time. Where should the responsibility for this lay? It can be argued that the data is responsible, if for example training $A$ on a more representative dataset $D'$ would have improved the performance. But it can similarly be argued that $A$ itself is at fault, if training a different variant $A'$ on the same dataset $D$ would have improved performance. As ML becomes widespread and such failure cases more common, these types of questions are proving to be far from hypothetical. With this motivation in mind, in this work we provide a rigorous formulation of the joint credit assignment problem between a learning algorithm $A$ and a dataset $D$. We propose Extended Shapley as a principled framework for this problem, and experiment empirically with how it can be used to address questions of ML accountability.

研究の動機と目的

  • モデルがサブパopulationで失敗した際の機械学習における責任追及の増大するニーズに対処すること。
  • 学習アルゴリズムと学習データの間の共同クレジット割り当て問題を形式的に定義すること。
  • アルゴリズムとデータの両方に公平に責任を帰属づける原理的でゲーム理論的な枠組みを構築すること。
  • 性能の低下がデータバイアスかアルゴリズム的設計由来かを実証的に分析できること。
  • 大規模データセットでも実用的な方法で共同寄与を計算できること。

提案手法

  • 古典的なシャープレイ値を拡張し、学習アルゴリズムとデータポイントの両方の寄与を一括してモデル化する。
  • すべての可能なデータサブセットにおいて、各アルゴリズムおよびデータポイントの限界寄与を計算する評価関数を定義する。
  • 大規模データセットでも効率的に拡張シャープレイ値を近似できるように、切断モンテカルロサンプリングを用いる。
  • 異なるデータサブセットにおけるアルゴリズム性能を比較することで、アルゴリズム選択とデータ構成の影響を分離する。
  • サンプリング中にシャープレイ値を段階的に更新する再帰的平均化スキームを採用し、収束性を向上させる。
  • 類似したサブセットサイズの繰り返し評価を避けるために、性能許容誤差しきい値を導入する。

実験結果

リサーチクエスチョン

  • RQ1訓練データとは独立して、学習アルゴリズムがサブパopulationで性能が悪いことにどの程度責任を負うことができるか。
  • RQ2モデルの失敗において、アルゴリズム設計とデータ品質の間で、どのように公平に責任を帰属づけることができるか。
  • RQ3共同クレジット割り当て枠組みは、性能問題が偏ったデータ由来か、非最適なアルゴリズム的選択由来かを区別できるか。
  • RQ4大規模機械学習環境において、このような共同寄与をどのように効率的に計算できるか。
  • RQ5バイアスを含む超解像モデルのような実世界の失敗事例において、この枠組みは意味のあるインサイトを明らかにできるか。

主な発見

  • 拡張シャープレイは、共同クレジット割り当てに望ましい公理を一意に満たしており、責任追及問題に対する原理的解決策である。
  • アダルトインCOMEデータセットでは、他のすべてのアルゴリズムと比較してアダブーストが正の拡張シャープレイ値を示し、データと併せた総合的寄与が優れていることを示した。
  • ラベル付きサブパopulationを含む合成実験を通じて、この枠組みはアルゴリズム的失敗とデータバイアスを明確に区別できた。
  • 切断モンテカルロ近似法は、48,000ポイントを超えるデータセットでさえも信頼性があり、効率的に収束した。
  • 拡張シャープレイ値は、単なる性能差のマージナルな測定値よりも深い洞察を提供し、失敗の主な原因がアルゴリズムかデータかを特定できた。
  • 制御された合成環境では、アルゴリズムBが完全な性能(値1.0)を示した一方で、アルゴリズムAの非線形意思決定境界が緑色ラベルの点で誤りを生じたことが正しく同定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。