Skip to main content
QUICK REVIEW

[論文レビュー] Ecosystem-level Analysis of Deployed Machine Learning Reveals Homogeneous Outcomes

Connor Toups, Rishi Bommasani|arXiv (Cornell University)|Jul 12, 2023
COVID-19 epidemiological studies被引用数 4
ひとこと要約

本稿は、個々のモデルではなく、複数のモデルの集団的出力を分析することで、展開済み機械学習が社会に与える影響を、エコシステムレベルの分析によって検討する。その結果、ユーザーがすべてのモデルによって誤分類されるというシステム的失敗が広範にわたり存在し、モデルの改善にもかかわらず持続していることが明らかになった。皮膚科分野のモデルでは、この枠組み下で人種的格差が顕著に強調され、従来の公平性指標では捉えきれない限界が浮き彫りになった。

ABSTRACT

Machine learning is traditionally studied at the model level: researchers measure and improve the accuracy, robustness, bias, efficiency, and other dimensions of specific models. In practice, the societal impact of machine learning is determined by the surrounding context of machine learning deployments. To capture this, we introduce ecosystem-level analysis: rather than analyzing a single model, we consider the collection of models that are deployed in a given context. For example, ecosystem-level analysis in hiring recognizes that a job candidate's outcomes are not only determined by a single hiring algorithm or firm but instead by the collective decisions of all the firms they applied to. Across three modalities (text, images, speech) and 11 datasets, we establish a clear trend: deployed machine learning is prone to systemic failure, meaning some users are exclusively misclassified by all models available. Even when individual models improve at the population level over time, we find these improvements rarely reduce the prevalence of systemic failure. Instead, the benefits of these improvements predominantly accrue to individuals who are already correctly classified by other models. In light of these trends, we consider medical imaging for dermatology where the costs of systemic failure are especially high. While traditional analyses reveal racial performance disparities for both models and humans, ecosystem-level analysis reveals new forms of racial disparity in model predictions that do not present in human predictions. These examples demonstrate ecosystem-level analysis has unique strengths for characterizing the societal impact of machine learning.

研究の動機と目的

  • 個々のモデルの公平性分析の限界を克服するため、複数の展開済みモデルが個人に与える集団的影響に焦点を移す。
  • 個々のモデルの改善が、すべてのモデルがユーザーを誤分類するというシステム的失敗を減少させるかを調査する。
  • 従来のグループレベルの公平性分析では見えない、機械学習の出力における新たな人種的格差を特定する。
  • エコシステム内で全モデルに失敗し続けるマイノリティの個人に、モデルの改善がどのような影響を与えるかを評価する。
  • 従来のモデル中心の評価に比べ、エコシステムレベルの分析がより洗練され、社会的影響が顕著に現れることを示す。

提案手法

  • エコシステム内の全意思決定者から個人が得る結果の集まりを失敗行列 F として定義する。
  • システム的失敗を、エコシステム内のすべてのモデルから否定的結果を得る個人として特定する。
  • 11のデータセット(テキスト、音声、ビジョンのモダリティ)を対象に、各モダリティで3つの商用システムを用いてHAPI監査フレームワークを適用する。
  • モデルパフォーマンスの粗大な改善とネット改善を測定し、進歩がシステム的失敗を減少させるかを評価する。
  • Fitzpatrick皮膚タイプのラベルが付与されたDDIデータセットを用いて、皮膚科モデルと人間の皮膚科医のエコシステムレベル分析を実施する。
  • プロファイルの極端化と人種的格差指標を用いて、モデルと人間の結果を比較する。HAM10kは全般的に否定的予測を下すため除外した。
Ecosystem-level Analysis of Deployed Machine Learning Reveals Homogeneous Outcomes

実験結果

リサーチクエスチョン

  • RQ1すべてのモデルがユーザーを誤分類するというシステム的失敗は、展開済み機械学習システム全体でどの程度持続しているか?
  • RQ2個々のモデルの改善は、すべてのモデルが誤分類するユーザーを対象とした失敗を減少させるのか、それとも、すでに他のモデルで正しく分類されているユーザーに限定的か?
  • RQ3エコシステムレベルの分析では、従来の公平性指標と比較して、モデルパフォーマンスの人種的格差はどのように現れるか?
  • RQ4皮膚科モデルは、人間の皮膚科医と比較して、集団的な出力においてより極端化し、人種的バイアスを示すか?
  • RQ5システム的失敗の進歩に関して、粗大な改善と比較して、ネット改善はどの程度効果を示すか?

主な発見

  • テキスト、音声、ビジョンの11のデータセットにわたり、すべてのモデルがユーザーを誤分類するシステム的失敗が広く存在しており、極端化率は個々のモデルの動作予測をはるかに上回っている。
  • waimaiデータセットでは誤差率が2.5%低下したが、Amazonのセンチメント分析APIは、すべての他のモデルが失敗するインスタンスに対しては、粗大な改善をゼロにとどめた。
  • 平均して、モデルのインスタンスレベルの改善のうち10%しか、すべての他のモデルが誤分類するケースに当てはまらない。しかし、システム的失敗は、改善可能な全ケースの27%を占めている。
  • 皮膚科分野では、色の濃い肌のタイプに対してモデルの極端化が増加しており、人間の予測にはその傾向が見られない。これは、従来の公平性分析では見えない新たな人種的不平等を示している。
  • HAM10kモデルを含めると、プロファイルの極端化と人種的格差が悪化し、研究結果がモデルの除外に起因するものではないこと、耐久性があることが確認された。
  • ネット改善は粗大な改善よりも、システム的失敗の進歩に対してさらに低い成果を示しており、モデルの成果が、もともと支援を受けやすい人々に集中していることが示された。
Ecosystem-level Analysis of Deployed Machine Learning Reveals Homogeneous Outcomes

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。