Skip to main content
QUICK REVIEW

[論文レビュー] Disembodied Machine Learning: On the Illusion of Objectivity in NLP

Zeerak Waseem, Smarika Lulz|arXiv (Cornell University)|Jan 28, 2021
Ethics and Social Impacts of AI参考文献 36被引用数 9
ひとこと要約

この論文は、自然言語処理(NLP)における客観性は幻想であると主張している。機械学習モデルは、データ収集からモデル訓練に至るまで、根本的に主観的で身体的(エンベッドされた)選択を内蔵しているからである。偏見の是正策は根本的に限界があるとされ、偏見は避けられないものであり、システム的であるとされ、代わりに社会的マイノリティを真正に扱うためには、主観的立場の受容を求める。

ABSTRACT

Machine Learning seeks to identify and encode bodies of knowledge within provided datasets. However, data encodes subjective content, which determines the possible outcomes of the models trained on it. Because such subjectivity enables marginalisation of parts of society, it is termed (social) `bias' and sought to be removed. In this paper, we contextualise this discourse of bias in the ML community against the subjective choices in the development process. Through a consideration of how choices in data and model development construct subjectivity, or biases that are represented in a model, we argue that addressing and mitigating biases is near-impossible. This is because both data and ML models are objects for which meaning is made in each step of the development pipeline, from data selection over annotation to model training and analysis. Accordingly, we find the prevalent discourse of bias limiting in its ability to address social marginalisation. We recommend to be conscientious of this, and to accept that de-biasing methods only correct for a fraction of biases.

研究の動機と目的

  • 偏見を有限的で除去可能な問題とみなすNLP分野の支配的議論を批判すること。
  • 機械学習における「客観性」の主張が、データおよびモデル設計における身体的で政治的な選択を隠蔽していることの暴露。
  • 是正手法がシステム的偏見のほんの一部しか是正しないことから、社会的マイノリティの問題に対処するには不十分であると主張すること。
  • 偏見の除去から、政治的・社会的エンベッティングを認識する自己反省的で立場に気づいた機械学習開発への移行を提唱すること。
  • 社会的マイノリティの生活経験と主観性を核とする公平性に関する議論の再定式化。

提案手法

  • ドナ・ハラウェイの「神のトリック」の概念を適用し、MLにおける客観性の主張が、身体的でない主観性の一種であることを批判的に検証する。
  • データ選択、アノテーション、モデル訓練が、社会的・文化的・政治的主観性を内蔵していることの分析。
  • 品詞タグセットや単語埋め込みといったNLPの事例を用いて、技術的基準が特定の言語的・社会的仮定を反映していることを示す。
  • トランスファー学習およびマルチタスク学習が、原則として文脈的および著者的エンベッティングをモデルに組み込むメカニズムであることを検討する。
  • フェミニスト科学・技術研究(STS)を援用し、偏見を除去すべき欠陥ではなく、継続的な自己反省を要する政治的状態と再定式化する。
  • 解決志向のアプローチから、研究者の自らの立場性とその結果を核とする自己反省的フレームワークへの置き換えを提言する。

実験結果

リサーチクエスチョン

  • RQ1NLPにおける客観性の幻想は、データおよびモデル開発に埋め込まれた主観的・身体的選択をどのように隠蔽しているか?
  • RQ2なぜ機械学習における是正アプローチは、根本的にシステム的社會的マイノリティを是正する上で限界をもつのか?
  • RQ3データおよびモデル設計の選択は、どのように支配的で社会的立場を反映・強化しているか?
  • RQ4ML研究は、どのようにして解決志向の偏見除去モデルから、主観的立場性と政治的自覚に基づくものに移行できるか?
  • RQ5品詞タグセットや単語埋め込みといった技術的実装は、どのように社会的偏見を埋め込み、継続的に再生産しているか?

主な発見

  • MLにおける客観性の追求は、支配的で身体的でない視点を優遇する政治的行為であり、開発者およびデータソースの主観性を隠蔽している。
  • NLPモデルにおける偏見は、知識生産の身体的・状況的性質に根ざしており、除去すべきバグではなく、避けられない特徴である。
  • 単語埋め込みの是正といった是正技術は、ジェンダー的および社会的構造の残存痕跡を残し、完全な偏見除去が不可能であることを示している。
  • ペーン・ツリー・バンクのような、見かけ上中立的なツール(例:品詞タグセット)でさえ、特定の言語理論を反映しており、特定の言語形態を他のものよりも優遇している。
  • トランスファー学習およびマルチタスク学習は、文脈および著者アイデンティティをモデルにエンベッティングする部分的な道筋を提供するが、どの視点を含めるかという選択自体が政治的である。
  • 現在のMLにおける偏見に関する議論は、研究プロセスに埋め込まれたパワー・ダイナミクスを十分に考慮していないため、代表されない声の継続的マイノリティ化を招いている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。