Skip to main content
QUICK REVIEW

[論文レビュー] Diversity and Language Technology: How Techno-Linguistic Bias Can Cause Epistemic Injustice

Paula Helm, Gábor Bella|arXiv (Cornell University)|Jul 25, 2023
Epistemology, Ethics, and Metaphysics被引用数 5
ひとこと要約

本稿は「技術的言語的バイアス」と呼ばれるものを導入する—これは言語技術における体系的で設計段階の偏見であり、支配的言語や文化を優遇することで、非支配的世界観を排除し、認識論的不正を引き起こす。単にAIツールをより多くの言語に拡張するだけでは、根本的な設計バイアスに対処しないまま排除を継続させ、真の多様性を損なう。本稿は、非支配的コミュニティと共同で開発することで、認識論的自己決定権を保障することを提唱する。

ABSTRACT

It is well known that AI-based language technology -- large language models, machine translation systems, multilingual dictionaries, and corpora -- is currently limited to 2 to 3 percent of the world's most widely spoken and/or financially and politically best supported languages. In response, recent research efforts have sought to extend the reach of AI technology to ``underserved languages.'' In this paper, we show that many of these attempts produce flawed solutions that adhere to a hard-wired representational preference for certain languages, which we call techno-linguistic bias. Techno-linguistic bias is distinct from the well-established phenomenon of linguistic bias as it does not concern the languages represented but rather the design of the technologies. As we show through the paper, techno-linguistic bias can result in systems that can only express concepts that are part of the language and culture of dominant powers, unable to correctly represent concepts from other communities. We argue that at the root of this problem lies a systematic tendency of technology developer communities to apply a simplistic understanding of diversity which does not do justice to the more profound differences that languages, and ultimately the communities that speak them, embody. Drawing on the concept of epistemic injustice, we point to the broader sociopolitical consequences of the bias we identify and show how it can lead not only to a disregard for valuable aspects of diversity but also to an under-representation of the needs and diverse worldviews of marginalized language communities.

研究の動機と目的

  • 言語技術における新しい形のバイアス—技術的言語的バイアスを特定・分析すること。これは言語的バイアスとは異なり、データやモデルそのものではなく、システムの設計および手法に根ざしている。
  • このバイアスが、キーンシップ用語や時間体系など文化的に特異な概念がAIツールに反映されない「語彙的ギャップ」を生じさせることを示すこと。
  • 現在の多言語AI拡張策が、一様な技術的スケーリングを通じて植民地時代の階級構造を再現する場合、それが不十分かつ有害であることを主張すること。
  • このバイアスの社会的・政治的影響、特に場所に根ざした知識の抹消と、非支配的言語コミュニティの認識論的自己決定権の否定を浮き彫りにすること。
  • 白人救世主的思考や技術的保護的態度を避けるべきであり、批判的でコミュニティ主導の共同開発を軸とした言語技術開発の根本的再考を呼びかけること。

提案手法

  • 大規模言語モデル、機械翻訳、コーパスといった既存の多言語言語技術を分析し、その設計上の選択と表象的制限に焦点を当てる。
  • 技術的言語的バイアスを、特に英語圏および西洋中心のモデルに関連する支配的地理的勢力と関連する言語や文化的枠組みへの意図的な優遇と特定する。
  • フリッカーの提唱する「認識論的不正」の概念を用い、非支配的世界観の排除を体系的知識に基づく抑圧の形態として位置づける。
  • Wikipediaなどのデジタルプラットフォームにおける言語表象の比較を通じて、話者数とデジタル可視性の乖離(例:キスワヒリ語 vs. ブレトン語)を露呈する。
  • 広く使われる貿易言語を軸とする多極的言語技術開発モデルを提唱するが、技術的設計および権力構造の批判的検証を含める。
  • 非支配的言語コミュニティの声と認識論的実践をシステム設計に中心に据える、価値に配慮した、コミュニティ志向の研究手法を提唱する。

実験結果

リサーチクエスチョン

  • RQ1技術的言語的バイアス—言語技術の設計に埋め込まれたバイアス—は、言語的バイアスとはどのように異なり、その体系的結果は何か?
  • RQ2AI言語システムにおける語彙的ギャップは、非西洋的世界観や社会的慣習の排除をどのように反映・再生産するか?
  • RQ3現在の多言語AI拡張策が意味的な多様性を達成できない理由は何か? そして、それらが歴史的権力格差を強化する仕組みは何か?
  • RQ4言語技術開発はどのように再構築されれば、認識論的不正を回避し、非支配的コミュニティの認識論的自己決定権を支援できるか?
  • RQ5貿易言語や多言語システムアーキテクチャは、技術的言語的バイアスの緩和または再生産にどのような役割を果たすか?

主な発見

  • 技術的言語的バイアスは、支配的地理的勢力に属する言語や文化的枠組みを優遇する、体系的で設計段階の偏見であり、排除的結果をもたらす。
  • 多言語AIの拡張に向けた努力にもかかわらず、キーンシップ関係、時間体系、食料用語など文化的に特異な概念が反映されず、認識論的抹消を示す語彙的ギャップが生じている。
  • データ不足によるものだけでなく、植民地時代の権力構造を反映する中央集権的で上位から下位への開発が、デジタル言語格差を維持している。
  • デジタル表象の格差は顕著である:8000万人の話者がいるキスワヒリ語は、20万人の話者のブレトン語よりもはるかに少ないデジタル支援を受けている。これは、制度的・技術的投資の不均等に起因する。
  • 現在のAIベースの言語ツールは、非支配的言語に埋め込まれた場所に根ざした知識や世界観を認識・表象しないことで、認識論的不正を再現している。
  • 本稿は、言語コミュニティとの共同開発なしに技術的拡張を進めるのは、むしろ排除を深めるリスクをはらんでおり、植民地的権力構造を再現しないよう、批判的で相互学習型のフレームワークに基づいた再構築が不可欠であると結論づける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。