Skip to main content
QUICK REVIEW

[논문 리뷰] Diversity and Language Technology: How Techno-Linguistic Bias Can Cause Epistemic Injustice

Paula Helm, Gábor Bella|arXiv (Cornell University)|2023. 07. 25.
Epistemology, Ethics, and Metaphysics인용 수 5
한 줄 요약

이 논문은 언어 기술에서의 '기술-언어적 편향'—지배적 언어와 문화를 우선시하는 체계적이고 설계 수준의 편향—을 소개한다. 이는 비지배적 세계관을 간과함으로써 지식적 불의를 야기하며, 단순히 더 많은 언어로 AI 도구를 확장하는 것만으로는 근본적인 설계 편향을 해결하지 못하므로, 진정한 다양성을 확보하기 위해 지배받는 공동체와의 공동 창작이 필요하다고 주장한다. 이는 지식적 자결권을 보장하기 위한 것이다.

ABSTRACT

It is well known that AI-based language technology -- large language models, machine translation systems, multilingual dictionaries, and corpora -- is currently limited to 2 to 3 percent of the world's most widely spoken and/or financially and politically best supported languages. In response, recent research efforts have sought to extend the reach of AI technology to ``underserved languages.'' In this paper, we show that many of these attempts produce flawed solutions that adhere to a hard-wired representational preference for certain languages, which we call techno-linguistic bias. Techno-linguistic bias is distinct from the well-established phenomenon of linguistic bias as it does not concern the languages represented but rather the design of the technologies. As we show through the paper, techno-linguistic bias can result in systems that can only express concepts that are part of the language and culture of dominant powers, unable to correctly represent concepts from other communities. We argue that at the root of this problem lies a systematic tendency of technology developer communities to apply a simplistic understanding of diversity which does not do justice to the more profound differences that languages, and ultimately the communities that speak them, embody. Drawing on the concept of epistemic injustice, we point to the broader sociopolitical consequences of the bias we identify and show how it can lead not only to a disregard for valuable aspects of diversity but also to an under-representation of the needs and diverse worldviews of marginalized language communities.

연구 동기 및 목표

  • 언어 기술에서 새로운 형태의 편향—기술-언어적 편향—을 식별하고 분석하는 것. 이는 언어적 편향과는 다름. 데이터나 모델에만 국한되지 않고, 설계 및 방법론에 뿌리를 두고 있다.
  • 이 편향이 비지배적 세계관을 표현할 수 없는 문화적으로 특수한 개념(예: 친족 관계 어휘, 시간 체계 등)을 포함한 어휘 격차를 초래함으로써 어떻게 작용하는지 보여주는 것.
  • 현행 다국어 AI 확장 노력이 일률적인 기술적 확장 방식을 통해 식민지 시대의 계층 구조를 재현함으로써 충분치도 않으며, 오히려 해로울 수 있음을 주장하는 것.
  • 이 편향의 사회정치적 영향, 즉 현장 지식의 삭제와 지배받는 언어 공동체의 지식적 자결권 부정을 드러내는 것.
  • 백인 메시아주의나 기술적 부모다운 태도를 피한 비판적이고 공동체 중심의 공동 창작을 중심으로 언어 기술 개발 방식을 근본적으로 재고할 것을 주장하는 것.

제안 방법

  • 대규모 언어 모델, 기계 번역, 어휘자료 등 기존의 다국어 언어 기술을 분석하여 설계 선택 사항과 표현적 한계에 초점을 맞춘다.
  • 기술-언어적 편향을 지배적 지리 政치적 권력과 관련된 언어 및 문화 프레임워크를 설계적으로 우선시하는 것으로 규정한다. 특히 영어권 및 서구 중심의 모델을 중심으로 한다.
  • 프리커의 지식적 불의 개념을 활용하여, 비지배적 세계관의 배제를 체계적 지식 기반 억압의 형태로 프레임화한다.
  • 위키피디아 등의 디지털 플랫폼에서의 언어 표현을 비교함으로써, 어휘 수와 디지털 가시성 간의 격차를 폭 드러낸다. 예를 들어, 스포크가 8000만 명이지만 디지털 지원은 브레튼어(20만 명)보다 훨씬 적은 경우.
  • 광범위하게 사용되는 무역어를 기준으로 삼는 다극모델의 언어 기술 개발 방식을 제안하지만, 이는 기술 설계 및 권력 구조에 대한 비판적 검토를 포함한다.
  • 지배받는 언어 공동체의 목소리와 지식 실천 방식을 시스템 설계에 중심에 두는 가치 중심의, 공동체 중심의 연구 방법론을 주장한다.

실험 결과

연구 질문

  • RQ1기술-언어적 편향—언어 기술 설계에 내재된 편향—은 언어적 편향과 어떻게 다를까? 그리고 그 체계적 결과는 무엇인가?
  • RQ2AI 언어 시스템의 어휘 격차는 비서구 세계관과 사회적 관습의 배제를 어떻게 반영하고 재생산하는가?
  • RQ3현행 다국어 AI 확장 노력은 왜 의미 있는 다양성을 달성하지 못하며, 역사적 권력 불균형을 어떻게 강화하는가?
  • RQ4어떻게 언어 기술 개발 방식을 재구성하여 지식적 불의를 방지하고 지배받는 공동체의 지식적 자결권을 지원할 수 있는가?
  • RQ5무역어와 다국어 시스템 아키텍처는 기술-언어적 편향을 완화하거나 재생산하는 데 어떤 역할을 하는가?

주요 결과

  • 기술-언어적 편향은 특정 언어와 문화 프레임워크를 우선시하는 체계적 설계 수준의 선호로, 특히 지배적 지리 정치적 권력의 언어와 문화를 중심으로 하여 배제적 결과를 초래한다.
  • 다국어 AI 확장 노력에도 불구하고, 시스템은 종종 친족 관계, 시간 체계, 음식 어휘 등 문화적으로 특수한 개념을 표현하지 못해 어휘 격차를 초래하며, 이는 지식적 삭제를 반영한다.
  • 디지털 언어 격차는 자료 부족 때문 뿐 아니라, 식민지 시대의 권력 구조를 반영하는 중심집중형, 상향식 개발 방식 때문이기도 하다.
  • 디지털 표현의 격차는 뚜렷하다. 스포크어는 8000만 명의 사용자가 있지만, 디지털 지원은 브레튼어(20만 명)보다 훨씬 적다. 이는 기관적·기술적 투자 격차 때문이기도 하다.
  • 현재의 AI 기반 언어 도구는 비지배적 언어에 내재된 현장 지식과 세계관을 인식하거나 표현하지 못함으로써 지식적 불의를 재생산한다.
  • 논문은 기술적 확장을 공동체와의 공동 창작 없이 진행할 경우 지배받는 상태를 심화시킬 수 있으며, 식민지적 권력 관계를 재생산하지 않기 위해 비판적이고 상호 학습 기반의 프레임워크로 재구성되어야 한다고 결론 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.