[논문 리뷰] Some Languages are More Equal than Others: Probing Deeper into the Linguistic Disparity in the NLP World
이 논문은 언어학적 불균형을 분석하여 12개의 Ethnologue 카테고리(언어 사용자 인구수 및 생존도 기반)에서 자원 분포를 조사한다. 분석 결과, 데이터가 풍부한 언어—특히 대규모 기관에 의해 지원받는 언어—가 NLP 자원을 지배하는 반면, 소규모 및 멸종 위험 언어들은 심지어 같은 언어 가문 내에서도 체계적 편향으로 인해 심각하게 부족한 자원을 경험함을 드러낸다. 이러한 편향은 지리, GDP, 언어 가문과 관련이 있다. 연구는 디지털 격차를 해소하기 위해 공정한 자원 정제 및 포괄적인 NLP 개발을 촉구한다.
Linguistic disparity in the NLP world is a problem that has been widely acknowledged recently. However, different facets of this problem, or the reasons behind this disparity are seldom discussed within the NLP community. This paper provides a comprehensive analysis of the disparity that exists within the languages of the world. We show that simply categorising languages considering data availability may not be always correct. Using an existing language categorisation based on speaker population and vitality, we analyse the distribution of language data resources, amount of NLP/CL research, inclusion in multilingual web-based platforms and the inclusion in pre-trained multilingual models. We show that many languages do not get covered in these resources or platforms, and even within the languages belonging to the same language group, there is wide disparity. We analyse the impact of family, geographical location, GDP and the speaker population of languages and provide possible reasons for this disparity, along with some suggestions to overcome the same.
연구 동기 및 목표
- 자원 가용성 외에도 다국어 플랫폼 및 사전 훈련된 모델에의 포함 여부를 고려하여 NLP에서의 언어학적 불균형을 분석하기 위해.
- 동일한 언어 가문이나 지리적 지역에 속해 있음에도 불구하고 일부 언어가 왜 여전히 부족한 자원을 경험하는지 조사하기 위해.
- GDP, 언어 가문, 사용자 인구수 등 사회경제적 요인과 언어학적 요인들이 이러한 불균형에 기여하는 방식을 특정하기 위해.
- 공정한 언어 자원 개발 및 NLP 시스템 내 포함을 위한 실천 가능한 권고안을 제안하기 위해.
- 자원 가용성만으로도 언어의 '자원 풍부성'이 결정된다는 전제를 도전하기 위해.
제안 방법
- 연구는 사용자 인구수(대규모, 중간, 소규모)와 생존도(멸종, 위험, 안정, 기관 지원) 기반으로 Ethnologue의 12개 언어 분류 체계를 사용한다.
- 연구자들은 네 가지 차원에서 언어 자원 분포를 평가한다: NLP/CL 연구 성과, 다국어 웹 플랫폼에의 포함 여부, 다국어 사전 훈련된 모델(예: mBERT, XLM-R)에의 포함 여부, 그리고 위키백과와 허깅페이스에서의 데이터 가용성.
- 연구자들은 허깅페이스와 위키백과에서 2021년 11월부터 2022년 7월까지의 데이터셋 성장률을 분석하며, 각 카테고리의 크기에 따라 정규화하여 상대적 진전을 평가한다.
- 언어 카테고리 간 비교 분석을 수행하여 언어 가문과 지리적 지역 내 불균형을 부각한다.
- 연구는 언어학적 불균형과 GDP, 지리적 위치, 언어 가문 간 상관관계를 특정한다.
- NLP 연구자들을 대상으로 설문 조사를 실시하여, 특히 동아시아 지역에서의 포함 및 협업 격차를 평가한다.
실험 결과
연구 질문
- RQ1사용자 인구수와 생존도 기반 언어 카테고리가 실제로 NLP 자원 가용성과 어느 정도 상관관계가 있는가?
- RQ2동일한 언어 가문이나 지역 내에서 일부 언어가 NLP 자원 및 모델에 훨씬 더 높은 수준으로 포함되는 이유는 무엇인가?
- RQ3다국어 플랫폼(예: 페이스북)과 사전 훈련된 모델(예: mBERT, XLM-R)에 언어가 포함되는 정도가 언어 카테고리 간에 어떻게 다름가?
- RQ4GDP와 지리적 위치와 같은 사회경제적 요인이 NLP에서 언어학적 불균형을 어떻게 형성하는가?
- RQ5왜 동아시아 및 기타 지역의 언어들은 공개 NLP 연구 커뮤니티와 데이터셋에서 지속적으로 부족한가?
주요 결과
- 대규모-기관 지원 언어 카테고리에서는 2021년 11월에서 2022년 7월 사이에 허깅페이스 데이터셋이 정규화 기준으로 245,941.37% 증가하여, 이미 자원이 풍부한 언어에 데이터 성장이 집중됨을 보여준다.
- 소규모-멸종 및 소규모-위험 언어 카테고리에서는 허깅페이스에서 데이터셋 성장이 없었으며, 정규화 기준으로 0% 증가를 기록하여 체계적 간과를 드러낸다.
- 중간-기관 지원 및 대규모-기관 지원 언어는 NLP 연구 주목과 모델 포함의 대부분을 차지하지만, 소규모 및 위험 언어는 거의 간과당한다.
- 커뮤니티 노력에도 불구하고, 중간-위험 언어의 위키백과 기사 수는 정규화 기준으로 1,421.19% 증가하여, 기초적인 디지털 보존 노력은 활발히 이루어지고 있음을 보여주지만, 규모적으로는 부족함을 드러낸다.
- 설문 조사 결과, 특히 중국에서 온 연구자들이 공개 NLP 메일링 리스트 및 협업 네트워크에서 현저하게 부족한 것으로 나타나, 언어 장벽과 고립된 연구 공동체가 원인일 가능성이 있다.
- 동일한 언어 가문 내에서도 데이터 가용성과 모델 포함 여부에 큰 격차가 있었으며, 이는 가문 소속만으로도 공정한 포함이 보장되지 않음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.