[论文解读] The State and Fate of Linguistic Diversity and Inclusion in the NLP World
本文通過將世界語言分為六種基於資源的類別,探討自然語言處理(NLP)中的語言多樣性與包容性,揭示了數據可用性與研究關注度之間的顯著差異。基於對資源、會議論文和嵌入投影的定量分析,研究顯示,即使擁有龐大母語人口,索馬里語等低資源語言仍系統性地被低估。然而,若社群能優先考慮公平的資源開發與語言包容的研究實踐,零-shot學習等新技術為未來的包容性帶來希望。
Language technologies contribute to promoting multilingualism and linguistic diversity around the world. However, only a very small number of the over 7000 languages of the world are represented in the rapidly evolving language technologies and applications. In this paper we look at the relation between the types of languages, resources, and their representation in NLP conferences to understand the trajectory that different languages have followed over time. Our quantitative investigation underlines the disparity between languages, especially in terms of their resources, and calls into question the "language agnostic" status of current models and systems. Through this paper, we attempt to convince the ACL community to prioritise the resolution of the predicaments highlighted here, so that no language is left behind.
研究动机与目标
- 探討當前自然語言處理(NLP)中語言多樣性與包容性的現狀,特別聚焦於語言資源可用性與研究關注度的差異。
- 分析標註與未標註資源的分佈如何與各語言的母語人口數量及語言類型特徵相關聯。
- 評估ACL會議在時間上的包容性,特別是在語言代表性與出版趨勢方面的表現。
- 評估資源可用性是否影響研究焦點、發表場所,以及NLP系統泛化能力的範圍。
- 識別NLP社群可採取的具體行動,以減少語言不平等,並透過包容性的研究實踐推動真正語言無關的模型。
提出的方法
- 基於標註與未標註資源的數量,提出六類語言分類法,實現對語言數位存在的系統性分類。
- 從主要NLP資源庫(LDC、ELRA、LRE、Wikipedia、Common Crawl)收集並分析數據,以量化每種語言的資源可用性。
- 追蹤2000至2020年間,ACL、NAACL、EACL、EMNLP、LREC與WS會議中提及特定語言(X與Y)的論文數量,以評估研究可見度。
- 應用多變量統計技術,包括熵計算與t-SNE可視化,分析語言與會議嵌入空間。
- 使用不同K值下的平均倒數排名(MRR)來衡量跨語言類別的檢索效能與研究關注度。
- 評估語言嵌入與會議嵌入之間的接近程度,以衡量會議在出版趨勢中反映語言多樣性的程度。
实验结果
研究问题
- RQ1全球七千多種語言的標註與未標註語言資源如何分佈?這種分佈與母語人口數量有何關聯?
- RQ2由於特定語言缺乏數據與研究,哪些語言類型特徵在當前NLP系統中代表性不足?
- RQ3ACL社群是否隨著時間推移變得更具語言包容性,特別是與早期數十年相比?
- RQ4資源可用性在多大程度上影響NLP中研究問題的選擇與發表場所?
- RQ5個人研究者與社群在減少NLP中語言-資源差距方面可發揮何種作用?
主要发现
- 語言被系統性地分為六種基於資源的類別,其中資源極少的第0類與資源豐富的第5類在研究可見度方面呈現最顯著的差異。
- 儘管索馬里語(語言Y)擁有1800萬母語人口,但僅有5,500篇Wikipedia文章,且僅在LDC/ELRA中被提及2次;相比之下,荷蘭語(X)擁有2900萬母語人口,卻有69項LDC/ELRA資源。
- 低資源語言如緬甸語(K=10時MRR=0.02)、爪哇語(0.23)與伊博語(0.13)的MRR分數遠低於高資源語言(如日語、中文、土耳其語與印地語,K=10時MRR>0.75),顯示研究關注度極低。
- LREC與WS會議展現更高的包容性,其嵌入與MRR統計數據顯示它們更接近多樣化語言群集,而非ACL或NAACL,暗示更廣泛的語言覆蓋。
- 嵌入可視化顯示,資源較少的語言與ACL趨勢線距離更遠,表明技術與研究差距隨時間推移而擴大。
- NLP研究存在可檢測的時間演進趨勢,新興會議展現更強的語言包容性,而舊型會議仍集中於少數主導語言與主題。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。