[论文解读] Language Varieties of Italy: Technology Challenges and Opportunities
本文挑战了NLP领域对意大利濒危语言变体的机器中心范式,倡导一种以说话人为中心的范式,强调语言多样性、文化语境和社区参与。该文提出建立一个参与式、跨学科的社区,通过伦理且具备文化意识的技术开发,负责任地支持意大利资源匮乏语言的活力。
Italy is characterized by a one-of-a-kind linguistic diversity landscape in Europe, which implicitly encodes local knowledge, cultural traditions, artistic expressions and history of its speakers. However, most local languages and dialects in Italy are at risk of disappearing within few generations. The NLP community has recently begun to engage with endangered languages, including those of Italy. Yet, most efforts assume that these varieties are under-resourced language monoliths with an established written form and homogeneous functions and needs, and thus highly interchangeable with each other and with high-resource, standardized languages. In this paper, we introduce the linguistic context of Italy and challenge the default machine-centric assumptions of NLP for Italy's language varieties. We advocate for a shift in the paradigm from machine-centric to speaker-centric NLP, and provide recommendations and opportunities for work that prioritizes languages and their speakers over technological advances. To facilitate the process, we finally propose building a local community towards responsible, participatory efforts aimed at supporting vitality of languages and dialects of Italy.
研究动机与目标
- 向NLP社区揭示意大利地区语言和方言的语言复杂性及其濒危状况。
- 批判主流的以机器为中心的NLP范式,该范式将地方语言变体视为同质的、资源匮乏的数据商品。
- 突出意大利语言变体在文化、功能和结构上的多样性,尤其是其口语性质以及与标准意大利语的语码转换关系。
- 提出从技术驱动的NLP转向尊重语言身份、文化语境和社区需求的以说话人为中心的设计。
- 建立一个参与式、跨学科的社区——“Boot的语言变体”(Varieties of the Boot)——以促进伦理协作和知识共享,推动语言保护。
提出的方法
- 分析意大利的语言景观,强调地区语言在历史、社会语言学和结构上的多样性,包括拉丁语、日耳曼语、Slavonic语和希腊语变体。
- 回顾现有的意大利语言变体NLP研究,识别出在数据代表性、拼写标准化和功能多样性方面的缺口。
- 批判认为书面、机器可读文本是主要数据来源的假设,主张纳入口语、语境特定及语码转换的语言使用。
- 提出一种以说话人为中心的NLP框架,重视文化语境、社区参与和参与式设计,而非技术可扩展性。
- 启动并推广“Boot的语言变体”——一个促进知识交流、伦理参与和跨语言学家、NLP研究人员与语音社区合作研究的社区平台。
- 探索在区域意大利变体、语码转换和语言变异大规模记录方面NLP的机遇,以补充传统的语言地图集。
实验结果
研究问题
- RQ1意大利地区语言变体的语言、文化和功能特征如何挑战标准机器中心NLP方法的假设?
- RQ2当前的NLP范式在多大程度上未能体现意大利濒危语言的口语性、非标准化性和语境依赖性?
- RQ3将地方语言变体视为可互换的数据资源用于机器学习,其伦理和实际影响是什么?
- RQ4参与式、社区驱动的NLP举措如何支持意大利语言遗产的长期活力?
- RQ5NLP在多大程度上存在机会来记录和呈现意大利语社区中的区域变异、语码转换和社会语言学动态?
主要发现
- 联合国教科文组织将超过30种意大利语言和方言列为濒危语言,反映出欧洲语言多样性最集中的地区之一。
- 大多数意大利地区语言主要为口语,缺乏标准化拼写系统,并与标准意大利语存在语码转换关系,而当前的NLP范式往往未能识别这一点。
- 认为书面数据能代表语言使用的假设,导致了同质化、无视文化的NLP系统,可能抹去区域性的词汇和功能差异——例如,Cimbrian方言中存在多个表示“雪”的词汇。
- 当前的NLP方法将语言变体视为可互换的数据点,忽视了其独特社会语言学角色、文化意义和社区特定需求。
- “Boot的语言变体”社区已建立为一个参与式平台,旨在促进伦理协作、分享最佳实践,并提高对意大利语言遗产的认识。
- 在NLP领域存在巨大机遇,可大规模研究区域意大利变体、语码转换和语言接触,为语言记录做出贡献,并补充传统的语言地图集(如ALI和AIS)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。