[论文解读] Harnessing the Power of Artificial Intelligence to Vitalize Endangered Indigenous Languages: Technologies and Experiences
本文提出一种由社区主导的AI开发循环,通过微调大语言模型(LLMs)和小规模数据,以振兴巴西濒危的原住民语言。通过让原住民社区参与共同设计,作者成功开发出高质量的机器翻译系统、拼写检查器和写作助手,证明即使数据极少,只要遵循伦理和去殖民化原则,也能实现具有影响力的、可扩展的语言技术。
Since 2022 we have been exploring application areas and technologies in which Artificial Intelligence (AI) and modern Natural Language Processing (NLP), such as Large Language Models (LLMs), can be employed to foster the usage and facilitate the documentation of Indigenous languages which are in danger of disappearing. We start by discussing the decreasing diversity of languages in the world and how working with Indigenous languages poses unique ethical challenges for AI and NLP. To address those challenges, we propose an alternative development AI cycle based on community engagement and usage. Then, we report encouraging results in the development of high-quality machine learning translators for Indigenous languages by fine-tuning state-of-the-art (SOTA) translators with tiny amounts of data and discuss how to avoid some common pitfalls in the process. We also present prototypes we have built in projects done in 2023 and 2024 with Indigenous communities in Brazil, aimed at facilitating writing, and discuss the development of Indigenous Language Models (ILMs) as a replicable and scalable way to create spell-checkers, next-word predictors, and similar tools. Finally, we discuss how we envision a future for language documentation where dying languages are preserved as interactive language models.
研究动机与目标
- 通过聚焦社区参与和原住民数据主权,解决原住民语言在AI和自然语言处理(NLP)中代表性不足的问题。
- 通过使用最少数据和微调技术,开发可扩展、可复制的AI工具,克服原住民语言语言资源稀缺的问题。
- 创建实用、交互式的语言技术工具(如翻译系统和写作助手),以支持语言记录、教育和复兴。
- 建立一个可持续的、由社区拥有并主导的AI开发循环,使原住民社区能够主导语言技术的设计、治理和演进。
- 证明:即使使用极小的数据集对最先进的大语言模型进行微调,也能为濒危语言生成高质量、领域特定的工具。
提出的方法
- 采用以社区参与为核心的AI开发流程,优先考虑原住民领导力、数据主权和共同创造,而非自上而下的技术部署。
- 使用原住民语言社区提供的极少量高质量平行语料,对最先进的多语言翻译模型进行微调。
- 开发原住民语言模型(ILMs)作为构建下游工具(如拼写检查器、下一个词预测器和写作助手)的基础。
- 利用提示工程和检索增强生成(RAG)技术,在训练数据有限的情况下提升模型性能。
- 在真实教育和文化场景中,与原住民社区(如尼扬加图语、瓜拉尼语、特雷纳语)合作开发并测试原型系统。
- 设计一个模块化、可扩展的ILM生产框架,包含合成数据生成和可复用的训练数据处理流水线,以实现跨语言的复制与推广。

实验结果
研究问题
- RQ1如何在数据极少的情况下,以合乎伦理的方式应用AI和NLP技术,支持濒危原住民语言的复兴?
- RQ2社区共同设计和数据主权在确保原住民语言AI工具的可持续性和合法性方面发挥什么作用?
- RQ3使用极小数据集对大语言模型进行微调,在多大程度上能产生可用且高质量的语言工具(如翻译系统和拼写检查器)?
- RQ4如何设计写作助手和语言模型,以支持原住民青年和社区的读写能力和语言使用?
- RQ5哪些技术和社交框架能够实现原住民语言模型(ILM)开发在多种原住民语言间的复制与扩展?
主要发现
- 使用极少量数据(如数百至数千对句子)对最先进的多语言翻译模型进行微调,成功生成了高质量、可使用的原住民语言机器翻译系统。
- 原住民语言模型(ILMs)的开发使得即使在语言资源有限的情况下,也能构建实用工具,如拼写检查器、下一个词预测器和写作助手。
- 与尼扬加图语使用者的学生和教师开展的社区工作坊揭示了对数字工具的强烈需求,以及对计算机科学教育的兴趣,表明具备长期社区主导的潜力。
- 该项目证明,在小规模高质量数据集上微调大语言模型,可避免数据污染问题,并产生可靠、领域特定的输出,尤其当结合提示工程时效果更佳。
- 已建立一个可复制、由社区主导的AI开发循环,原型通过与原住民社区和教育工作者的直接协作实现迭代优化。
- 该项目为未来奠定了基础:濒危语言不仅作为静态文本被保存,更将作为可交互、可应用的语言模型,活跃于教育、法律、医疗和经济等各个领域。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。