Skip to main content
QUICK REVIEW

[논문 리뷰] Harnessing the Power of Artificial Intelligence to Vitalize Endangered Indigenous Languages: Technologies and Experiences

Cláudio Pinhanez, Paulo Cavalin|arXiv (Cornell University)|2024. 07. 17.
Second Language Learning and Teaching인용 수 4
한 줄 요약

이 논문은 브라질의 멸종 위험에 처한 자국민 언어를 복원하기 위해 공동체 중심의 인공지능 개발 주기를 제안한다. 이는 최적화된 대규모 언어 모델(Large Language Models, LLMs)과 소규모 데이터를 활용한다. 공동체와의 협업을 통해 저자들은 높은 품질의 기계 번역기, 철자 검사기, 글쓰기 보조 도구를 성공적으로 개발하였으며, 윤리적이고 탈식민주의 원칙에 따라 지도된다면 미미한 데이터로도 영향력 있고 확장 가능한 언어 기술을 도출할 수 있음을 입증한다.

ABSTRACT

Since 2022 we have been exploring application areas and technologies in which Artificial Intelligence (AI) and modern Natural Language Processing (NLP), such as Large Language Models (LLMs), can be employed to foster the usage and facilitate the documentation of Indigenous languages which are in danger of disappearing. We start by discussing the decreasing diversity of languages in the world and how working with Indigenous languages poses unique ethical challenges for AI and NLP. To address those challenges, we propose an alternative development AI cycle based on community engagement and usage. Then, we report encouraging results in the development of high-quality machine learning translators for Indigenous languages by fine-tuning state-of-the-art (SOTA) translators with tiny amounts of data and discuss how to avoid some common pitfalls in the process. We also present prototypes we have built in projects done in 2023 and 2024 with Indigenous communities in Brazil, aimed at facilitating writing, and discuss the development of Indigenous Language Models (ILMs) as a replicable and scalable way to create spell-checkers, next-word predictors, and similar tools. Finally, we discuss how we envision a future for language documentation where dying languages are preserved as interactive language models.

연구 동기 및 목표

  • 공동체 참여와 자국민 데이터 주권을 중심으로 삼아, AI 및 자연어처리(NLP) 분야에서 자국민 언어의 부족한 표현 문제를 해결한다.
  • 자국민 언어의 언어 자료 부족 문제를 해결하기 위해 최소한의 데이터와 최적화를 활용해 확장 가능하고 재사용 가능한 AI 도구를 개발한다.
  • 언어 기록, 교육, 복원 활동을 지원하기 위한 실용적이고 상호작용 가능한 언어 기술 도구(예: 번역기, 글쓰기 보조 도구)를 개발한다.
  • 자국민 공동체가 설계, 거버넌스, 언어 기술의 진화를 주도하는 지속 가능한 공동체 소유의 AI 개발 주기를 수립한다.
  • 초소형 데이터셋으로 최첨단 LLM을 최적화함으로써, 멸종 위험에 처한 언어를 위한 고성능, 영역 특화 도구를 생산할 수 있음을 입증한다.

제안 방법

  • 상향식 기술 배포가 아닌 공동체 리더십, 데이터 주권, 공동 창조를 우선시하는 공동체 참여형 AI 개발 주기를 채택한다.
  • 자국민 언어 공동체로부터의 최소한이지만 고품질의 병렬 어휘 자료를 활용해 최첨단(SOTA) 다국어 번역기를 최적화한다.
  • 철자 검사기, 다음 단어 예측기, 글쓰기 보조 도구와 같은 후행 도구를 구축하기 위한 기초로 자국민 언어 모델(ILMs)을 개발한다.
  • 제한된 학습 데이터 상황에서도 성능을 향상시키기 위해 프롬프트 엔지니어링과 검색 기반 증강 생성(Retrieval-Augmented Generation, RAG)을 활용한다.
  • 실생활 교육 및 문화적 맥락에서 자국민 공동체(예: 니앙가투, 구아라니, 테레나)와 함께 프로토타입을 구축하고 테스트한다.
  • 합성 데이터 생성과 재사용 가능한 학습 데이터 파이프라인을 포함한, 확장 가능하고 모듈화된 ILM 제작 프레임워크를 설계한다.
Figure 1: Histograms of 444 Indigenous languages used in the Americas today and of 221 Indigenous languages in Brazil (based on 2010 numbers) with the number of languages for different logarithmic intervals of number of speakers.
Figure 1: Histograms of 444 Indigenous languages used in the Americas today and of 221 Indigenous languages in Brazil (based on 2010 numbers) with the number of languages for different logarithmic intervals of number of speakers.

실험 결과

연구 질문

  • RQ1최소한의 데이터로 윤리적으로 AI와 NLP를 적용하여 멸종 위험에 처한 자국민 언어의 복원을 지원할 수 있는 방법은 무엇인가?
  • RQ2공동체의 공동 설계와 데이터 주권은 자국민 언어를 위한 AI 도구의 지속 가능성과 합법성 확보에 어떤 역할을 하는가?
  • RQ3초소형 데이터셋으로 대규모 언어 모델을 최적화함으로써 번역기나 철자 검사기와 같은 실용적이고 고성능의 언어 도구를 얼마나 잘 생산할 수 있는가?
  • RQ4글쓰기 보조 도구와 언어 모델은 자국민 청소년 및 공동체의 독서 및 언어 사용을 어떻게 지원할 수 있는가?
  • RQ5다양한 자국민 언어 간에 자국민 언어 모델(ILM) 개발의 복제 및 확장을 가능하게 하는 기술적 및 사회적 프레임워크는 무엇인가?

주요 결과

  • 최소한의 데이터(예: 수백~수천 개의 문장 쌍)로 최첨단 다국어 번역기를 최적화함으로써, 자국민 언어를 위한 고성능이고 실용적인 기계 번역 시스템을 성공적으로 구현하였다.
  • 자국민 언어 모델(ILMs) 개발은 제한된 언어 자원 상황에서도 철자 검사기, 다음 단어 예측기, 글쓰기 보조 도구와 같은 실용적 도구의 개발을 가능하게 하였다.
  • 니앙가투어를 사용하는 학생들과 교사들과의 공동체 워크숍에서 디지털 도구에 대한 강한 수요와 컴퓨터 과학 교육에 대한 관심이 확인되어, 장기적인 공동체 소유 가능성의 잠재력을 보여주었다.
  • 작은 고품질 데이터셋으로 LLM을 최적화함으로써 오염 문제를 피하고, 특히 프롬프트 엔지니어링과 결합할 경우 신뢰할 수 있고 영역 특화된 출력을 생성할 수 있음을 입증하였다.
  • 재사용 가능한 공동체 중심의 AI 개발 주기가 수립되었으며, 공동체 및 교사들과의 직접적 협업을 통해 프로토타입이 반복적으로 개선되었다.
  • 이 프로젝트는 향후 멸종 위험에 처한 언어가 정적 텍스트로만 보존되는 것이 아니라, 교육, 법, 건강, 경제 분야에서 활발히 활용 가능한 상호작용적이고 기능적인 언어 모델로 보존될 수 있음을 토대를 마련하였다.
Figure 2: Histograms of the number of Brazilian Indigenous languages with a descriptive page in Wikipedia per number of speakers (left) and according to different levels of endangerment (right).
Figure 2: Histograms of the number of Brazilian Indigenous languages with a descriptive page in Wikipedia per number of speakers (left) and according to different levels of endangerment (right).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.