Skip to main content
QUICK REVIEW

[논문 리뷰] Language Technology Programme for Icelandic 2019-2023

Anna Bjørk Nikulásdóttir, Jón Guðnason|arXiv (Cornell University)|2020. 03. 20.
Natural Language Processing Techniques참고 문헌 32인용 수 5
한 줄 요약

이 논문은 2019–2023년 기간 동안 아이сл란드어의 디지털 커뮤니케이션 가능성을 보장하기 위해 오픈소스 기반의 핵심 NLP 도구 및 언어 자원 개발을 추진하는 5년간의 국가 차원의 언어 기술 프로그램을 제시한다. 이 프로그램은 음성 인식, 기계 번역, 철자 및 문법 검사, 음성 합성에 중점을 두며, 모든 결과물은 접근성과 산업적 도입을 보장하기 위해 오픈 라이선스 하에 공개된다. 이는 경쟁적인 연구개발 기금과 학술 교육 프로그램을 통해 뒷받침된다.

ABSTRACT

In this paper, we describe a new national language technology programme for Icelandic. The programme, which spans a period of five years, aims at making Icelandic usable in communication and interactions in the digital world, by developing accessible, open-source language resources and software. The research and development work within the programme is carried out by a consortium of universities, institutions, and private companies, with a strong emphasis on cooperation between academia and industries. Five core projects will be the main content of the programme: language resources, speech recognition, speech synthesis, machine translation, and spell and grammar checking. We also describe other national language technology programmes and give an overview over the history of language technology in Iceland.

연구 동기 및 목표

  • 디지털 커뮤니케이션에서 아이슬란드어가 지속 가능하게 유지되도록 핵심 언어 기술 인프라를 개발함으로써.
  • 자료가 부족하고 시장 인centives가 제한된 저자원 언어들이 상업적 NLP 응용 프로그램에서 소외되는 문제를 해결하기 위해.
  • 공동 MSc 및 PhD 프로그램을 통해 아이슬란드어 언어 기술 분야의 지속 가능한 연구 및 교육 역량을 구축하기 위해.
  • Rannís에서 운영하는 경쟁적 보조금 기반의 기금 제도를 통해 외부 R&D 과제를 지원함으로써 혁신을 촉진하기 위해.
  • 모든 소프트웨어 및 자원을 오픈소스 라이선스 하에 공개함으로써 접근성과 산업적 도입을 촉진하기 위해.

제안 방법

  • 핵심 언어 기술 분야의 R&D를 이끄는 대학, 기관, 민간 기업으로 구성된 국가적 컨sortium를 구축함.
  • 사용자 정의 가능한 오픈소스 언어 자원 개발, 예를 들어 토크나이저, 태거, 파서, 품사 태깅 도구 포함.
  • 유럽경제지역(European Economic Area, EEA) 문서에서 유래한 350만 개 문장 쌍의 병렬 코퍼스(ParIce)를 구축하고, 문서 정렬을 통해 확장함.
  • 백트랜슬레이션을 활용한 훈련 데이터 증강: 일방적 아이슬란드어 텍스트를 영어로 번역하고, 저품질 출력을 걸러내기 위해 필터링을 적용함.
  • 세 가지 기준 기계 번역 시스템 훈련 및 비교: 어절 기반 SMT 시스템(Moses), 순차적-시퀀스 LSTM 모델(OpenNMT), 주의 기반 신경망 모델(Tensor2Tensor).
  • 훈련 및 추론 중에 고유명사 처리를 위해 자리표시자 치환을 통한 사전 및 사후 처리 파이프라인을 구현함.

실험 결과

연구 질문

  • RQ1어떻게 국가 차원의 언어 기술 프로그램이 디지털 시대의 저자원 언어들, 예를 들어 아이슬란드어의 개발을 효과적으로 지원할 수 있는가?
  • RQ2오픈소스 인프라, 데이터 증강, 공동 R&D의 조합 중에서 어떤 조합이 소규모 언어에서 확장 가능한 NLP 시스템을 구축하는 데 가장 효과적인가?
  • RQ3제한된 병렬 데이터를 가진 아이슬란드어 기계 번역 품질을 향상시키기 위해 백트랜슬레이션과 병렬 코퍼스 확장 기법이 어느 정도 기여할 수 있는가?
  • RQ4오픈 라이선싱과 산업 협업을 통해 아이슬란드어 언어 기술의 장기적 지속 가능성과 도입을 보장할 수 있는가?
  • RQ5학계-산업 협업은 소규모 국가에서 언어 기술 지식 센터를 지속 가능하게 구축하는 데 어떤 역할을 하는가?

주요 결과

  • 2019년 10월, 학술 기관, 기관, 민간 기업 파트너들이 참여한 컨소소리와 함께 프로그램이 성공적으로 출범하여 광범위한 협업을 보장함.
  • 유럽경제지역(EEA) 문서에서 유래한 350만 개 문장 쌍의 핵심 병렬 코퍼스(ParIce)가 구축되어 기계 번역 개발의 기반을 마련함.
  • 백트랜슬레이션 기법이 훈련 데이터를 증가시키기 위해 구현되었으며, 품질 유지를 위해 노이즈가 포함된 증강 데이터를 걸러내기 위한 필터링이 적용됨.
  • 어절 기반, LSTM 기반, 주의 기반의 세 가지 기준 기계 번역 시스템이 개발되어 웹 인터페이스와 API를 통해 공개적으로 테스트 가능하게 제공됨.
  • 입력 및 출력 파이프라인 전반에서 고유명사 처리를 위해 자리표시자 치환 기법을 도입하여 번역 결과에서 적절한 형태와 문장의 대소문자를 유지함.
  • 모든 결과물, 즉 소프트웨어 및 언어 자원이 오픈 라이선스 하에 공개되어 상용 및 공공 응용 분야에서의 재사용을 가능하게 함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.