Skip to main content
QUICK REVIEW

[論文レビュー] Language Technology Programme for Icelandic 2019-2023

Anna Bjørk Nikulásdóttir, Jón Guðnason|arXiv (Cornell University)|Mar 20, 2020
Natural Language Processing Techniques参考文献 32被引用数 5
ひとこと要約

本論文は、アイスランド語のデジタルコミュニケーションにおける活用を目的として、2019–2023年の5年間の国家的言語技術プログラムを提示する。このプログラムは、自然言語処理(NLP)の基盤ツールおよび言語リソースのオープンソース開発に焦点を当てており、音声認識、機械翻訳、スペル・文法チェック、音声合成の分野をカバーする。すべての成果物はオープンライセンスのもとで公開され、アクセス性と産業分野への導入を促進する。また、競争的な研究開発資金と学術的教育イニシアチブが支援を提供する。

ABSTRACT

In this paper, we describe a new national language technology programme for Icelandic. The programme, which spans a period of five years, aims at making Icelandic usable in communication and interactions in the digital world, by developing accessible, open-source language resources and software. The research and development work within the programme is carried out by a consortium of universities, institutions, and private companies, with a strong emphasis on cooperation between academia and industries. Five core projects will be the main content of the programme: language resources, speech recognition, speech synthesis, machine translation, and spell and grammar checking. We also describe other national language technology programmes and give an overview over the history of language technology in Iceland.

研究の動機と目的

  • アイスランド語がデジタルコミュニケーションにおいて持続可能であることを保証するため、必須の言語技術インfraストラクチャの開発。
  • データ不足と市場インcentiveの欠如により、商業的NLPアプリケーションにおいて低リソース言語(アイスランド語を含む)が疎外されがちな状況に対処する。
  • 共同で運営される修士課程および博士課程プログラムを通じて、アイスランド語言語技術分野における持続可能な研究および教育能力を確立する。
  • Rannísが管理する競争的助成金メカニズムにより、外部の研究開発プロジェクトを資金援助することでイノベーションを促進する。
  • すべてのソフトウェアおよびリソースをオープンソースライセンスのもとで公開することで、オープンアクセスと産業分野への採用を促進する。

提案手法

  • 大学、機関、民間企業からなる国家コンsortiumを設立し、基盤的言語技術分野における研究開発を主導する。
  • 再利用可能なオープンソースの言語リソース(トークナイザー、タガーやパーサー、品詞タグ付きツールなど)の開発。
  • EEA文書から抽出した350万文の対訳文書ペアを含む並列コーパス(ParIce)の構築し、文書のアラインメントによる拡張を実施。
  • バックトランスレーションを用いたトレーニングデータの拡張:アイスランド語の単語文書を英語に翻訳し、品質が低い出力をフィルタリングする。
  • 3つのベースラインMTシステムのトレーニングと比較:フレーズベースのSMTシステム(Moses)、LSTMベースのsequence-to-sequenceモデル(OpenNMT)、アテンションベースのニューラルモデル(Tensor2Tensor)。
  • 名前付きエンティティの処理を、トレーニングおよび推論時にプレースホルダ置換を用いた前処理・後処理パイプラインで実装。

実験結果

リサーチクエスチョン

  • RQ1どのようにして国家的言語技術プログラムが、デジタル時代における低リソース言語(アイスランド語を含む)の開発を効果的に支援できるか?
  • RQ2オープンソースインfraストラクチャ、データ拡張、共同研究開発の組み合わせの中で、小規模言語におけるスケーラブルなNLPシステム構築に最も効果的なのはどれか?
  • RQ3限定的な対訳データを有するアイスランド語向け機械翻訳品質を、バックトランスレーションおよび並列コーパス拡張によってどの程度向上できるか?
  • RQ4オープンライセンスと産業分野との連携は、アイスランド語の言語技術の長期的持続可能性と採用をどのように保証できるか?
  • RQ5学術分野と産業分野の連携は、小国における言語技術分野の持続可能な知識拠点を構築する上で、どのような役割を果たすか?

主な発見

  • 2019年10月に、学術機関、機関、民間企業のパートナーシップを結んだコンsortiumのもと、プログラムが正常に開始された。広範な連携が確保された。
  • EEA文書から抽出した350万文の対訳文書ペアを含むコア並列コーパス(ParIce)が確立され、機械翻訳開発の基盤が構築された。
  • バックトランスレーション技術が実装され、トレーニングデータの増強が行われた。品質を維持し、ノイズの混入を防ぐためにフィルタリングが適用された。
  • フレーズベース、LSTMベース、アテンションベースの3つのベースラインMTシステムが開発され、一般公開のためのWebインターフェースおよびAPIを通じて利用可能となった。
  • 入力および出力パイプラインの両方でプレースホルダ置換を用いて、翻訳における固有名の表記および大文字・小文字の正確な維持を実装した。
  • ソフトウェアおよび言語リソースを含むすべての成果物がオープンライセンスのもとで公開され、商業的および公共的アプリケーションでの再利用が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。