Skip to main content
QUICK REVIEW

[论文解读] Language Technology Programme for Icelandic 2019-2023

Anna Bjørk Nikulásdóttir, Jón Guðnason|arXiv (Cornell University)|Mar 20, 2020
Natural Language Processing Techniques参考文献 32被引用 5
一句话总结

本文介紹了冰島語在2019–2023年間的五年國家語言科技計畫,旨在透過開放原始碼方式開發核心自然語言處理工具與語言資源,使冰島語能在數位溝通中得以應用。該計畫著重於語音辨識、機器翻譯、拼字與文法檢查,以及語音合成,所有成果均以開放授權釋出,以確保可及性與產業應用,並由競爭性研發基金與學術培訓計畫支持。

ABSTRACT

In this paper, we describe a new national language technology programme for Icelandic. The programme, which spans a period of five years, aims at making Icelandic usable in communication and interactions in the digital world, by developing accessible, open-source language resources and software. The research and development work within the programme is carried out by a consortium of universities, institutions, and private companies, with a strong emphasis on cooperation between academia and industries. Five core projects will be the main content of the programme: language resources, speech recognition, speech synthesis, machine translation, and spell and grammar checking. We also describe other national language technology programmes and give an overview over the history of language technology in Iceland.

研究动机与目标

  • 確保冰島語在數位溝通中持續具備可行性,透過發展必要的語言科技基礎建設。
  • 因應低資源語言如冰島語在商業自然語言處理應用中因資料有限與市場誘因不足而遭邊緣化的問題。
  • 透過共同的碩士與博士學位計畫,建立冰島語科技的永續研究與教育能力。
  • 透過由Rannís管理的競爭性補助金機制資助外部研發計畫,激發創新。
  • 透過將所有軟體與資源以開放原始碼授權釋出,促進開放存取與產業應用。

提出的方法

  • 成立由大學、機構與私人企業組成的國家合作 consortium,領導核心語言科技領域的研發。
  • 開發可重複使用的開放原始碼語言資源,包括分詞器、詞性標註器、解析器與詞性工具。
  • 建立一個平行語料庫(ParIce),收錄來自歐洲經濟區文件的350萬組句子對,並透過文件對齊方式擴充。
  • 運用反向翻譯技術增強訓練資料:將單語冰島語文本翻譯成英文,並過濾低品質輸出。
  • 訓練並比較三種基線機器翻譯系統:基於短語的SMT系統(Moses)、基於LSTM的序列轉序列模型(OpenNMT),以及基於注意力機制的神經網絡模型(Tensor2Tensor)。
  • 在訓練與推理過程中,透過取代標記的方式處理命名實體,以維持其正確形式與大小寫。

实验结果

研究问题

  • RQ1國家語言科技計畫如何有效支援冰島語等低資源語言在數位時代的發展?
  • RQ2開放原始碼基礎建設、資料增強與合作研發的組合,對小語種可擴展自然語言處理系統的建置而言,何種組合最為有效?
  • RQ3在平行資料有限的情況下,反向翻譯與平行語料庫擴充能在多大程度上提升冰島語機器翻譯的品質?
  • RQ4開放授權與產業合作如何確保冰島語語言科技的長期永續性與應用?
  • RQ5學術與產業合作在小國建立語言科技永續知識中心的過程中扮演何種角色?

主要发现

  • 該計畫於2019年10月成功啟動,由學術機構、公共機構與私人企業組成的合作 consortium 牽頭,確保廣泛合作。
  • 從歐洲經濟區文件中建立了一個核心平行語料庫(ParIce),包含350萬組句子對,成為機器翻譯發展的基礎。
  • 實施反向翻譯技術以增加訓練資料,並透過過濾機制維持品質,避免增強資料中引入雜訊。
  • 開發並公開了三種基線機器翻譯系統——基於短語的、LSTM的與注意力機制的——並透過網路介面與API提供公開測試。
  • 透過在輸入與輸出處理流程中使用取代標記的方式,實現命名實體的處理,以維持翻譯中正確的形式與大小寫。
  • 所有交付成果,包括軟體與語言資源,均以開放授權釋出,以支援商業與公共應用中的重用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。