Skip to main content
QUICK REVIEW

[論文レビュー] Facilitating Access to Multilingual COVID-19 Information via Neural Machine Translation

Andy Way, Rejwanul Haque|arXiv (Cornell University)|May 1, 2020
Natural Language Processing Techniques参考文献 21被引用数 4
ひとこと要約

本論文では、英語とドイツ語、フランス語、イタリア語、スペイン語の間で翻訳を行う8つのニューラル機械翻訳(NMT)システムのセットを提示する。特に、パンデミック関連の多言語COVID-19保健情報へのアクセスを向上させることが目的である。最新のNMT技術を用いて、自由に利用可能なデータを訓練データとして使用した本システムは、Google翻訳やBing翻訳などの商業的エンジンと同等またはそれ以上の性能を達成しており、プライバシーを守る形で公開されている。これにより、医療専門家および一般大衆が、タイムリーかつ安全に、パンデミック関連の重要なコンテンツにアクセスできるようになる。

ABSTRACT

Every day, more people are becoming infected and dying from exposure to COVID-19. Some countries in Europe like Spain, France, the UK and Italy have suffered particularly badly from the virus. Others such as Germany appear to have coped extremely well. Both health professionals and the general public are keen to receive up-to-date information on the effects of the virus, as well as treatments that have proven to be effective. In cases where language is a barrier to access of pertinent information, machine translation (MT) may help people assimilate information published in different languages. Our MT systems trained on COVID-19 data are freely available for anyone to use to help translate information published in German, French, Italian, Spanish into English, as well as the reverse direction.

研究の動機と目的

  • パンデミック期における、タイムリーかつ正確な多言語COVID-19保健情報へのアクセスの障壁を解消すること。
  • パンデミックの影響を受ける主要なヨーロッパ言語(英語、ドイツ語、フランス語、イタリア語、スペイン語)向けに、高品質で公開可能なニューラル機械翻訳(NMT)システムを開発すること。
  • ユーザーのプライバシーを守りながら、商業的システムと同等またはそれ以上の翻訳品質を実現すること。
  • 医療専門家および一般大衆が、多言語の公衆衛生コンテンツに迅速かつスケーラブルにアクセスできるようにすること。

提案手法

  • ニュースメディアや保健当局など、多様なソースから入手可能な自由に利用可能な多言語COVID-19テキストデータのみを用いて、エンドツーエンドのNMTモデルを訓練する。
  • トークン化、文分割、文字正規化、スペルチェック、URL やタグなどの特別な要素の処理を含むモジュラーな前処理パイプラインを採用する。
  • 8つの言語ペアそれぞれに専用のGPUサーバーを割り当てた分散アーキテクチャを実装し、低遅延で応答性の高いオンライン翻訳サービスを確保する。
  • ウェブサーバーを用いてユーザーのリクエストを管理し、適切なMTサーバーにタスクを割り当て、適切なポストプロセッシングを施した上で翻訳結果を返す。
  • サブワード分割、トゥルーキャーシング、合成語の再結合(特にドイツ語向け)といった高度なNMT技術を適用し、スムーズさと正確性を向上させる。
  • 実世界のパンデミック関連文の翻訳に対して、自動評価指標と人間による評価を用いて、Google翻訳やBing翻訳と比較してシステムの性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1英語、フランス語、ドイツ語、イタリア語、スペイン語間で、多言語COVID-19コンテンツを素早く翻訳できる高品質で低コストのNMTシステムを開発できるか?
  • RQ2本研究で開発されたカスタムNMTシステムの性能は、Google翻訳やBing翻訳といった主要な商業的MTプラットフォームと比較して、なめらかさと適切さの観点でどの程度優れているか?
  • RQ3危機的状況下における多様な言語ペアの翻訳品質を向上させるために、モジュラーで多言語対応の前処理パイプラインはどの程度の効果を示すか?
  • RQ4公開されたプライバシー保護型MTシステムは、非専門家ユーザーが言語の壁を超えて重要な保健情報にアクセスするのを効果的に支援できるか?
  • RQ5急激に変化する公衆衛生コンテンツという、感受性の高い文脈に応用されたカスタムNMTシステムの主な強みと弱みは何か?

主な発見

  • 自動評価スコアにおいて、カスタムNMTシステムは同じテストセットでGoogle翻訳やBing翻訳と同等またはそれ以上のスコアを達成した。
  • 人間による評価では、医療用語や文脈の処理において、商業プラットフォームの翻訳よりも正確で自然な翻訳を生成していることが判明した。
  • 本システムは、症状の特定、予防策、治療ガイドラインといった複雑な公衆衛生メッセージの翻訳において、優れた性能を示した。
  • モジュラーな前処理パイプラインのおかげで、標点、特殊文字、URL、合成語(特にドイツ語)の処理が正確に行われ、翻訳品質が顕著に向上した。
  • 分散型でプライバシーを守るウェブアーキテクチャを用いたシステムのデプロイにより、データ漏洩のリスクを回避しながら、世界中のユーザーが低遅延でリアルタイムにアクセスできるようになった。
  • ドイツの新聞『ヴェルト』(2020年3月20日付)の見出しを含む、高影響力かつタイムリーなコンテンツの翻訳に成功したことで、実際の危機的状況下での実用性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。