Skip to main content
QUICK REVIEW

[論文レビュー] Bianet: A Parallel News Corpus in Turkish, Kurdish and English

Duygu Ataman|arXiv (Cornell University)|May 14, 2018
Natural Language Processing Techniques被引用数 15
ひとこと要約

この論文では、Bianetオンライン新聞から収集した、トルコ語、クルド語(ソラーニ、ラテン文字)、英語の3言語による新しいオープンソースの並列ニュースコーパス「Bianet」を紹介する。このコーパスにより、特に英語-トルコ語および英語-クルド語の低リソース言語対のニューラル機械翻訳(NMT)が向上し、二言語およびマルチリンガルモデルの両方の性能が向上する。SETIMESおよびBianetデータを用いた実験では、BLEUおよびchrF3スコアに顕著な向上が見られた。

ABSTRACT

We present a new open-source parallel corpus consisting of news articles collected from the Bianet magazine, an online newspaper that publishes Turkish news, often along with their translations in English and Kurdish. In this paper, we describe the collection process of the corpus and its statistical properties. We validate the benefit of using the Bianet corpus by evaluating bilingual and multilingual neural machine translation models in English-Turkish and English-Kurdish directions.

研究の動機と目的

  • トルコ語やクルド語のような低リソース言語のための並列単語新聞コーパスの不足に対処すること。
  • Bianetという1つのニュースソースから、トルコ語、英語、クルド語の翻訳済み記事を含む、マルチリンガルで文単位でアラインメントされた並列コーパスを作成すること。
  • Bianetコーパスが二言語およびマルチリンガル設定のニューラル機械翻訳の品質に与える影響を評価すること。
  • 低リソースおよびマルチリンガル機械翻訳分野の研究を支援するための公開リソースを提供すること。

提案手法

  • Scrapyを用いたウェブクローリングにより、トルコ語のニュース記事をBianet(トルコのオンライン新聞)から抽出する。
  • Bianetのウェブサイト上で複数言語の記事リンクを特定することで、文書レベルの翻訳を取得する。
  • 文の長さと語彙的重複に基づくヒューリスティックなマッチングを用いて、並列テキストを文単位でアラインメントする。
  • トルコ語-英語、英語-クルド語、トルコ語-クルド語という3つの並列言語ペアを構築する。
  • 既存のデータ(例:SETIMES)と組み合わせて、Bianetコーパスを用いて二言語およびマルチリンガルニューラル機械翻訳モデルを訓練する。
  • 公式のMTベンチマークデータセットを用いて、BLEUおよびchrF3という標準的な指標で翻訳品質を評価する。

実験結果

リサーチクエスチョン

  • RQ1Bianetコーパスは、英語-トルコ語のニューラル機械翻訳において、どの程度翻訳品質を向上させるか?
  • RQ2クルド語の並列データを含めることで、低リソース言語対のマルチリンガルNMTモデルの性能が向上するか?
  • RQ3Bianetコーパスは、SETIMESのような既存の並列コーパスと比較して、NMTパフォーマンスの向上にどの程度寄与するか?
  • RQ4Bianetを既存のコーパスと組み合わせることで、マルチリンガルモデルのパフォーマンスにどのような影響を与えるか?
  • RQ5Bianetコーパスは、低リソース言語たるクルド語のゼロショットまたはフェイントショット翻訳を効果的に支援できるか?

主な発見

  • SETIMESベースラインにBianetコーパスを追加することで、英語-トルコ語翻訳のBLEUスコアが2.27ポイント、chrF3スコアが0.0204ポイント向上した。
  • Bianetコーパス全般(トルコ語-クルド語を含む)を用いて訓練したマルチリンガルモデルは、英語-トルコ語タスクで13.92のBLEUスコアと0.4360のchrF3スコアを達成し、ベースラインおよび結合二言語モデルを上回った。
  • 英語-クルド語翻訳において、マルチリンガルモデルは、二言語モデルの5.41 BLEUから8.51 BLEUへ、chrF3スコアは0.2257から0.2406へと向上し、顕著な向上が見られた。
  • コーパス内のトルコ語-クルド語部分は規模が小さいものの、マルチリンガル学習において4.10のBLEUおよび0.0149のchrF3向上をもたらし、低リソース環境下での価値を示した。
  • すべての向上はベースラインに対して統計的に有意であった(p < 0.05)、これによりコーパスの翻訳品質向上への有効性が裏付けられた。
  • Bianetコーパスは公開されており、トルコ語、クルド語、英語のマルチリンガルNMTシステムの訓練およびファインチューニングに使用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。