Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation for Sign Language Gloss Translation

Amit Moryossef, Kayo Yin|arXiv (Cornell University)|May 16, 2021
Natural Language Processing Techniques参考文献 25被引用数 5
ひとこと要約

本稿では、スクリプト言語と話言語の間の高レベルの語彙的類似性と構文的相違を活用して、ルールベースのデータ拡張を提案する。構文に配慮した再順序化ヒューリスティクスを用いて単語の並べ替えを施すことで、モノリンガル話言語データから合成された gloss-テキスト対を生成し、ASL-英語翻訳およびDGS-ドイツ語翻訳において、それぞれ最大3.14および2.20 BLEUの向上を達成した。この手法は、低リソース環境下でバックトランスレーションやベースラインモデルを上回った。

ABSTRACT

Sign language translation (SLT) is often decomposed into video-to-gloss recognition and gloss-to-text translation, where a gloss is a sequence of transcribed spoken-language words in the order in which they are signed. We focus here on gloss-to-text translation, which we treat as a low-resource neural machine translation (NMT) problem. However, unlike traditional low-resource NMT, gloss-to-text translation differs because gloss-text pairs often have a higher lexical overlap and lower syntactic overlap than pairs of spoken languages. We exploit this lexical overlap and handle syntactic divergence by proposing two rule-based heuristics that generate pseudo-parallel gloss-text pairs from monolingual spoken language text. By pre-training on the thus obtained synthetic data, we improve translation from American Sign Language (ASL) to English and German Sign Language (DGS) to German by up to 3.14 and 2.20 BLEU, respectively.

研究の動機と目的

  • サイン言語翻訳における並列 gloss-テキストデータの極めて少ない状況に対処すること。
  • モノリンガル話言語データが、低リソースのサイン言語翻訳に効果的に活用可能かどうかを調査すること。
  • サイン言語と話言語の間の語彙的類似性と構文的相違を活用するルールベースのヒューリスティクスを開発すること。
  • 合成データの有効性がゼロショットおよびファインチューニングされた翻訳性能に与える影響を評価すること。
  • バックトランスレーションが極めて低リソースなサイン言語環境では効果がないことを示すこと。

提案手法

  • モノリンガル話言語テキストから擬似並列 gloss-テキスト対を生成するための2つのルールベースのヒューリスティクス(一般的および特定的)を提案する。
  • 一般ルールは、語彙的内容を保持しながら多様な構文的バリエーションを生成するために、ランダムな語順の入れ替えを適用する。
  • 特定ルールは、ターゲット言語(例:ドイツ語)に特化しており、言語固有の語順パターンに基づいて構文的変換を適用する。
  • 実際の並列データでのゼロショット評価またはファインチューニングの前段階として、合成データでモデルを事前学習する。
  • 効率性と OOV(未知語)の取り扱いを考慮し、BPEトークン化を2,000のサーブワードユニットで使用する。
  • SacreBLEU および COMET を用いてモデルを評価し、2つのデータセットにおいてベースライン、バックトランスレーション、および拡張手法を比較する。

実験結果

リサーチクエスチョン

  • RQ1モノリンガル話言語データを用いたルールベースのデータ拡張が、低リソースのサイン言語 gloss-テキスト翻訳を改善できるか?
  • RQ2極めて低リソースなサイン言語環境下で、ルールベースの拡張手法とバックトランスレーションの性能はどのように比較されるか?
  • RQ3一般の再順序化ヒューリスティクスと比較して、言語固有の構文ルールが翻訳品質にどの程度向上効果をもたらすか?
  • RQ4合成データで事前学習することで、実際の並列テストセットへのゼロショット一般化が可能になるか?
  • RQ5サイン言語と話言語の間の構文的相違は、サイン言語翻訳におけるデータ拡張に活用可能か?

主な発見

  • Specific- pre は PHOENIX で 7.26 BLEU を達成し、General- pre(3.95 BLEU)を顕著に上回った。これは、言語固有の構文ルールがより効果的であることを示している。
  • General- tuned は PHOENIX で 23.35 BLEU を達成し、ベースラインより 2.20 BLEU の向上を示した。これは、一般ルールベースの拡張による強力な向上効果を示している。
  • Specific- tuned は PHOENIX で 23.17 BLEU を達成し、ベースラインを顕著に上回った。これは、カスタマイズされた構文的ヒューリスティクスの有効性を確認している。
  • 合成データのみで学習したモデル(Specific- pre)が PHOENIX で 7.26 BLEU を達成した。これは、合成データでの事前学習のみで、非自明な性能が得られることを示している。
  • バックトランスレーション(BT- tuned)は、ルールベースの手法に比べて性能が劣った。これは、並列データがあまりに少なすぎる場合、バックトランスレーションが効果がないことを示している。
  • 実際の並列データが限られる状況で、データ拡張による向上効果が顕著に現れ、ASL-英語翻訳では最大3.14 BLEUの向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。