[論文レビュー] Improving Sign Language Translation with Monolingual Data by Sign Back-Translation
本稿では、2段階のプロセス(まずテキストから語彙に翻訳し、次に事前にアノテートされたサイン特徴セグメントを連結することで語彙からサインシーケンスを生成)を用いて、単語のみのテキストデータを活用することで、サイン言語翻訳(SLT)の性能を向上させるための Sign Back-Translation (SignBT) を提案する。この手法は、PHOENIX-2014T および新たに導入された CSL-Daily データセットの両方で顕著な性能向上を達成し、PHOENIX-2014T では BLEU-4 で 2.6 ポイント向上し、CSL-Daily のテストセットでは BLEU-4 で 21.34 のスコアを達成した。
Despite existing pioneering works on sign language translation (SLT), there is a non-trivial obstacle, i.e., the limited quantity of parallel sign-text data. To tackle this parallel data bottleneck, we propose a sign back-translation (SignBT) approach, which incorporates massive spoken language texts into SLT training. With a text-to-gloss translation model, we first back-translate the monolingual text to its gloss sequence. Then, the paired sign sequence is generated by splicing pieces from an estimated gloss-to-sign bank at the feature level. Finally, the synthetic parallel data serves as a strong supplement for the end-to-end training of the encoder-decoder SLT framework. To promote the SLT research, we further contribute CSL-Daily, a large-scale continuous SLT dataset. It provides both spoken language translations and gloss-level annotations. The topic revolves around people's daily lives (e.g., travel, shopping, medical care), the most likely SLT application scenario. Extensive experimental results and analysis of SLT methods are reported on CSL-Daily. With the proposed sign back-translation method, we obtain a substantial improvement over previous state-of-the-art SLT methods.
研究の動機と目的
- サイン言語翻訳(SLT)における並列のサイン言語データとテキストデータの著しい不足を解決すること。
- 大規模な単語のみのテキストデータを活用して、SLT の学習を補強する可能性を検討すること。
- テキストとサイン動画の間のモodal 間隔を埋める、現実的で効果的なデータ拡張パイプラインを開発すること。
- 豊富なアノテーションを備えた連続的サイン言語翻訳のための新しい大規模ベンチマーク、CSL-Daily を確立すること。
- サインバックトランスレーションによって生成された合成データが、SLT モデルの性能を顕著に向上させることを実証すること。
提案手法
- テキストから語彙への翻訳と、その後に語彙からサインシーケンスへの生成という2段階のサインバックトランスレーションパイプラインを設計した。
- テキストから語彙への翻訳は、既存のテキスト-語彙ペアを用いて学習されたニューラルシーケンス・トゥ・シーケンスモデルによって実行された。
- 語彙からサインへの変換は、語彙-サインバンクに事前にセグメント化されたサイン特徴クリップを特徴レベルで連結することで達成された。
- サインのセグメンテーションは、CTC を用いたサイン-語彙アライメントネットワークによって実行され、サイン動画内の正確な語彙境界を特定した。
- 合成データペア(単語のみのテキスト、合成されたサイン特徴シーケンス)を用いて、エンドツーエンドのエンコーダ-デコーダ型 SLT モデルをファインチューニングした。
- この手法は、シーケンスの連結処理を伴うテキストからテキストへのバックトランスレーション問題として全体を捉え、直接の動画生成を回避した。
実験結果
リサーチクエスチョン
- RQ1単語のみのテキストデータは、サイン言語翻訳の性能向上に効果的に活用可能か?
- RQ2直接の動画生成を要せず、テキストとサイン動画の間のモダリティギャップをどのように埋め合わせられるか?
- RQ3サインバックトランスレーションによって生成された合成データは、SLT モデルのロバスト性と正確性を向上させるか?
- RQ4合成データの品質と量は、SLT モデルの性能にどのように影響するか?
- RQ5CSL-Daily のような大規模で多様性に富み、豊富なアノテーションが付与された SLT ベンチマークは、SLT メソッドのより効果的かつ標準化された評価を可能にするか?
主な発見
- 提案された SignBT メソッドは、PHOENIX-2014T データセットにおいてベースライン比で BLEU-4 で 2.6 ポイントの向上を達成した。
- CSL-Daily ベンチマークでは、テストセットで BLEU-4 スコアが 21.34 に達し、ベースラインを著しく上回った。
- 合成データの量が増えるに従い、性能が着実に向上し、このアプローチのスケーラビリティを示した。
- より高品質な合成データ(より正確なテキスト-語彙モデルを用いて生成)は、より優れた SLT モデル性能をもたらし、この手法のデータ品質への感受性を確認した。
- 入力が空の最悪の状況でも、わずかな向上が見られたため、合成データが単なる言語モデル化を超えて、意味的に寄与していることが示された。
- この手法は、さまざまな語彙サイズに対して有効であり、特にテキストおよびサイン両側で語彙が大きい CSL-Daily では、より大きな向上が得られた。これは、高複雑性の環境下で、データ拡張の恩恵がより顕著であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。