[論文レビュー] Better Sign Language Translation with STMC-Transformer
本稿では、中間表現としての語彙(グロス)を経由せずに、直接ビデオからテキストへの翻訳を実行することで、最先端の性能を達成する新しいニューラル機械翻訳モデル、STMC-Transformerを提案する。このモデルは、グロスに基づく中間表現を用いた翻訳や、真値グロスを用いたビデオからテキストへの翻訳を上回り、グロスが上限を形成するという仮定に疑問を呈し、それらがシグナリング言語の非効率な表現であることを明らかにする。
Sign Language Translation (SLT) first uses a Sign Language Recognition (SLR) system to extract sign language glosses from videos. Then, a translation system generates spoken language translations from the sign language glosses. This paper focuses on the translation system and introduces the STMC-Transformer which improves on the current state-of-the-art by over 5 and 7 BLEU respectively on gloss-to-text and video-to-text translation of the PHOENIX-Weather 2014T dataset. On the ASLG-PC12 corpus, we report an increase of over 16 BLEU. We also demonstrate the problem in current methods that rely on gloss supervision. The video-to-text translation of our STMC-Transformer outperforms translation of GT glosses. This contradicts previous claims that GT gloss translation acts as an upper bound for SLT performance and reveals that glosses are an inefficient representation of sign language. For future SLT research, we therefore suggest an end-to-end training of the recognition and translation models, or using a different sign language annotation scheme.
研究の動機と目的
- 機械学習認識(SLR)の進展にもかかわらず、シグナリング言語翻訳(SLT)システムにおける進展の欠如に焦点を当て、翻訳部の改善を図ること。
- 真値(GT)グロスの翻訳がSLT性能の上限を形成するという一般的な仮定に挑戦し、それらが最適な中間表現であるとみなされる背景を疑うこと。
- 変換器ベースのモデルを用いて直接ビデオからテキストへの翻訳を実行することで、真値グロスからの翻訳を上回ることを示し、グロスが情報損失を引き起こす可能性があることを示唆すること。
- 今後の方向性として、認識と翻訳モデルのエンドツーエンド学習、または代替のアノテーションスキームの提案を検討すること。
提案手法
- シグナリング言語のシーケンスにおける長距離依存関係をモデル化するために自己注意メカニズムを活用する、序列変換型の変換器モデル「STMC-Transformer」を導入し、シグナリング言語翻訳に特化して微調整する。
- 一般化性能の向上と低リソースなシグナリング言語翻訳タスクにおける性能向上を目的に、重みの共有、転移学習、アンサンブル学習の手法を適用する。
- 中間のグロス表現に依存せずに、時間的符号化を用いたビデオ入力に対してエンドツーエンドで学習を行う。
- デコード中に視覚的特徴と言語的文脈の両方に注目できるマルチヘッドクロスアテンションメカニズムを用いることで、シグナリング動画とターゲット言語出力の間のより良いアライメントを実現する。
- トレーニングの安定化と一般化性能の向上を目的に、ラベルスムージングを適用した交差エントロピー損失とスケジュール化された学習率の減少を用いてモデルを最適化する。
- PHOENIX-Weather 2014T および ASLG-PC12 の2つのベンチマークデータセットを用いて評価し、グロスからテキストへの翻訳とビデオからテキストへの翻訳のベースラインと性能を比較する。
実験結果
リサーチクエスチョン
- RQ1グロスに依存せずに、直接ビデオ入力で学習された変換器ベースのモデルが、既存の手法を上回ることができるか?
- RQ2真値グロスの使用が、ビデオからテキストへのシグナリング言語翻訳性能の上限を真正に表しているとされる根拠は妥当か?
- RQ3一対一の語の対応による一次元的表現であるグロスアノテーションが、多次元的な言語的特徴(表情や空間的動きなど)を含むシグナリング言語を表現するうえで、どの程度情報のブottleneckを引き起こすか?
- RQ4重みの共有、転移学習、アンサンブル学習といった技術を、初めてSLTに適用した場合に、シグナリング言語翻訳性能を顕著に向上させることができるか?
- RQ5認識と翻訳モデルをエンドツーエンドで学習する方法が、グロスの監視を伴う共同学習よりも効果的であるか?
主な発見
- PHOENIX-Weather 2014T データセットにおけるビデオからテキストへの翻訳で、STMC-Transformerは38.7のBLEUスコアを達成し、以前の最先端手法を7ポイント以上上回った。
- 同じデータセットにおいて、グロスからテキストへの翻訳でも32.1のBLEUスコアを記録し、前回の最先端手法を5ポイント以上上回った。
- ASLG-PC12 データセットでは、従来手法と比較して16ポイント以上のBLEUスコア上昇を達成し、異なるデータセット間でも強力な一般化性能を示した。
- 真値グロスからの翻訳よりも、ビデオからテキストへの翻訳で優れた性能を示し、BLEUスコアは38.7(直接翻訳)と31.0(真値グロス経由)を記録した。これは、真値グロスが上限を形成するという仮定に反する。
- 定性的な分析から、グロスが動画と完全に一致している場合でさえ、真値グロスを経由する翻訳よりも、モデルがより自然で正確な翻訳を生成することが明らかになった。
- 結果から、顔の表情や空間的動きといった多次元的な言語的手がかりを損失を伴う一次元的符号化で表現するグロスは、本質的に非効率なシグナリング言語表現であることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。