Skip to main content
QUICK REVIEW

[論文レビュー] Clean Text and Full-Body Transformer: Microsoft's Submission to the WMT22 Shared Task on Sign Language Translation

Subhadeep Dey, Abhilash Pal|arXiv (Cornell University)|Oct 24, 2022
Hand Gesture Recognition Systems被引用数 4
ひとこと要約

本論文は、スイスドイツ語手話から話言語への翻訳を目的としたWMT22共同タスクへのマイクロソフトの提出を提示する。事前学習済みI3Dモデルから得られる全身動画特徴と洗練されたテキストパイプラインを活用し、テストセットにおいて最高のBLEUスコア(0.6)と1位のヒューマン評価を達成した。さらに、唇読み特徴と語彙データセットを統合することで、開発セットではBLEUスコアが1.08に向上し、低リソースな手話翻訳におけるマルチモーダル入力とデータ整備の有効性を示した。

ABSTRACT

This paper describes Microsoft's submission to the first shared task on sign language translation at WMT 2022, a public competition tackling sign language to spoken language translation for Swiss German sign language. The task is very challenging due to data scarcity and an unprecedented vocabulary size of more than 20k words on the target side. Moreover, the data is taken from real broadcast news, includes native signing and covers scenarios of long videos. Motivated by recent advances in action recognition, we incorporate full body information by extracting features from a pre-trained I3D model and applying a standard transformer network. The accuracy of the system is further improved by applying careful data cleaning on the target text. We obtain BLEU scores of 0.6 and 0.78 on the test and dev set respectively, which is the best score among the participants of the shared task. Also in the human evaluation the submission reaches the first place. The BLEU score is further improved to 1.08 on the dev set by applying features extracted from a lip reading model.

研究の動機と目的

  • 高頻度の語彙多様性を伴う現実的で低リソースな環境における手話から話言語への翻訳の課題に対処すること。
  • 事前学習済みI3Dモデルを用いて全身動画表現を統合することで、翻訳性能を向上させること。
  • 体系的なテキストクリーニングと語彙データセットの統合を通じて、モデルの汎化性能と正確性を向上させること。
  • 特に全身と唇読み特徴を含むマルチモーダル入力が、手話翻訳の品質に与える影響を評価すること。

提案手法

  • ビデオフレームから全身手話の動きを符号化するため、事前学習済みI3Dモデルを用いて動画埋め込みを抽出した。
  • I3D埋め込みシーケンスから話言語の翻訳を生成するために、標準的なTransformerデコーダアーキテクチャを適用した。
  • 語彙サイズの縮小とシングルトン語の削減を目的として、広範なテキスト前処理を実施し、モデルの汎化性能と学習効率を向上させた。
  • 唇領域からの補足的視覚特徴を抽出するために、事前学習済みのAV-HuBERT唇読みモデルを統合し、低頻度語や機能語の認識を向上させた。
  • 全身特徴と唇読み特徴を統合した入力表現を構築し、シーケンスモデリングと翻訳精度の向上を図った。
  • 公開済みの手話語彙データセット(SignSuisse)を統合し、ベースモデルで予測が不十分だった高頻度の機能語の表現を強化した。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みI3Dモデルから得られる全身動画特徴は、低リソース環境下での手話翻訳性能を顕著に向上させることができるか?
  • RQ2テキストクリーニングは、手話翻訳システムにおける語彙サイズの縮小とBLEUスコアの向上にどの程度寄与するか?
  • RQ3AV-HuBERTから得られる唇読み特徴は、手話翻訳におけるレア語や機能語の認識にどの程度効果的か?
  • RQ4語彙データセットの統合により、エンドツーエンドモデルがしばしば見逃す高頻度・低曖昧性の手話表現の予測能力が向上するか?
  • RQ5WMT22共同タスクの性能指標は、PHOENIX-2014Tのような既存のベンチマークと比較してどう異なるか?これはタスクの難易度にどのような示唆をもたらすか?

主な発見

  • 本システムは、公式のWMT2022テストセットでBLEUスコア0.6を達成し、全7参加者中最も高いスコアを記録した。
  • ヒューマン評価では1位にランクされ、生成された翻訳の自然さと流暢さが確認された。
  • AV-HuBERTからの唇読み特徴の追加により、開発セットのBLEUスコアはI3Dモデル単体の0.78から1.08に向上した。
  • 語彙データセットの統合により、特に「auf wiedersehen」のような機能語の予測精度が向上し、性能がさらに向上した。
  • WMTデータで学習したモデルは、PHOENIX-2014Tの最先端モデルと比較して著しく性能が低く、WMT22タスクがデータ品質とドメイン制約のため、著しく困難であることが示唆された。
  • PHOENIX-2014Tデータに文末ピリオドが存在したことで、BLEUスコアが1%相対的に向上した。これはBLEU評価が句読点やフォーマットに敏感であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。