Skip to main content
QUICK REVIEW

[論文レビュー] Progressive Transformers for End-to-End Sign Language Production

Ben Saunders, Necati Cihan Camgöz|arXiv (Cornell University)|Apr 30, 2020
Hand Gesture Recognition Systems参考文献 66被引用数 13
ひとこと要約

本論文では、話言語を直接3次元のサインポーズ系列に変換する、連続的サイン言語生成のためのエンドツーエンドモデルであるProgressive Transformersを提案する。変長の連続シーケンスを明示的な終端トークンなしに生成できるカウンターデコーディング機構を導入し、PHOENIX14-TデータセットにおいてSOTAを達成し、BLEU-4スコアが9.94に達した。これは、語彙を中間表現とするモデルを上回る性能を示している。

ABSTRACT

The goal of automatic Sign Language Production (SLP) is to translate spoken language to a continuous stream of sign language video at a level comparable to a human translator. If this was achievable, then it would revolutionise Deaf hearing communications. Previous work on predominantly isolated SLP has shown the need for architectures that are better suited to the continuous domain of full sign sequences. In this paper, we propose Progressive Transformers, a novel architecture that can translate from discrete spoken language sentences to continuous 3D skeleton pose outputs representing sign language. We present two model configurations, an end-to-end network that produces sign direct from text and a stacked network that utilises a gloss intermediary. Our transformer network architecture introduces a counter that enables continuous sequence generation at training and inference. We also provide several data augmentation processes to overcome the problem of drift and improve the performance of SLP models. We propose a back translation evaluation mechanism for SLP, presenting benchmark quantitative results on the challenging RWTH-PHOENIX-Weather-2014T(PHOENIX14T) dataset and setting baselines for future research.

研究の動機と目的

  • 分離されたサインの合成に起因する制限を克服し、話言語テキストから連続的なサイン言語ビデオを生成するエンドツーエンドモデルの開発。
  • 固定語彙や明示的な終端トークンに依存せずに、可変長の連続的3次元ポーズシーケンスを生成する課題への対処。
  • 新規のデータ拡張技術を用いて、ポーズ生成におけるモデルの安定性を向上させ、ドリフトを低減する。
  • バックトランスレーションを用いたバックグラウンドで評価プロトコルを確立し、サイン言語生成(SLP)のベンチマークを提供する。
  • 直接的なテキストからポーズへの翻訳が、高価な語彙アノテーションに依存する少ないアプローチを上回ることを実証する。

提案手法

  • 固定語彙やEOSトークンを必要とせず、シーケンス生成の進行状況を追跡するカウンターデコーディング機構を導入し、可変長の連続出力を可能にする。
  • 入力テキストおよび出力ポーズシーケンスの両方における長距離依存関係をモデル化するため、マルチヘッドアテンションを用いたプログレッシブトランスフォーマー構造を採用する。
  • モデルのドリフトを低減し、一般化性能を向上させるために、ランダムクロッピング、時間的スケーリング、ノイズ注入などのデータ拡張技術を適用する。
  • 訓練済みのサイン言語翻訳(SLT)モデルが生成されたサインポーズを再びテキストに翻訳するバックトランスレーション評価プロトコルを用い、自動的な指標計算を可能にする。
  • T2P(テキストからポーズ)とT2G2P(テキストから語彙を経由してポーズ)の2つのモデル構成を実装し、語彙の中間表現の影響をアブレーション可能にする。
  • トレーニングおよび評価に、RWTH-PHOENIX-Weather-2014 Tデータセットの3次元ポーズシーケンスを用い、出力表現として関節座標を採用する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーに基づくアーキテクチャは、固定語彙やEOSトークンを必要とせず、話言語テキストから連続的3次元サインポーズシーケンスを生成できるか?
  • RQ2直接的なエンドツーエンドのテキストからポーズへの翻訳は、語彙を中間表現として用いるモデルを上回る性能を示すか?
  • RQ3データ拡張技術は、ポーズシーケンスのドリフトをどれほど低減し、生成品質を向上させるか?
  • RQ4バックトランスレーション評価メカニズムは、サイン言語生成のための信頼性があり再現可能なベンチマーク結果を提供できるか?
  • RQ5異なるモデル構成(T2P 対 T2G2P)は、生成されたサインシーケンスのリアリズムと正確性にどのように影響を与えるか?

主な発見

  • 語彙を中間表現とするT2G2Pモデルに比べ、直接的なテキストからポーズへの翻訳を実行するT2Pモデルが優れた性能を示し、PHOENIX14-TデータセットでBLEU-4スコア9.94を達成した。
  • 提案されたカウンターデコーディング機構により、明示的な終端トークンがなくても安定した連続的シーケンス生成が可能となり、推論の信頼性が向上した。
  • データ拡張はモデルのドリフトを顕著に低減し、生成中のポーズシーケンスの正確性と安定性を高めた。
  • バックトランスレーション評価プロトコルにより、人的評価を要せずとも信頼性があり自動的なベンチマーク評価が可能となり、モデル間の比較が可能になった。
  • 定性的な結果から、モデルは滑らかで現実的で、正確な身体の動きと意味的な手の形を有するサインシーケンスを生成しているが、固有名詞の処理は依然として課題である。
  • 本モデルは、語彙アノテーションが不要な高品質なサイン言語生成が可能であることを示しており、低リソースなサイン言語ドメインへの適用可能性を拡大した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。