Skip to main content
QUICK REVIEW

[論文レビュー] Sign Language Translation with Hierarchical Spatio-TemporalGraph Neural Network

Jichao Kan, Kun Hu|arXiv (Cornell University)|Nov 14, 2021
Hand Gesture Recognition Systems被引用数 7
ひとこと要約

本稿では、手話の翻訳(SLT)のための階層的空間時系列グラフニューラルネットワーク(HST-GNN)を提案する。手話は細分化された(関節レベル)および高レベル(身体領域)のグラフによってモデル化され、局所的および大規模な空間時系列的依存関係を捉える。本手法は、Phoenix-2014-TおよびCSLベンチマークで最先端の性能を達成し、テストセットにおいて19.5 WERおよび46.1 BLEU-1を記録した。

ABSTRACT

Sign language translation (SLT), which generates text in a spoken language from visual content in a sign language, is important to assist the hard-of-hearing community for their communications. Inspired by neural machine translation (NMT), most existing SLT studies adopted a general sequence to sequence learning strategy. However, SLT is significantly different from general NMT tasks since sign languages convey messages through multiple visual-manual aspects. Therefore, in this paper, these unique characteristics of sign languages are formulated as hierarchical spatio-temporal graph representations, including high-level and fine-level graphs of which a vertex characterizes a specified body part and an edge represents their interactions. Particularly, high-level graphs represent the patterns in the regions such as hands and face, and fine-level graphs consider the joints of hands and landmarks of facial regions. To learn these graph patterns, a novel deep learning architecture, namely hierarchical spatio-temporal graph neural network (HST-GNN), is proposed. Graph convolutions and graph self-attentions with neighborhood context are proposed to characterize both the local and the global graph properties. Experimental results on benchmark datasets demonstrated the effectiveness of the proposed method.

研究の動機と目的

  • 聴覚障害者や難聴を抱える手話使用者と、話言語話者との間のコミュニケーションギャップを解消するため、正確な手話翻訳(SLT)を可能にすること。
  • 複数の身体部位にわたる複雑な空間時系列的相互作用をモデル化できない既存のシーケンス・トゥ・シーケンスモデルの限界を克服すること。
  • 細粒度の関節レベルと高レベルの領域的相互作用を表現するため、手話を階層的空間時系列グラフとして形式化すること。
  • グラフ畳み込みとグラフ自己注意機構を、近隣の文脈と統合した、新たな深層学習アーキテクチャ(HST-GNN)を構築し、強固な表現学習を実現すること。
  • 包括的なアブレーションおよび定性的分析を通じて、ベンチマークSLTデータセット上で提案手法の有効性を実証すること。

提案手法

  • 身体部位(例:手)の関節座標を用いて細分化された空間時系列グラフを構築し、顔や手などの主要領域の外観、動き、またはポーズ特徴を用いて高レベルのグラフを構築する。
  • 近隣の文脈を統合したグラフ畳み込みとグラフ自己注意機構を用い、局所的および大規模なグラフ特性を同時にモデル化する。
  • エンコーダ・デコーダフレームワークを設計し、エンコーダがグラフ畳み込みと自己注意を用いて階層的グラフを処理し、デコーダが学習済み埋め込みから話言語テキストを生成する。
  • 隣接行列ベースの接続メカニズムを用い、細分化されたグラフおよび高レベルのグラフの両方で、ノード(身体部位)間の構造的関係を保持する。
  • 最適サイズが3の時間ウィンドウを導入し、短期的依存関係を捉える一方で、長距離の歴史的データからのノイズを最小限に抑える。
  • 訓練中にアライメントの監視を強化するため、CTC損失を適用し、語彙予測の正確性を向上させる。
Figure 1: Illustration of the proposed HST-GNN architecture for SLT.
Figure 1: Illustration of the proposed HST-GNN architecture for SLT.

実験結果

リサーチクエスチョン

  • RQ1どのようにして、マルチモodalかつ空間時系列的な性質を持つ手話を、グラフベースの表現によって効果的にモデル化できるか?
  • RQ2空間的および時間的グラフ構造を統合することで、個別にモデル化した場合と比較して、SLT性能にどのような影響を与えるか?
  • RQ3細分化されたレベル(細粒度)と高レベルのグラフモデリングにより、平坦または単一レベルのグラフアプローチと比較して、手話表現がどのように向上するか?
  • RQ4近隣の文脈を統合したグラフ畳み込みとグラフ自己注意は、SLTにおける特徴学習をどの程度向上させるか?
  • RQ5意味のある手話のダイナミクスを捉えるために、最適な時間ウィンドウサイズは何か?ノイズの増加を避けるためにも、過剰なノイズを含まないよう最適化する必要がある。

主な発見

  • 提案されたHST-GNNは、Phoenix-2014-Tデータセットで最先端の性能を達成し、テストセットで19.5 WERおよび46.1 BLEU-1のスコアを記録した。
  • CSLデータセットでは、27.6 WERおよび49.1 BLEU-1のスコアを達成し、異なる手話データセットへの汎用性が強く示された。
  • アブレーションスタディの結果、空間的および時間的グラフモデリングを統合することで、個別のコンponentsよりも顕著に性能が向上し、完全なHST-GNNがすべてのアブレーションバリアントを上回った。
  • 階層的モデリングコンponentは、特にレアまたは複雑な語彙の検出において性能を向上させたことが、定性的分析で示された。
  • 最適な時間ウィンドウサイズは3であった。より大きなウィンドウは、ノイズとモデルの複雑さが増加するため、性能を低下させた。
  • 定性的な結果から、完全なHST-GNNモデルはテスト例のすべての語彙を正しく検出していたが、ベースラインおよび部分的なモデルは、語彙の漏れや誤挿入を示していた。
Figure 2: Effect of the windows size on recognition performance (lower is better). WER scores on PHONIX (left y-axis) WER scores on CSL (right y-axis) vs. window size (x-axis).
Figure 2: Effect of the windows size on recognition performance (lower is better). WER scores on PHONIX (left y-axis) WER scores on CSL (right y-axis) vs. window size (x-axis).

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。