Skip to main content
QUICK REVIEW

[論文レビュー] SLGTformer: An Attention-Based Approach to Sign Language Recognition

Neil Song, Xiang Yu|arXiv (Cornell University)|Dec 21, 2022
Hand Gesture Recognition Systems被引用数 4
ひとこと要約

SLGTformerは、人間の骨格キーポoin時系列を用いた、非アンサンブル型で注目メカニズムに基づく新しいトランスフォーマーモデルを提案する。空間的モデリングには学習可能なグラフ相対的位置エンコーディング(LGRPE)を、時間的モデリングには効率的な局所的・グローバルな時間的依存関係を捉えるための時間的ツイン自己注意(TTSA)を組み合わせ、アンサンブルを用いない状態を達成した。

ABSTRACT

Sign language is the preferred method of communication of deaf or mute people, but similar to any language, it is difficult to learn and represents a significant barrier for those who are hard of hearing or unable to speak. A person's entire frontal appearance dictates and conveys specific meaning. However, this frontal appearance can be quantified as a temporal sequence of human body pose, leading to Sign Language Recognition through the learning of spatiotemporal dynamics of skeleton keypoints. We propose a novel, attention-based approach to Sign Language Recognition exclusively built upon decoupled graph and temporal self-attention: the Sign Language Graph Time Transformer (SLGTformer). SLGTformer first deconstructs spatiotemporal pose sequences separately into spatial graphs and temporal windows. SLGTformer then leverages novel Learnable Graph Relative Positional Encodings (LGRPE) to guide spatial self-attention with the graph neighborhood context of the human skeleton. By modeling the temporal dimension as intra- and inter-window dynamics, we introduce Temporal Twin Self-Attention (TTSA) as the combination of locally-grouped temporal attention (LTA) and global sub-sampled temporal attention (GSTA). We demonstrate the effectiveness of SLGTformer on the World-Level American Sign Language (WLASL) dataset, achieving state-of-the-art performance with an ensemble-free approach on the keypoint modality. The code is available at https://github.com/neilsong/slt

研究の動機と目的

  • 骨格キーポイント時系列を用いた、分離型手話認識のための強力で注目メカニズムに基づくトランスフォーマーフレームワークの開発。
  • 学習可能なグラフ相対的位置エンコーディング(LGRPE)を用いて、グラフの近隣構造を組み込むことで、空間的モデリングの向上。
  • 局所的およびグローバルな注目メカニズムを組み合わせることで、時間的モデリングを強化し、長距離および短距離の依存関係を効率的に学習。
  • モデルアンサンブルやRGBモダリティに依存せずに、WLASL2000データセットで最先端の性能を達成すること。
  • キーポイントベースのSLRにおける限界、例えば遮蔽や発話者による実行のばらつきを、向上した注目メカニズムにより克服すること。

提案手法

  • SLGTformerは、空間的グラフと時間的ウィンドウを分離して処理し、独立した注目計算を実施する。
  • 空間的自己注意に構造的近隣コンテキストを組み込むために、学習可能なグラフ相対的位置エンコーディング(LGRPE)を導入する。
  • 時間的ツイン自己注意(TTSA)機構は、短距離ダイナミクスのための局所的グループ化時間的注目(LTA)と、長距離依存関係のためのグローバルにサブサンプリングされた時間的注目(GSTA)を組み合わせる。
  • LGRPEは自己注意の前処理として適用され、グラフトポロジーを用いて空間的注目をガイドする。一方、自己注意後のグラフ畳み込みにより、ノード表現がさらに精錬される。
  • RGB動画から27ノードの2次元キーポイント時系列を抽出するために、事前学習済みの全身ポーズ推定器(HRNetベースのMMPose)を用い、正規化とデータ拡張を適用する。
  • 通常の自己注意の2次関数的コストを回避するため、ウィンドウ化およびサブサンプリングされた注目を用いることで、モデルの複雑さを低減する。

実験結果

リサーチクエスチョン

  • RQ1キーポイント時系列のみを用いたトランスフォーマーベースのアーキテクチャが、分離型手話認識で最先端の性能を達成できるか。
  • RQ2学習可能なグラフ相対的位置エンコーディング(LGRPE)は、人間の骨格グラフの空間的モデリングをどの程度向上させるか。
  • RQ3局所的およびグローバルな時間的注目(TTSA)の組み合わせが、標準的な自己注意よりも短距離および長距離の時間的ダイナミクスを効果的に捉えられるか。
  • RQ4非アンサンブル型、キーポイントオンリーモデルが、既存のアンサンブルベースまたはRGBベースの手法をWLASL2000ベンチマークで上回れるか。
  • RQ5データ拡張およびキーポイント正規化は、多様な発話者や発話スタイルにわたるモデルの一般化性能にどのように影響するか。

主な発見

  • SLGTformerは、WLASL2000データセットにおいて非アンサンブル手法として最高のトップ-1およびトップ-5正解率を達成し、キーポイントオンリーモデルとして新たな最先端性能を確立した。
  • アブレーションスタディにより、TTSAが局所的および長距離の時間的依存関係を効果的にモデリングすることで、性能が著しく向上することが確認された。
  • LGRPEは標準的な位置エンコーディングよりも顕著な性能向上を示し、グラフ構造に基づく相対的位置情報の価値を裏付けた。
  • 自己注意後のグラフ畳み込みは、特にノードの自己接続および空間的コンテキストのモデリングにおいて性能をさらに向上させた。
  • 空間的および時間的次元において、SLGTformerは通常の自己注意を上回った。これは、提案されたアーキテクチャ的要素の有効性を示している。
  • 事前学習済みのポーズ推定器に依存しているものの、発話者や発話のバリエーションにわたって良好に一般化された。ただし、遮蔽や指レベルの不正確さは依然として課題である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。