Skip to main content
QUICK REVIEW

[論文レビュー] Multi-View Spatial-Temporal Network for Continuous Sign Language Recognition

Ronghui Li, Lu Meng|arXiv (Cornell University)|Apr 19, 2022
Hand Gesture Recognition Systems被引用数 8
ひとこと要約

本稿では、RGBとスケルトンモダリティを統合する新しいアテンション強化マルチスケール3次元グラフ畳み込みネットワーク(AM3D-GCN)とトランスフォーマーに基づくエンコーダーを用いて、連続する手話認識のためのマルチビュー空間時間ネットワーク(MSTCSLRN)を提案する。長距離依存関係をモデル化する。本手法は、SLR-100で1.9%の語誤り率(WER)を達成し、RWTH-PHOENIX-Weatherで22.8%を記録し、両ベンチマークで最先端の手法を上回った。

ABSTRACT

Sign language is a beautiful visual language and is also the primary language used by speaking and hearing-impaired people. However, sign language has many complex expressions, which are difficult for the public to understand and master. Sign language recognition algorithms will significantly facilitate communication between hearing-impaired people and normal people. Traditional continuous sign language recognition often uses a sequence learning method based on Convolutional Neural Network (CNN) and Long Short-Term Memory Network (LSTM). These methods can only learn spatial and temporal features separately, which cannot learn the complex spatial-temporal features of sign language. LSTM is also difficult to learn long-term dependencies. To alleviate these problems, this paper proposes a multi-view spatial-temporal continuous sign language recognition network. The network consists of three parts. The first part is a Multi-View Spatial-Temporal Feature Extractor Network (MSTN), which can directly extract the spatial-temporal features of RGB and skeleton data; the second is a sign language encoder network based on Transformer, which can learn long-term dependencies; the third is a Connectionist Temporal Classification (CTC) decoder network, which is used to predict the whole meaning of the continuous sign language. Our algorithm is tested on two public sign language datasets SLR-100 and PHOENIX-Weather 2014T (RWTH). As a result, our method achieves excellent performance on both datasets. The word error rate on the SLR-100 dataset is 1.9%, and the word error rate on the RWTHPHOENIX-Weather dataset is 22.8%.

研究の動機と目的

  • 明確な単語境界のない連続する手話シーケンスを認識する課題に対処する。これは弱教師付きのシーケンス・ツー・シーケンスモデルを必要とする。
  • 従来のCNN-LSTMモデルが空間的および時間的特徴を別々に学習し、長期依存関係に対処しづらいという限界を克服する。
  • RGB動画フレームとスケルトンキーポイントデータからの補完的情報を統合することで、認識のロバスト性を向上させる。
  • 両モダリティにおける空間的時間的ダイナミクスを統合的にモデル化できる特徴抽出ネットワークを設計し、表現学習を強化する。
  • 統合的マルチモーダル学習とアテンション機構を用いて、公開の連続手話データセットで最先端の性能を達成する。

提案手法

  • 長時間の手話シーケンスをより短いクリップに分割するスライディングウィンドウ戦略を採用し、より効果的な空間的時間的特徴学習を可能にする。
  • RGB動画クリップからの空間的時間的特徴を抽出するためにビジョントランスフォーマー(ViT)を用いる。これにより、グローバルな動きと外観パターンを捉える。
  • スケルトンシーケンスにおける関節座標とその関係性を時間的にモデル化するため、アテンション強化マルチスケール3次元グラフ畳み込みネットワーク(AM3D-GCN)を設計する。
  • AM3D-GCNにマルチスケールの受容 field を組み込み、遠く離れた関節間の長距離依存関係を捉え、構造的モデリングを向上させる。
  • AM3D-GCNに空間的時間的アテンション機構を適用し、不正確なキーポイント予測からのノイズを低減し、ロバスト性を向上させる。
  • RNNの長時間シーケンスにおける限界を克服するため、トランスフォーマーに基づくエンコーダーを用いて、手話シーケンス内の長距離時間的依存関係をモデル化する。
  • 符号化された特徴から最終的な手話単語シーケンスを予測するために、コネクショニスティック・タイムクラシフィケーション(CTC)デコーダーを実装する。

実験結果

リサーチクエスチョン

  • RQ1RGBとスケルトンモダリティの統合的モデリングは、連続手話認識の性能向上に寄与するか?
  • RQ2マルチスケール3D-GCNアーキテクチャは、標準の2Dまたは3D-GCNと比較して、身体関節間の空間的時間的関係をより効果的にモデル化できるか?
  • RQ3特徴抽出器に空間的時間的アテンションを組み込むことで、ノイズの多いキーポイント予測への感受性はどの程度低減されるか?
  • RQ4トランスフォーマーに基づくエンコーダーは、RNNベースのエンコーダーと比較して、連続手話シーケンス内の長距離依存関係をより効果的に捉えられるか?
  • RQ5提案されたマルチビュー空間時間ネットワークは、SLR-100 や RWTH-PHOENIX-Weather のような標準ベンチマークで、最先端の手法と比較してどのように差をつけるか?

主な発見

  • 提案手法は、SLR-100データセットで1.9%の語誤り率(WER)を達成し、比較対象のすべての手法の中で最高位となった。
  • RWTH-PHOENIX-Weatherデータセットでは、WERが22.8%に達し、低画質にもかかわらず強い汎化性能を示した。
  • RGBとスケルトンデータの統合により、RGB単体(3.2%)とスケルトン単体(2.1%)のWERから、マルチモーダル統合(1.9%)に低下し、補完的モダリティ学習の有効性が確認された。
  • アブレーションスタディの結果、3D-GCNにマルチスケールと空間的時間的アテンションを組み込んだ場合、2D-GCN単体(3.6%)から2.1%にWERが低下し、AM3D-GCN設計の有効性が裏付けられた。
  • トランスフォーマーに基づくエンコーダーは、数百フレームにわたる長時間シーケンスの依存関係を捉える能力が顕著に向上し、RNNベースの代替手法を上回った。
  • マルチスケールアーキテクチャを備えたAM3D-GCNは、すべてのバリエーションの中で最高の性能(WER = 2.1%)を示し、長距離関節関係のモデリングの重要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。