Skip to main content
QUICK REVIEW

[論文レビュー] Multi-scale temporal network for continuous sign language recognition

Qidan Zhu, Jing Li|arXiv (Cornell University)|Apr 8, 2022
Hand Gesture Recognition Systems被引用数 7
ひとこと要約

本稿では、マルチスケール受容 field とトランスフォーマーに基づくモジュールを用いて時間的特徴抽出を向上させる、連続性のある手話認識のためのマルチスケール時系列ネットワーク(MSTNet)を提案する。マルチレベルの接続主義的時系列分類(CTC)損失を統合することで、パラメータ増加なしにエンドツーエンド認識精度を向上させ、2つの公開データセットで最先端の性能を達成した。

ABSTRACT

Continuous Sign Language Recognition (CSLR) is a challenging research task due to the lack of accurate annotation on the temporal sequence of sign language data. The recent popular usage is a hybrid model based on "CNN + RNN" for CSLR. However, when extracting temporal features in these works, most of the methods using a fixed temporal receptive field and cannot extract the temporal features well for each sign language word. In order to obtain more accurate temporal features, this paper proposes a multi-scale temporal network (MSTNet). The network mainly consists of three parts. The Resnet and two fully connected (FC) layers constitute the frame-wise feature extraction part. The time-wise feature extraction part performs temporal feature learning by first extracting temporal receptive field features of different scales using the proposed multi-scale temporal block (MST-block) to improve the temporal modeling capability, and then further encoding the temporal features of different scales by the transformers module to obtain more accurate temporal features. Finally, the proposed multi-level Connectionist Temporal Classification (CTC) loss part is used for training to obtain recognition results. The multi-level CTC loss enables better learning and updating of the shallow network parameters in CNN, and the method has no parameter increase and can be flexibly embedded in other models. Experimental results on two publicly available datasets demonstrate that our method can effectively extract sign language features in an end-to-end manner without any prior knowledge, improving the accuracy of CSLR and achieving competitive results.

研究の動機と目的

  • 従来の CNN+RNN モデルにおける固定受容 field による時間的特徴抽出の不正確さという、連続性のある手話認識(CSLR)の課題に対処すること。
  • 複数の時間スケールで手話特徴を捉えることで、時間的モデリング能力を向上させること。
  • 新規のマルチレベル CTC 損失機構を用いて、浅い CNN 层における学習の効率性とパラメータ学習を向上させること。
  • 事前知識なしにエンドツーエンド認識を可能にし、公開ベンチマークで競争力のある性能を達成すること。

提案手法

  • フレームごとの特徴抽出のため、2つの全結合層を備えた ResNet を使用する。
  • 複数の受容 field サイズをカバーするように設計されたマルチスケール時系列ブロック(MSTブロック)を導入し、時間的特徴を抽出する。
  • 異なるスケールからの時間的特徴を統合し、トランスフォーマーモジュールを用いて長距離依存性を強化する。
  • 複数のネットワーク深さで訓練を監視するためのマルチレベル接続主義的時系列分類(CTC)損失を導入し、浅い層への勾配伝搬を改善する。
  • マルチレベル CTC 損失はパラメータフリーであり、既存モデルへの柔軟な統合が可能である。
  • ネットワーク全体をエンドツーエンドで訓練し、空間的および時間的表現の共同最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1マルチスケール時系列モデリングは、連続性のある手話認識システムの認識精度を向上させることができるか?
  • RQ2提案されたマルチレベル CTC 損失は、浅い CNN 層における学習効率と性能をどのように向上させるか?
  • RQ3マルチスケール時系列ブロックとトランスフォーマーを統合することで、時間的特徴学習はどの程度向上するか?
  • RQ4追加パラメータや事前知識なしに、提案手法は最先端の性能を達成できるか?
  • RQ5モデルは異なる公開 CSLR データセットに対してどの程度頑健か?

主な発見

  • 提案された MSTNet は、2つの公開可能な連続性のある手話認識データセットで最先端の性能を達成した。
  • マルチレベル CTC 損失により、浅いネットワーク層でのパラメータ更新が改善され、全体の訓練安定性と収束性が向上した。
  • マルチスケール時系列ブロックとトランスフォーマーの統合は、時間的特徴表現学習を顕著に向上させた。
  • モデルのパラメータを増加させることなく認識精度が向上し、高い効率性を示した。
  • アブレーションスタディにより、MSTブロックやマルチレベル CTC 損失の各コンポーネントの有効性が確認された。
  • エンドツーエンドの手話認識において競争力のある結果を達成し、従来の CNN+RNN ベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。