[論文レビュー] Continuous Sign Language Recognition with Correlation Network
本稿では、連続するフレーム間の動的相関マップを用いて、クロスフレームのボディトラジェクトリを明示的に捉える、新しい相関ネットワークであるCorrNetを提案する。相関モジュールにより手や顔の動きのパターンを特定し、識別モジュールにより顕著なボディ領域を強調することで、追加の教師信号やポーズ推定を必要とせず、4つの主要データセットで最先端の性能を達成した。
Human body trajectories are a salient cue to identify actions in the video. Such body trajectories are mainly conveyed by hands and face across consecutive frames in sign language. However, current methods in continuous sign language recognition (CSLR) usually process frames independently, thus failing to capture cross-frame trajectories to effectively identify a sign. To handle this limitation, we propose correlation network (CorrNet) to explicitly capture and leverage body trajectories across frames to identify signs. In specific, a correlation module is first proposed to dynamically compute correlation maps between the current frame and adjacent frames to identify trajectories of all spatial patches. An identification module is then presented to dynamically emphasize the body trajectories within these correlation maps. As a result, the generated features are able to gain an overview of local temporal movements to identify a sign. Thanks to its special attention on body trajectories, CorrNet achieves new state-of-the-art accuracy on four large-scale datasets, i.e., PHOENIX14, PHOENIX14-T, CSL-Daily, and CSL. A comprehensive comparison with previous spatial-temporal reasoning methods verifies the effectiveness of CorrNet. Visualizations demonstrate the effects of CorrNet on emphasizing human body trajectories across adjacent frames.
研究の動機と目的
- 従来の連続符号語認識(CSLR)手法がフレームを独立して処理し、意味のあるクロスフレームのボディトラジェクトリを捉えられていないという限界に対処すること。
- 連続するフレーム間で、符号語の重要な手がかりである手や顔の特徴の時間的動きパターンを明示的にモデル化すること。
- キーポイントのアノテーションやヒートマップなどの追加教師信号に依存せず、軽量でエンドツーエンドで学習可能なフレームワークを開発すること。
- 相関ベースの特徴学習により局所的な時間的動きに注目することで、認識精度を向上させること。
- 多様なデータセット、特に大規模語彙や実世界のシナリオを含む環境において汎用性を示すこと。
提案手法
- 現在のフレームとその直前および直後のフレームとの間で動的相関マップを計算する相関モジュールを提案し、空間的パッチの軌道を特定する。
- 相関モジュール内に学習可能なアテンション機構を導入し、手や顔などの情報量の多い領域をフレーム間で注目する。
- 相関マップ内にボディトラジェクトリを動的に強調する識別モジュールを導入し、手や顔の表情といった動き関連領域を強調する。
- ポーズ推定やヒートマップなどの高コストな教師信号を避ける、軽量でエンドツーエンドの学習戦略を採用する。
- ResNet18バックボーン内で相関モジュールと識別モジュールを統合し、フレームごとの特徴を抽出するとともに、時間的文脈を保持する。
- 弱教師付きCSLRにおけるシーケンスレベルのアライメントに標準的なCTC損失を用い、エンドツーエンドの学習を可能にする。
![Figure 1 : Visualization of correlation maps with Grad-CAM [ 40 ] . It’s observed that without extra supervision, our method could well attend to informative regions in adjacent left/right frames to identify human body trajectories.](https://ar5iv.labs.arxiv.org/html/2303.03202/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1クロスフレームのボディトラジェクトリをモデル化することで、連続符号語認識の認識精度が向上するか?
- RQ2追加の教師信号に依存せず、相関ベースのメカニズムが局所的な時間的動きパターン(手や顔の特徴)を効果的に捉えられるか?
- RQ3外部モデルで抽出された手や顔の特徴を用いる最先端の手法と比較して、提案手法CorrNetはどのように性能を発揮するか?
- RQ4識別モジュール内の動的アテンション機構が、手や顔といった動き関連のボディパーツを適切に強調できるか?
- RQ5本手法は、語彙数や実世界コンテンツが異なる多様なデータセットに汎用性を示せるか?
主な発見
- PHOENIX14の開発スプリットでは18.8%、テストスプリットでは19.4%という、従来手法(手や顔の特徴を用いたものも含む)を上回る新しい最先端の語誤り率(WER)を達成した。
- 大規模語彙のCSL-Dailyデータセットでは、WERが30.1%にまで低下し、従来の最先端手法を顕著に上回り、優れた汎用性を示した。
- 標準的なCSLデータセットでは、0.8%という最先端のWERを達成し、以前の最良手法(C²SLR)を0.1パーセンテージポイント上回った。
- Grad-CAMを用いた可視化により、相関モジュールが隣接フレーム間で動くボディパーツ(手や顔)を動的に注目していることが確認された。
- 識別モジュールは、手や顔といった顕著な領域を効果的に強調し、不要な背景領域を抑制していた。
- ポーズ推定やヒートマップなどの追加教師信号を用いないにもかかわらず、それらを用いる手法を上回る性能を発揮したため、本手法の効率性と有効性が裏付けられた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。