[論文レビュー] SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
SignVTCL は、ビデオ、キーポイント、オプティカルフローのデータを統合し、グロスおよび文レベルでの視覚的・言語的対照学習を用いるマルチモーダル連続性サイン言語認識フレームワークを提案する。この手法は、Phoenix-2014、Phoenix-2014T、CSL-Daily で最先端の性能を達成し、開発セットでは 17.3%、テストセットでは 17.6% の語誤り率(WER)を低下させた。
Sign language recognition (SLR) plays a vital role in facilitating communication for the hearing-impaired community. SLR is a weakly supervised task where entire videos are annotated with glosses, making it challenging to identify the corresponding gloss within a video segment. Recent studies indicate that the main bottleneck in SLR is the insufficient training caused by the limited availability of large-scale datasets. To address this challenge, we present SignVTCL, a multi-modal continuous sign language recognition framework enhanced by visual-textual contrastive learning, which leverages the full potential of multi-modal data and the generalization ability of language model. SignVTCL integrates multi-modal data (video, keypoints, and optical flow) simultaneously to train a unified visual backbone, thereby yielding more robust visual representations. Furthermore, SignVTCL contains a visual-textual alignment approach incorporating gloss-level and sentence-level alignment to ensure precise correspondence between visual features and glosses at the level of individual glosses and sentence. Experimental results conducted on three datasets, Phoenix-2014, Phoenix-2014T, and CSL-Daily, demonstrate that SignVTCL achieves state-of-the-art results compared with previous methods.
研究の動機と目的
- 連続性サイン言語認識(CSLR)における大規模なアノテート済みサイン言語データセットの不足に取り組む。
- 統一されたバックボーンでビデオ、キーポイント、オプティカルフローのモダリティを統合し、視覚的表現学習を向上させる。
- グロスレベルおよび文レベルでの視覚的・言語的アライメントを通じて自然言語の監視を活用し、モデルの汎化性能を向上させる。
- 全動画のグロスのみがアノテートされている弱教師ありのSLRの性質を克服し、視覚的セグメントと対応するテキスト的グロスの間で細粒度のアライメントを可能にする。
- マルチモーダルおよび対照学習の統合により、複数のベンチマークで最先端の性能を達成する。
提案手法
- ビデオ、2次元ポーズキーポイント、オプティカルフローの3つのモダリティを統合し、動的運動理解を向上させる共通の視覚的バックボーンに統合する。
- 中間層で補助的な CTC 損失を生成するためのサインピラミッドネットワーク(SPN)を採用し、時間的スケールにわたる特徴学習を改善する。
- 動的時間ワープ(DTW)を用いたグロスレベルのアライメント損失を導入し、視覚的特徴と個々のグロスを一致させる。
- 視覚的シーケンスと完全な文の埋め込みの間で包括的な意味的整合性を強制する文レベルのアライメント損失を導入する。
- グロスおよび文レベルで視覚的・言語的埋め込み間のクロスモダリティ類似度を最適化することで、視覚的・言語的対照学習を実装する。
- 弱教師ありのサイン動画データ上で、エンドツーエンドに学習可能なマルチヘッドデコーダーを CTC 損失および補助的な SPN 監視を用いて訓練する。
実験結果
リサーチクエスチョン
- RQ1ビデオ、キーポイント、オプティカルフローの3モダリティを同時に学習することで、サイン言語認識における視覚的表現品質が顕著に向上するか?
- RQ2グロスレベルでの視覚的・言語的対照学習は、個々のサインジェスチャーとその対応するテキスト的グロスを効果的にアライメントできるか?
- RQ3文レベルでの視覚的・言語的アライメントは、連続性サイン言語認識における文脈理解と認識精度をどの程度向上させるか?
- RQ4マルチモーダルデータと対照学習の統合により、SLRにおける大規模なアノテート済みデータセットの不足に起因する性能低下を緩和できるか?
- RQ5各モダリティ(ビデオ、キーポイント、オプティカルフロー)および学習損失部品が最終的な認識性能に果たす相対的寄与度はどの程度か?
主な発見
- SignVTCL は、Phoenix-2014 データセットの開発セットで語誤り率(WER)17.3%、テストセットで 17.6% を達成し、以前の手法を上回った。
- ビデオ、キーポイント、オプティカルフローのエンコーダーの統合により、開発セットで 1.1%、テストセットで 1.0% の WER 減少が確認され、単一モダリティの使用と比較して顕著な改善が得られた。
- グロスレベルのアライメント損失の導入により、開発セットの WER は 18.3% から 17.5% に低下し、細粒度アライメントの有効性が裏付けられた。
- 文レベルのアライメントにより、開発セットの WER は 17.7% に改善され、文脈モデリングの向上が示された。
- SPN 補助損失とすべてのアライメント損失を組み合わせることで、開発セットでは WER 17.3%、テストセットでは 17.6% にまで低下し、すべてのコンponents の相乗効果が確認された。
- グロスレベル類似度行列の可視化により、対角線に沿った高い集中度が観察され、視覚的および言語的表現間の有効なアライメントが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。