Skip to main content
QUICK REVIEW

[論文レビュー] CVT-SLR: Contrastive Visual-Textual Transformation for Sign Language Recognition with Variational Alignment

Jiangbin Zheng, Yile Wang|arXiv (Cornell University)|Mar 10, 2023
Hand Gesture Recognition Systems被引用数 4
ひとこと要約

本論文は、変分自己オートエンコーダ(VAE)を用いて視覚的・言語的モダリティを暗黙的かつ一貫して統合し、完全に事前学習された言語知識を統合する、新しい単一コア信号のサイン言語認識フレームワークCVT-SLRを提案する。対照的でクロスモダリティの整合性損失と動画- glossアダプタを組み合わせることで、より単純なアーキテクチャであるにもかかわらず、PHOENIX-2014およびPHOENIX-2014Tで最先端の性能を達成し、単一コア信号およびマルチコア信号の最先端手法を上回った。

ABSTRACT

Sign language recognition (SLR) is a weakly supervised task that annotates sign videos as textual glosses. Recent studies show that insufficient training caused by the lack of large-scale available sign datasets becomes the main bottleneck for SLR. Most SLR works thereby adopt pretrained visual modules and develop two mainstream solutions. The multi-stream architectures extend multi-cue visual features, yielding the current SOTA performances but requiring complex designs and might introduce potential noise. Alternatively, the advanced single-cue SLR frameworks using explicit cross-modal alignment between visual and textual modalities are simple and effective, potentially competitive with the multi-cue framework. In this work, we propose a novel contrastive visual-textual transformation for SLR, CVT-SLR, to fully explore the pretrained knowledge of both the visual and language modalities. Based on the single-cue cross-modal alignment framework, we propose a variational autoencoder (VAE) for pretrained contextual knowledge while introducing the complete pretrained language module. The VAE implicitly aligns visual and textual modalities while benefiting from pretrained contextual knowledge as the traditional contextual module. Meanwhile, a contrastive cross-modal alignment algorithm is designed to explicitly enhance the consistency constraints. Extensive experiments on public datasets (PHOENIX-2014 and PHOENIX-2014T) demonstrate that our proposed CVT-SLR consistently outperforms existing single-cue methods and even outperforms SOTA multi-cue methods.

研究の動機と目的

  • サイン言語認識(SLR)におけるデータ不足のボトル neck を解消するため、事前学習済みの視覚的および言語的モデルを完全に活用すること。
  • 単一コア信号SLRにおける従来の文脈モジュールを、暗黙的なクロスモダリティ整合性を可能にするとともに、完全な事前学習済み言語知識を保持できる変分自己オートエンコーダ(VAE)に置き換えること。
  • 陽的なクロスモダリティの一貫性を向上させるために、正例および負例のペアを区別する対照的学習に基づく整合性アルゴリズムを導入すること。
  • 微調整中に事前学習済みの視覚的および言語的パラメータを最大限に保持できるように、動画- glossアダプタを設計すること。
  • 高度なクロスモダリティ整合性を備えた単一コア信号フレームワークが、複雑なマルチコア信号最先端手法を上回ることを実証すること。

提案手法

  • 事前学習済み言語モデルを用いた疑似翻訳タスクから学習するVAEベースのモジュールを、単一コア信号SLRにおける標準的な文脈モジュールに置き換える。
  • VAEのオートエンコーディング構造を活用し、入力モダリティの再構築によって視覚的および言語的特徴を暗黙的に統合し、モダリティ間の一貫性を強制する。
  • 正例の視覚的・言語的特徴ペア間の類似度を最大化し、負例ペア間の類似度を最小化するように、対照的クロスモダリティ整合性損失を導入する。
  • 事前学習済みの視覚的および言語的エンコーダーの元のパラメータを更新せずに、微調整を効果的に行えるように動画- glossアダプタを設計する。
  • 序列生成のためのCTC損失と、クロスモダリティの一貫性のための対照的整合性損失を同時に最適化する。
  • GradCAMを用いてサリエンシーマップを可視化し、手および顔領域への注目度を分析することで、サイン言語の文法的原則との整合性を検証する。

実験結果

リサーチクエスチョン

  • RQ1VAEベースのモジュールは、単一コア信号SLRにおける標準的な文脈モジュールを効果的に置き換えられ、暗黙的なクロスモダリティ整合性を実現できるか?
  • RQ2VAEを介して完全な事前学習済み言語モデルを統合することで、標準的な文脈モジュールと比較してSLR性能が向上するか?
  • RQ3対照的整合性損失は、陽的なクロスモダリティの一貫性を向上させ、より高い認識精度をもたらすか?
  • RQ4本手法で提案された単一コア信号フレームワークは、暗黙的および陽的な整合性を備えることで、マルチコア信号最先端手法を上回るか?
  • RQ5事前学習済みの視覚的および言語的モジュールの使用は、学習収束速度および最終的な性能にどのような影響を与えるか?

主な発見

  • CVT-SLRは、PHOENIX-2014およびPHOENIX-2014Tの両方で、既存の単一コア信号およびマルチコア信号手法を上回る新たな最先端性能を達成した。
  • アブレーションスタディの結果、対照的整合性損失が性能向上に顕著に寄与しており、最適な性能は損失重み10.0で達成された。
  • 事前学習済みの視覚的および言語的モジュールを搭載したモデルは、収束が早く、より低い訓練損失を示し、これはより良いWERスコアと相関していた。
  • サリエンシーマップから、モデルがキーモーメントのサイン言語領域(手および顔)に注目していることが示され、言語学的原則との整合性が裏付けられた。
  • 完全な事前学習済み言語知識を備えたVAEベースのモジュールは、標準的なRNN/LSTMモジュールよりも性能が向上しており、事前知識の利点を示した。
  • 動画- glossアダプタは、事前学習済みの視覚的および言語的エンコーダーの完全な能力を保持したまま、効果的な微調整を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。