Skip to main content
QUICK REVIEW

[論文レビュー] Natural Language-Assisted Sign Language Recognition

Ronglai Zuo, Fangyun Wei|arXiv (Cornell University)|Mar 21, 2023
Hand Gesture Recognition Systems被引用数 5
ひとこと要約

本論文は、語彙の意味的情報を活用することで、視覚的特徴に依存するモデルの性能を向上させるNatural Language-Assisted Sign Language Recognition (NLA-SLR) フレームワークを提案する。語彙間の意味的類似度を用いた言語意識的なラベルスムージングと、モダリティ間ミックスアップを導入し、特徴の分離性を向上させ、MSASL、WLASL、NMFs-CSLベンチマークで最先端の性能を達成した。WLASL2000では61.05%のトップ1正答率を記録した。

ABSTRACT

Sign languages are visual languages which convey information by signers' handshape, facial expression, body movement, and so forth. Due to the inherent restriction of combinations of these visual ingredients, there exist a significant number of visually indistinguishable signs (VISigns) in sign languages, which limits the recognition capacity of vision neural networks. To mitigate the problem, we propose the Natural Language-Assisted Sign Language Recognition (NLA-SLR) framework, which exploits semantic information contained in glosses (sign labels). First, for VISigns with similar semantic meanings, we propose language-aware label smoothing by generating soft labels for each training sign whose smoothing weights are computed from the normalized semantic similarities among the glosses to ease training. Second, for VISigns with distinct semantic meanings, we present an inter-modality mixup technique which blends vision and gloss features to further maximize the separability of different signs under the supervision of blended labels. Besides, we also introduce a novel backbone, video-keypoint network, which not only models both RGB videos and human body keypoints but also derives knowledge from sign videos of different temporal receptive fields. Empirically, our method achieves state-of-the-art performance on three widely-adopted benchmarks: MSASL, WLASL, and NMFs-CSL. Codes are available at https://github.com/FangyunWei/SLRT.

研究の動機と目的

  • 視覚的に区別が困難なサイン(VISigns)の認識課題に対処し、視覚ベースのモデル性能を制限する要因を解消すること。
  • 言語的意味を持つ語彙(gloss)の意味的情報を活用し、視覚的特徴に加えて認識性能を向上させること。
  • 同じ視覚的外観を示すが意味が異なるVISignsの学習難易度を、意味的類似度をラベルスムージングに組み込むことで軽減すること。
  • 意味的に異なるが視覚的に類似したサイン(VISigns)の潜在空間における特徴の分離性を最大化するため、クロスモダリティ特徴ブレンドを活用すること。
  • RGB動画と人体キーポイント表現を複数の時間的受容場を有する複数の時間的受容場で統合する、新しい動画キーポイントネットワークバックボーンを設計すること。

提案手法

  • 言語意識的なラベルスムージングの提案:fastText埋め込みを用いて、正解語彙と語彙語彙内全語彙との間の正規化された意味的類似度からソフトラベルを生成する。
  • モダリティ間ミックスアップの適用:サイン動画の視覚的特徴とfastTextからの語彙特徴をブレンドし、混合表現とラベルを生成することで、識別能を向上させる。
  • RGB動画フレームと人体ボディキーポイント列を共同でモデル化する動画キーポイントネットワークバックボーンの設計。多様な受容場を有する知識蒸留を組み込む。
  • 補助分類器(FC2)を主分類器(FC1)に統合し、言語情報の伝搬を促進し、一般化性能を向上させる。訓練後期段階では分類損失を優先するための適応的損失重み付けを実装する。
  • 二段階訓練戦略の採用:まず標準的な交差エントロピー損失でバックボーンと分類器を訓練し、その後ミックスアップとラベルスムージングのコンponentsでファインチューニングを行う。
  • fastTextを用いて語彙間の意味的類似度を計算し、ラベルスムージングにおけるスムージング重みと、モダリティ間ミックスアップの基礎として用いる。

実験結果

リサーチクエスチョン

  • RQ1語彙間の意味的類似度は、視覚的に類似しているが意味的に異なるサインの学習安定性と性能向上に寄与するか?
  • RQ2モダリティ間ミックスアップにより、視覚的特徴と語彙特徴をブレンドすることで、潜在空間におけるサイン表現の分離性が向上するか?
  • RQ3標準的なラベルスムージングに比べ、言語意識的なラベルスムージングは、視覚的に類似したが意味的に異なるVISignsの処理において、どの程度優れているか?
  • RQ4提案された動画キーポイントネットワークバックボーンは、従来のモデルと比較して、サイン言語動画の空間的・時間的ダイナミクスをどの程度効果的にモデル化できるか?
  • RQ5言語意識的なラベルスムージングとモダリティ間ミックスアップの組み合わせは、視覚的に類似したサイン(類似/非類似意味)の両方において一貫した性能向上を達成できるか?

主な発見

  • 言語意識的なラベルスムージングは、テストされたすべてのスムージングパラメータ(ε = 0.1, 0.2, 0.3)において、バニララベルスムージングを上回り、WLASL2000ではトップ1正答率が0.92%〜1.24%向上した。
  • モダリティ間ミックスアップは、すべてのベンチマークでトップ1正答率を1%以上向上させ、特にVS-S(視覚的に類似、意味的に類似)サインで最大の向上を示し、正答率は50.50%から65.35%に上昇した。
  • 言語意識的なラベルスムージングとモダリティ間ミックスアップの組み合わせにより、最高の全体的性能が達成され、WLASL2000では61.05%のトップ1正答率を記録し、以前の最先端手法を上回った。
  • アブレーションスタディの結果、補助分類器と損失重み付け戦略が性能向上に顕著に寄与しており、主な貢献は2つの分類器の統合に起因することが確認された。
  • 意味的に異なるが視覚的に類似したVISigns(VS-D)においても顕著な向上が得られ、正答率は50.93%から56.07%に上昇した。これは、意味的に異なるが視覚的に類似したサインの処理における有効性を示している。
  • 動画キーポイントネットワークバックボーンは、異なる時間的受容場を有するRGBとキーポイントモダリティを効果的にモデル化することで、性能向上に寄与しており、アブレーションスタディで裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。