Skip to main content
QUICK REVIEW

[論文レビュー] Self-Emphasizing Network for Continuous Sign Language Recognition

Lianyu Hu, Liqing Gao|arXiv (Cornell University)|Nov 30, 2022
Hand Gesture Recognition Systems被引用数 11
ひとこと要約

本稿では、高価な監視情報や重いポーズ推定ネットワークに依存せずに、判別性の高い空間的(手や顔)および時間的(キーフレーム)特徴を自己適応的に強調する自己強調ネットワーク(SEN)を、連続性のある手話認識のためのものとして提案する。軽量なサブネットワークと学習可能なアテンションマップを用いることで、SENは最小限の計算コストで4つの大規模データセットにおいて最先端の性能を達成する。

ABSTRACT

Hand and face play an important role in expressing sign language. Their features are usually especially leveraged to improve system performance. However, to effectively extract visual representations and capture trajectories for hands and face, previous methods always come at high computations with increased training complexity. They usually employ extra heavy pose-estimation networks to locate human body keypoints or rely on additional pre-extracted heatmaps for supervision. To relieve this problem, we propose a self-emphasizing network (SEN) to emphasize informative spatial regions in a self-motivated way, with few extra computations and without additional expensive supervision. Specifically, SEN first employs a lightweight subnetwork to incorporate local spatial-temporal features to identify informative regions, and then dynamically augment original features via attention maps. It's also observed that not all frames contribute equally to recognition. We present a temporal self-emphasizing module to adaptively emphasize those discriminative frames and suppress redundant ones. A comprehensive comparison with previous methods equipped with hand and face features demonstrates the superiority of our method, even though they always require huge computations and rely on expensive extra supervision. Remarkably, with few extra computations, SEN achieves new state-of-the-art accuracy on four large-scale datasets, PHOENIX14, PHOENIX14-T, CSL-Daily, and CSL. Visualizations verify the effects of SEN on emphasizing informative spatial and temporal features. Code is available at https://github.com/hulianyuyy/SEN_CSLR

研究の動機と目的

  • 手や顔の特徴を用いる既存の手話認識手法が直面する高い計算コストと、高価な監視情報への依存を解消すること。
  • 外部監視なしで、情報量の多い空間的領域(手や顔)および判別性の高い時間的フレームへの自動的・自己動機付けされた強調を可能にすること。
  • モデルの複雑さとトレーニングの負荷を低減しつつ、連続性のある手話認識の認識精度を向上させること。
  • 外部のポーズ推定や事前抽出されたヒートマップではなく、エンドツーエンドで学習可能なアテンション機構によって、効果的な特徴強調が達成可能であることを示すこと。

提案手法

  • SENは、局所的な空間的・時間的特徴を抽出し、入力特徴を動的に強調または抑制するアテンションマップを生成する軽量なサブネットワークを採用する。
  • 空間的自己強調モジュールは、学習可能なアテンションにより、手や顔のような重要な領域を特定し、追加の監視なしに関連する視覚的手がかりを強化する。
  • 時間的自己強調モジュールは、顕著な動きを示すフレームに高い重みを割り当て、静的または冗長なフレームに低い重みを割り当てる。
  • 本手法は、標準的なバックボーン(例:ResNet18)を用いて、空間的および時間的アテンションモジュールを統合したエンドツーエンドで学習可能なフレームワークに統合する。
  • アテンションマップは、教師強化ヒートマップやキーポイントアノテーションの必要なしにトレーニング中に学習されるため、自己教師付きの特徴強調が可能になる。
  • アーキテクチャは計算効率に配慮しており、外部ポーズ推定ネットワークを用いる手法と比較して、追加パrameterやFLOPsを最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1外部監視に依存せずに、自己教師付きのアテンション機構が、手話動画における情報量の多い空間的領域(手や顔)を効果的に強調できるか。
  • RQ2学習可能な時間的アテンションモジュールが、判別性の高いフレームに注目し、冗長なフレームを抑制することで認識性能を向上できるか。
  • RQ3軽量でエンドツーエンドで学習可能なネットワークが、重いポーズ推定ネットワークや事前抽出されたヒートマップを用いる既存の最先端手法を凌駆できるか。
  • RQ4提案された自己強調メカニズムが、多様で大規模な連続性のある手話データセットに一般化可能か。

主な発見

  • SENは、PHOENIX14で19.5%、PHOENIX14-Tで21.0%という、新たな最先端の語誤り率(WER)を達成し、追加監視や重いポーズネットワークを用いる手法を上回った。
  • 挑戦的な CSL-Daily データセットでは、WERが30.7%にまで低下し、従来手法と顕著な差をつけて新たなSOTAを樹立した。
  • CSLデータセットでは、WERが0.8%にまで低下し、C2SLRが報告した従来のSOTA(0.9%)を上回った。
  • 可視化結果から、SENが効果的に手や顔の領域を強調し、動的な動きを示すフレームに注目していることが確認され、意味のあるアテンションパターンを学習できていることが示された。
  • 事前抽出されたヒートマップや専用のポーズ推定ネットワークに依存しないにもかかわらず、SENはそれらの手法を上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。