Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Lift Pooling for Continuous Sign Language Recognition

Lianyu Hu, Liqing Gao|arXiv (Cornell University)|Jul 18, 2022
Hand Gesture Recognition Systems被引用数 7
ひとこと要約

本稿では、信号処理におけるリフト・スケームにインspiredした、学習可能な時系列ダウンサンプリング手法であるTemporal Lift Pooling (TLP)を提案する。この手法は、連続する手話認識(CSLR)における特徴表現を向上させるために、入力シーケンスを低周波数成分と高周波数成分に分解し、重み付けと統合の段階を経て処理する。TLPは、手動で設計されたプーリング法や最先端手法に対して、最小限の計算コスト増加で1.5%の絶対的性能向上を達成した。

ABSTRACT

Pooling methods are necessities for modern neural networks for increasing receptive fields and lowering down computational costs. However, commonly used hand-crafted pooling approaches, e.g., max pooling and average pooling, may not well preserve discriminative features. While many researchers have elaborately designed various pooling variants in spatial domain to handle these limitations with much progress, the temporal aspect is rarely visited where directly applying hand-crafted methods or these specialized spatial variants may not be optimal. In this paper, we derive temporal lift pooling (TLP) from the Lifting Scheme in signal processing to intelligently downsample features of different temporal hierarchies. The Lifting Scheme factorizes input signals into various sub-bands with different frequency, which can be viewed as different temporal movement patterns. Our TLP is a three-stage procedure, which performs signal decomposition, component weighting and information fusion to generate a refined downsized feature map. We select a typical temporal task with long sequences, i.e. continuous sign language recognition (CSLR), as our testbed to verify the effectiveness of TLP. Experiments on two large-scale datasets show TLP outperforms hand-crafted methods and specialized spatial variants by a large margin (1.5%) with similar computational overhead. As a robust feature extractor, TLP exhibits great generalizability upon multiple backbones on various datasets and achieves new state-of-the-art results on two large-scale CSLR datasets. Visualizations further demonstrate the mechanism of TLP in correcting gloss borders. Code is released.

研究の動機と目的

  • 連続する手話認識(CSLR)における長時間系列データの判別的時系列特徴を保持する点で、従来の手動で設計されたプーリング手法(例:max/average pooling)に見られる限界を解消すること。
  • 空間的バージョンと比較してしばしば無視されがちな、プーリング機構における未開拓な時系列次元を探索すること。
  • 多様なバックボーンやデータセットに普遍的に適用可能な、即挿入可能な時系列ダウンサンプリングモジュールを構築し、特徴表現を強化すること。
  • 時系列特徴階層の精錬により、連続する手話認識における語彙境界検出と認識精度を向上させること。

提案手法

  • TLPは、信号処理におけるリフト・スケームに由来し、入力信号を異なる周波数帯域に分解し、異なる動きパターンに対応させる。
  • 本手法は3段階のプロセスを経る:予測と更新ステップによる信号分解、学習可能なパラメータを用いた成分重み付け、および情報統合による洗練されたダウンサンプル特徴マップの生成。
  • リフト処理により、入力シーケンスが低域(滑らかな動きパターン)と高域(詳細なダイナミクス)成分に分離され、階層的特徴学習が可能になる。
  • TLPは軽量な1×1畳み込みを用いて実装されており、計算コストはたった0.4%増加に抑えられ、効率的かつ即挿入可能なモジュールとしての実用性を有する。
  • アーキテクチャはバックボーンに依存しない設計となっており、CSLR用のさまざまなCNNベースのモデルへのシームレスな統合が可能である。
  • TLPは、バックボーン内の2つのプーリング層のみを置き換える形で、2つの大規模なCSLRベンチマークで評価された。

実験結果

リサーチクエスチョン

  • RQ1信号処理にインspiredした時系列プーリング機構は、連続する手話認識において従来の手動で設計されたプーリングを上回ることができるか?
  • RQ2TLPは、動きパターンに対応する異なる周波数帯域に時系列信号を分解することで、特徴表現をどのように向上させるか?
  • RQ3TLPは、長時間系列モデリングの文脈において、さまざまなニューラルネットワークバックボーンやデータセットにどの程度一般化可能か?
  • RQ4TLPは語彙境界検出を向上させることで、連続する手話認識における認識精度を向上させるか?
  • RQ5TLPは、顔や手のランドマークなどの補助入力に依存せずに、最先端の性能を達成できるか?

主な発見

  • PHOENIX14データセットでは、標準的なmax poolingおよびaverage poolingに対して1.5%の絶対的WER改善を達成し、PHOENIX14-Tでは1.7%の向上を示した。
  • PHOENIX14データセットでは、TLPにより開発セットで19.7%(dev)、テストセットで20.8%(test)のWERを達成し、ベースラインのResNet18を1.5ポイント上回った。
  • TLPは、ResNet18、SqueezeNet、RegNetY-800Mfなど複数のバックボーンで一貫した性能向上を示し、1.0%から1.7%の向上を達成した。
  • PHOENIX14およびPHOENIX14-Tの両データセットで、顔や手の特徴などの追加情報を利用する手法を上回る、新たな最先端の結果を達成した。
  • 可視化結果から、TLPはより集中的かつ正確な語彙予測を生成することが確認され、特にベースラインと比較してずれが大きい境界の修正に有効であることが示された。
  • 本手法は良好な一般化性能を示し、バックボーンの能力に比例した性能向上を示した。大規模なモデルはTLPによりより大きな利益を得ており、強力な特徴抽出器と相乗効果を発揮することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。