Skip to main content
QUICK REVIEW

[論文レビュー] Lip-reading with Hierarchical Pyramidal Convolution and Self-Attention

Hang Chen, Jun Du|arXiv (Cornell University)|Dec 28, 2020
Speech and Audio Processing参考文献 25被引用数 4
ひとこと要約

本論文は、語彙レベルの唇読み取りのための新しい深層学習モデルを提案する。標準的な畳み込みを、多スケールの空間的特徴抽出を可能にする階層的パラメトリック畳み込み(HPConv)に置き換え、平均プーリングによるコンSENSUS手法を自己注意に基づく時系列統合に置き換えている。本モデルはLRWデータセットで86.83%の精度を達成し、先行研究の最良結果である1.53%の絶対的向上を示しており、微細な唇の動きの検出能が向上し、関連する動画フレームへの注目が強化されていることを示している。

ABSTRACT

In this paper, we propose a novel deep learning architecture to improving word-level lip-reading. On the one hand, we first introduce the multi-scale processing into the spatial feature extraction for lip-reading. Specially, we proposed hierarchical pyramidal convolution (HPConv) to replace the standard convolution in original module, leading to improvements over the model's ability to discover fine-grained lip movements. On the other hand, we merge information in all time steps of the sequence by utilizing self-attention, to make the model pay more attention to the relevant frames. These two advantages are combined together to further enhance the model's classification power. Experiments on the Lip Reading in the Wild (LRW) dataset show that our proposed model has achieved 86.83% accuracy, yielding 1.53% absolute improvement over the current state-of-the-art. We also conducted extensive experiments to better understand the behavior of the proposed model.

研究の動機と目的

  • 微細な唇の動きの空間的特徴抽出を強化することで、語彙レベルの唇読み取り性能を向上させること。
  • 平均プーリングによるコンセンサスの限界を克服し、動的で注目に基づくフレーム重み付けを学習することで、時系列的コンセンサスの性能を向上させること。
  • 多スケール処理を唇読み取りモデルのフロントエンドに統合し、ビズムの変動をよりよく表現すること。
  • 階層的パラメトリック畳み込みと自己注意に基づくコンセンサスの有効性を、LRWベンチマーク上での除去実験と比較実験により検証すること。

提案手法

  • 入力特徴を複数の空間的解像度で処理できる階層的パラメトリック畳み込み(HPConv)を提案し、局所的およびグローバルな唇の運動パターンのより良い捉え込みを可能にする。
  • ResNet-18における標準的な2次元畳み込みをHPConvに置き換え、階層的特徴学習を維持したまま、多スケールの空間的特徴を抽出する。
  • ターゲット語に対する関連性に基づいて動的フレーム重みを付与する自己注意に基づくコンセンサスモジュールを導入する。
  • 学習可能な注目メカニズムを用いてソフトな語の境界を生成し、固定または均一な平均化よりも優れたフレーム選択を実現する。
  • 長距離の時系列依存性をモデル化するために、多スケール時系列畳み込みネットワーク(MS-TCN)をバックエンドとして採用する。
  • HPConvをフロントエンドに、自己注意に基づくコンセンサスを統合することで、空間的認識と時系列的関連性モデリングの両方を向上させる。

実験結果

リサーチクエスチョン

  • RQ1階層的パラメトリック畳み込みによる多スケール空間的特徴抽出は、語彙レベルの唇読み取りにおける微細な唇の動きの認識を向上させることができるか?
  • RQ2自己注意に基づく時系列コンセンサスは、分類の際に関連する動画フレームに注目する点で、平均プーリングを上回る性能を示すか?
  • RQ3HPConvと自己注意に基づくコンセンサスは、LRWデータセット上で個別および統合的にどのように性能に寄与するか?
  • RQ4手動アノテーションと比較して、注目メカニズムによりモデルがどれほど正確な語の境界を学習できるか?

主な発見

  • 提案モデルはLRWデータセットでトップ1精度86.83%を達成し、先行研究の最良結果である1.53%の絶対的向上を示している。
  • HPConvは、ビズムが少ない語の分類精度を著しく向上させ、微細な唇の動きの検出能を強化している。
  • 自己注意に基づくコンセンサスは、語の境界が曖昧な場合に特に平均プーリングを上回り、より正確なフレーム関連性を学習している。
  • 除去実験の結果、HPConvと自己注意に基づくコンセンサスは、独立してかつ相乗的に性能向上に寄与していることが確認された。
  • モデルが学習した注目重みは、手動アノテーションと相関しており、編集距離が増加するにつれて精度が低下する傾向を示しており、モデルが意味的な時系列構造を学習していることが裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。