Skip to main content
QUICK REVIEW

[論文レビュー] Deformation Flow Based Two-Stream Network for Lip Reading

Jingyun Xiao, Shuang Yang|arXiv (Cornell University)|Mar 12, 2020
Speech and Audio Processing参考文献 16被引用数 4
ひとこと要約

本稿では、隣接する動画フレーム間の自己教師付き変形フロー推定を活用して、口元領域の運動ダイナミクスを捉える、変形フローに基づく二ストリームネットワーク(DFTN)を提案する。二ストリームアーキテクチャと双方向知識蒸留を用いて、生動画と変形フロー特徴を融合することで、LRW(84.13%)およびLRW-1000(41.93%)ベンチマークで最先端の性能を達成し、補完的な運動と外観の手がかりの有効性を示している。

ABSTRACT

Lip reading is the task of recognizing the speech content by analyzing movements in the lip region when people are speaking. Observing on the continuity in adjacent frames in the speaking process, and the consistency of the motion patterns among different speakers when they pronounce the same phoneme, we model the lip movements in the speaking process as a sequence of apparent deformations in the lip region. Specifically, we introduce a Deformation Flow Network (DFN) to learn the deformation flow between adjacent frames, which directly captures the motion information within the lip region. The learned deformation flow is then combined with the original grayscale frames with a two-stream network to perform lip reading. Different from previous two-stream networks, we make the two streams learn from each other in the learning process by introducing a bidirectional knowledge distillation loss to train the two branches jointly. Owing to the complementary cues provided by different branches, the two-stream network shows a substantial improvement over using either single branch. A thorough experimental evaluation on two large-scale lip reading benchmarks is presented with detailed analysis. The results accord with our motivation, and show that our method achieves state-of-the-art or comparable performance on these two challenging datasets.

研究の動機と目的

  • 隣接フレーム間の変形フローを用いて、口元領域における微細な時間的運動ダイナミクスをモデル化することで、唇読み取りの性能を向上させること。
  • 従来の手法が動画フレーム内の空間的・時間的相関を十分に活用していないという限界を補うために、動きに敏感なモダリティを導入すること。
  • 双方向知識蒸留により、二ストリームブランチ間での知識交換を可能にし、特徴学習を強化すること。
  • 生動画と変形フローからの補完的特徴を用いて、単語レベルの唇読み取りベンチマークで優れた性能を達成すること。

提案手法

  • 連続する動画フレーム間のピクセル単位の変形フィールドを推定する自己教師付き変形フローネットワーク(DFN)を訓練し、口元領域における動きを顕著な変形として表現する。
  • 変形フローと生グレースケールフレームを、それぞれ別々のストリームとして二ストリーム畳み込みニューラルネットワークに供給し、特徴抽出を実行する。
  • トレーニング段階で双方向知識蒸留を適用し、各ストリームが相手のソフト確率予測から知識を蒸留することで、汎化性能と特徴学習を向上させる。
  • 推論段階では、両ストリームの予測を確率分布の要素ごとの乗算により統合し、分類精度を向上させる。
  • 本手法はResNetベースのバックボーンと交差エントロピー損失を用い、中間特徴統合と知識蒸留を組み合わせて共同最適化を実現する。
  • 変形フローは、人為的にアノテートされた動きラベルを一切使用せずに、動画の一貫性に依存して推定される。

実験結果

リサーチクエスチョン

  • RQ1隣接フレーム間の変形フローは、より良い唇読み取りを実現するための唇の運動ダイナミクスを効果的にモデル化できるか?
  • RQ2生動画と変形フロー特徴を二ストリームネットワークで統合することで、単一ストリームベースラインよりも優れた性能が得られるか?
  • RQ3二ストリームブランチ間での双方向知識蒸留は、モデルの精度と汎化性能をさらに向上させられるか?
  • RQ4本手法は大規模ベンチマークにおいて、最先端の唇読み取りモデルと比較してどのように性能を発揮するか?

主な発見

  • 提案されたDFTNは、LRWベンチマークで単語レベル認識精度84.13%を達成し、以前の最先端手法(84.07%)を上回った。
  • より困難なLRW-1000データセットでは、DFTNが41.93%の精度を達成し、Yang19(38.19%)やWang19(36.91%)といった先行手法を顕著に上回った。
  • 双方向知識蒸留損失は、個々のストリームおよび最終統合予測の両方の性能を向上させ、効果的なストリーム間知識移転を示した。
  • 二ストリームの確率出力の乗算統合は、加法的統合や中間特徴統合よりも高い精度を示し、補完的情報の有効性を裏付けた。
  • 自己教師付きDFNは、ラベルなしの動きデータに依存して意味のある変形フローを生成でき、唇読み取りにおける動きモデリングに有効であることを実証した。
  • アブレーションスタディにより、変形フローと生動画の組み合わせに加え、双方向蒸留が性能向上の鍵であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。