Skip to main content
QUICK REVIEW

[論文レビュー] Visual Keyword Spotting with Attention

K R Prajwal, Liliane Momeni|arXiv (Cornell University)|Oct 29, 2021
Speech and Audio Processing参考文献 72被引用数 6
ひとこと要約

本論文では、視覚的動画特徴と音声的キーワード埋め込みの間で完全なクロスモーダルアテンションを用いる、TransformerベースのモデルTranspotterを提案する。このモデルは、無音動画における話されたキーワードの局所化に、LRW、LRS2、LRS3データセットで最先端の性能を達成し、特に手話動画における孤立した口の動きの検出において顕著に優れた性能を示し、極端なドメインシフト下でも強力な一般化能力を示している。

ABSTRACT

In this paper, we consider the task of spotting spoken keywords in silent video sequences -- also known as visual keyword spotting. To this end, we investigate Transformer-based models that ingest two streams, a visual encoding of the video and a phonetic encoding of the keyword, and output the temporal location of the keyword if present. Our contributions are as follows: (1) We propose a novel architecture, the Transpotter, that uses full cross-modal attention between the visual and phonetic streams; (2) We show through extensive evaluations that our model outperforms the prior state-of-the-art visual keyword spotting and lip reading methods on the challenging LRW, LRS2, LRS3 datasets by a large margin; (3) We demonstrate the ability of our model to spot words under the extreme conditions of isolated mouthings in sign language videos.

研究の動機と目的

  • 無音動画における視覚的キーワードスポットティング(KWS)の課題に取り組むこと。この際、全トランスクリプションではなく、特定のキーワードの局所化のみを目的とする。
  • 言語モデル依存度が高く、遮蔽や短い発話条件下で性能が低下する既存の視覚的発話認識(VSR)手法の限界を克服すること。
  • ターゲットキーワードの事前知識を活用することで、キーワード局所化のロバスト性と正確性を向上させるモデルを開発すること。
  • 顕著なドメインシフトや部分的発話が見られる、孤立した手話の口の動きを含む、困難な現実世界のシナリオにおける性能を評価すること。
  • 標準的な唇読みデータセットを超えて一般化できるかどうかを示すために、部分的発話が含まれる、新しいノイズの多い手動アノテーション付きの手話コーパスを用いてテストすること。

提案手法

  • Transpotterモデルは、2つの独立したスティームを用いる。1つは3D CNNを用いて動画フレームを視覚的特徴に変換するためのもので、もう1つは学習可能な位置エンコーディングを用いてターゲットキーワードを音声的埋め込みに変換するためのものである。
  • 視覚的スティームと音声的スティームの間で完全なクロスアテンションを採用し、キーワードの音声的構造に対応する関連する視覚的領域を動的に注目できるようにする。
  • キーワードが存在する際には、視覚的および音声的表現の整合性を促進するため、対照的学習の目的関数を用いて訓練する。
  • 最終的な予測ヘッドは、動画シーケンス全体にわたる時間的局所化スコアを出力し、キーワードの開始時刻と終了時刻を特定する。
  • アーキテクチャはエンドツーエンド微分可能であり、特徴学習と局所化の両方を同時に最適化する。
  • 事前処理パイプラインにより、手話動画から顔クロップされた動画トラックを抽出し、推論における一貫性のある入力を保証する。

実験結果

リサーチクエスチョン

  • RQ1視覚的モダリティと音声的モダリティの間でクロスアテンション機構を用いることで、従来手法と比較して視覚的キーワードスポットティングの性能が顕著に向上するか?
  • RQ2孤立した手話の口の動きを含むような極端なドメインシフトに対して、モデルの一般化性能はどの程度高いか?
  • RQ3部分的唇運動、遮蔽、非標準的な発話といった困難な条件下でも、モデルの性能は維持されるか?
  • RQ4標準的なベンチマークデータセット(LRW、LRS2、LRS3)において、最先端のKWSおよびVSRベースラインを上回る性能を発揮できるか?
  • RQ5キーワードが部分的にしか口で発話されない、または強い共鳴発話(co-articulation)が伴う状況では、モデルの性能がどの程度低下するか?

主な発見

  • Transpotterモデルは、手話動画における口の動きの検出において、BSL-Corpusで29.6のmAPを達成し、従来の最先端KWS-Netベースライン(15.6 mAP)を顕著に上回った。
  • LRS2データセットでは、Transpotterが47.1のmAPを達成し、以前の最先端KWS手法を大きく上回った。
  • モデルは同音語(homophones)に対してもロバストであることが示され、ターゲット語とその音声的に類似した同音語を、同じ正解位置で正しく局所化できた。
  • 部分的な口の動きしか存在しない状況でも、BSL-Corpusの定性的な結果から、高いドメインシフトと手動アノテーションのノイズがある中で、キーワードの局所化に成功した。
  • BSL-Corpusでは、トップ1精度が22.5%、トップ5精度が47.1%を達成し、低リソースで現実世界の手話データへの強い一般化能力を示した。
  • Transpotterは、挑戦的なLRW、LRS2、LRS3データセットにおいて、従来の視覚的KWSおよび最先端の唇読みベースラインをすべて上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。