Skip to main content
QUICK REVIEW

[論文レビュー] Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing

Yapeng Tian, Dingzeyu Li|arXiv (Cornell University)|Jul 21, 2020
Music and Audio Processing参考文献 70被引用数 9
ひとこと要約

本論文は、ビデオレベルのラベルのみを用いて、聴覚的、視覚的、および聴覚視覚連合イベントにビデオをセグメンテーションする弱教師付き音声視覚動画解析フレームワークを提案する。ハイブリッドアテンションネットワークを導入して単モodalおよびクロスモーダルな時間的文脈をモデル化し、注意メカニズムを用いたMMILプーリングを採用して柔軟にマルチモーダル特徴を統合する。さらに、個別ガイド付き学習とラベルスムージングを用いてモーダルバイアスとノイズの多いラベルを軽減し、弱教師付き学習において優れた性能を達成した。本研究では、弱教師付き学習を用いた新しい大規模なLLPデータセットを用いて評価した。

ABSTRACT

In this paper, we introduce a new problem, named audio-visual video parsing, which aims to parse a video into temporal event segments and label them as either audible, visible, or both. Such a problem is essential for a complete understanding of the scene depicted inside a video. To facilitate exploration, we collect a Look, Listen, and Parse (LLP) dataset to investigate audio-visual video parsing in a weakly-supervised manner. This task can be naturally formulated as a Multimodal Multiple Instance Learning (MMIL) problem. Concretely, we propose a novel hybrid attention network to explore unimodal and cross-modal temporal contexts simultaneously. We develop an attentive MMIL pooling method to adaptively explore useful audio and visual content from different temporal extent and modalities. Furthermore, we discover and mitigate modality bias and noisy label issues with an individual-guided learning mechanism and label smoothing technique, respectively. Experimental results show that the challenging audio-visual video parsing can be achieved even with only video-level weak labels. Our proposed framework can effectively leverage unimodal and cross-modal temporal contexts and alleviate modality bias and noisy labels problems.

研究の動機と目的

  • 統合的マルチセンサリ動画理解の欠如に応えるために、音声視覚動画解析を弱教師付きタスクとして定式化すること。
  • 音声と視覚モーダルの間の複雑な時間的関係、特に非同期性を含めた関係をモデル化し、イベント検出の性能を向上させること。
  • 新しい訓練戦略を用いて、弱教師付きマルチモーダル学習におけるモーダルバイアスとノイズラベルを軽減すること。
  • ビデオレベルのアノテーションのみを用いて、聴覚的、視覚的、および聴覚視覚連合イベントの正確な時間的境界予測を可能にすること。
  • 統合的マルチセンサリ認識の文脈において、音声視覚動画解析のための新しいベンチマークとデータセットを提供すること。

提案手法

  • 単モーダルな時間的再帰性、マルチモーダルな同時発生性、音声視覚非同期性を統合的にモデル化するハイブリッドアテンションネットワーク(HAN)を提案する。
  • 異なる時間的スケールとモーダルの特徴を適応的に統合するための注意メカニズムを備えたMMILプーリング機構を導入する。
  • 各モーダルが独立に予測を行うように制約を課すことで、モーダルバイアスを低減する個別ガイド付き学習戦略を採用する。
  • 予測の過信を軽減し、ノイズの多いビデオレベルラベルの影響を緩和するためにラベルスムージングを適用する。
  • トレーニングに必要なのはビデオレベルのイベントラベルのみである弱教師付き学習パラダイムを採用する。
  • 11,849本のYouTubeクリップを含み、25のカテゴリに分けられた大規模な新規データセットLLPを、トレーニングおよび評価に活用する。

実験結果

リサーチクエスチョン

  • RQ1ビデオレベルの弱ラベルのみから音声視覚動画解析を効果的に学習できるか?
  • RQ2単モーダルおよびクロスモーダルな時間的文脈をどのように統合的にモデル化することで、イベント検出性能を向上させられるか?
  • RQ3弱教師付きマルチモーダル学習において、どの程度までモーダルバイアスを軽減できるか?
  • RQ4ラベルスムージングは、音声視覚解析におけるノイズの多いビデオレベルアノテーションに対して、どのようにモデルのロバストネスを向上させるか?
  • RQ5正確な音声視覚動画解析と時間的境界検出が可能になることで、どのような実用的応用が可能になるか?

主な発見

  • 提案されたフレームワークは、ビデオレベルの弱ラベルのみを用いても音声視覚動画解析で優れた性能を達成し、本タスクにおける弱教師付き学習の可能性を示した。
  • ハイブリッドアテンションネットワークは、同期的および非同期的な音声視覚イベントパターンを効果的に捉えており、時間的非同期性を無視するモデルを上回る性能を示した。
  • 個別ガイド付き学習戦略によりモーダルバイアスが顕著に低減され、主に聴覚的または視覚的なイベントの性能が向上した。
  • ラベルスムージングはモデルのロバストネスを向上させたが、ブートストラップベースのラベル更新は誤りの伝搬により性能を低下させた。
  • LLPデータセットは大規模な評価を可能にし、正確な時間的アノテーションを備えた音声視覚動画解析のための新しいベンチマークを確立した。
  • 本フレームワークは、非同期音声分離や音声視覚シーン認識に基づく動画理解といった、新たな応用を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。