[論文レビュー] Improving Audio-Visual Video Parsing with Pseudo Visual Labels
本論文では、CLIPベースの視覚的イベント検出を用いて高品質なセグメントレベルの偽ラベルを生成する、弱教師付き音声・視覚動画解析のための新規手法VPLANを提案する。豊かさに配慮した損失関数とラベルノイズ除去戦略を導入することで、監視を強化し、LLPデータセットにおいて最先端の性能を達成した。セグメントレベルの視覚的イベント精度は、MM-Pyramidと組み合わせた際、52.3%から64.8%に向上した。
Audio-Visual Video Parsing is a task to predict the events that occur in video segments for each modality. It often performs in a weakly supervised manner, where only video event labels are provided, i.e., the modalities and the timestamps of the labels are unknown. Due to the lack of densely annotated labels, recent work attempts to leverage pseudo labels to enrich the supervision. A commonly used strategy is to generate pseudo labels by categorizing the known event labels for each modality. However, the labels are still limited to the video level, and the temporal boundaries of event timestamps remain unlabeled. In this paper, we propose a new pseudo label generation strategy that can explicitly assign labels to each video segment by utilizing prior knowledge learned from the open world. Specifically, we exploit the CLIP model to estimate the events in each video segment based on visual modality to generate segment-level pseudo labels. A new loss function is proposed to regularize these labels by taking into account their category-richness and segmentrichness. A label denoising strategy is adopted to improve the pseudo labels by flipping them whenever high forward binary cross entropy loss occurs. We perform extensive experiments on the LLP dataset and demonstrate that our method can generate high-quality segment-level pseudo labels with the help of our newly proposed loss and the label denoising strategy. Our method achieves state-of-the-art audio-visual video parsing performance.
研究の動機と目的
- ビデオレベルのラベルしか入手できない弱教師付き音声・視覚動画解析の課題に対処すること。
- 既存の偽ラベル手法がセグメントレベルの時間的監視を欠いているという制限を克服すること。
- 音声および視覚モodalの両方のための信頼性が高く、カテゴリ豊富でセグメント豊富な偽ラベルを生成することで、モデルの汎化性能を向上させること。
- 偽ラベルをノイズ除去機構で精練することで、曖昧なビデオレベルラベルによる干渉を低減すること。
- アーキテクチャの変更なしに、既存のAVVPモデルに適用可能な汎用フレームワークを提供すること。
提案手法
- 偽ラベル生成モジュールは、CLIPモデルを用いて各ビデオセグメントにおける視覚的イベントを予測し、セグメントレベルの偽ラベルを生成する。
- 豊かさに配慮した損失関数を提案し、カテゴリ多様性とセグメントカバレッジの両方を最大化することで、偽ラベルを正則化する。
- トレーニング中に高いバイナリクロスエントロピー損失が検出された場合に予測を反転させることで、動的に偽ラベルを修正するラベルノイズ除去戦略を採用する。
- ベースラインHANモデルと前方損失計算を共同でトレーニングすることで、反復的に偽ラベルを精錬する。
- 既存のAVVPモデルと互換性があり、プラグインモジュールとして直接適用可能である。
- フレームワークはエンドツーエンドで訓練され、偽ラベルが音声および視覚的イベントの局所化の監視に用いられる。
実験結果
リサーチクエスチョン
- RQ1視覚言語事前学習を用いて、弱教師付きのビデオレベルラベルからセグメントレベルの偽ラベルを効果的に生成できるか?
- RQ2損失関数にカテゴリ豊かさとセグメント豊かさを組み込むことで、偽ラベル品質をどのように向上させられるか?
- RQ3高い損失を示す予測を補正する動的ラベルノイズ除去戦略は、AVVPにおけるモデルの汎化性能を向上させるか?
- RQ4本手法は、アーキテクチャの変更なしに、複数の最先端AVVPモデルの性能を向上させられるか?
- RQ5既存の偽ラベル生成技術と比較して、精度と頑健性の面で本手法はどのように差をつけるか?
主な発見
- 提案されたVPLAN手法は、音声・視覚動画解析のためのLLPデータセットにおいて、最先端の性能を達成した。
- MM-Pyramidモデルと組み合わせた場合、VPLANパイプラインを全量使用することで、視覚的イベント解析精度が52.3%から64.8%に向上した。
- ラベルノイズ除去戦略は性能向上に顕著な効果を示し、ベースラインの偽ラベル付けおよび先行手法(MA [48])を上回った。
- 本手法は偽ラベルの誤検出を効果的に是正でき、例えば動きをクラップと誤って分類する、またはぼやけた物体をイベントと誤認するなどの誤検出を是正した。
- 豊かさに配慮した損失は、セグメントおよびカテゴリにわたり多様で均等に分布する偽ラベルを促進することで、ラベルの整合性を向上させた。
- 本手法は汎用性が高く、プラグインとして適用した場合、MM-PyramidおよびMGNモデルの両方の性能を向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。