[論文レビュー] Leveraging Foundation models for Unsupervised Audio-Visual Segmentation
本論文は、高価なピクセル単位の音声マスクアノテーションを不要にするために、事前学習されたファウンデーションモデルを活用するトレーニングフリーで教師なしの音声視覚セグメンテーション手法を提案する。音声タギングとオープンワールド検出を用いたクロスモダリティセマンティックフィルタリング(CMSF)により、特に重なったオブジェクトにおいても優れた性能を達成しており、微調整や明示的な音声視覚統合を一切行わないにもかかわらず、複雑なシナリオで教師ありベースラインを上回る。
Audio-Visual Segmentation (AVS) aims to precisely outline audible objects in a visual scene at the pixel level. Existing AVS methods require fine-grained annotations of audio-mask pairs in supervised learning fashion. This limits their scalability since it is time consuming and tedious to acquire such cross-modality pixel level labels. To overcome this obstacle, in this work we introduce unsupervised audio-visual segmentation with no need for task-specific data annotations and model training. For tackling this newly proposed problem, we formulate a novel Cross-Modality Semantic Filtering (CMSF) approach to accurately associate the underlying audio-mask pairs by leveraging the off-the-shelf multi-modal foundation models (e.g., detection [1], open-world segmentation [2] and multi-modal alignment [3]). Guiding the proposal generation by either audio or visual cues, we design two training-free variants: AT-GDINO-SAM and OWOD-BIND. Extensive experiments on the AVS-Bench dataset show that our unsupervised approach can perform well in comparison to prior art supervised counterparts across complex scenarios with multiple auditory objects. Particularly, in situations where existing supervised AVS methods struggle with overlapping foreground objects, our models still excel in accurately segmenting overlapped auditory objects. Our code will be publicly released.
研究の動機と目的
- 高価で細分化されたピクセル単位の音声マスクアノテーションを必要とする教師あり音声視覚セグメンテーションのスケーラビリティの限界を解消すること。
- タスク固有の微調整やアノテーションデータなしで、教師なし音声視覚セグメンテーションを可能にすること。
- 音声タギング、オブジェクト検出、マルチモーダルなアライメントのための事前学習ファウンデーションモデル(例:AST, DINO, ImageBIND)を活用し、トレーニングなしでゼロショットで正確なセグメンテーションマスクを生成すること。
- 重なった聴覚的オブジェクトが存在する複雑なシーンにおける性能を向上させること。教師あり手法がしばしば失敗する状況で特に有効である。
- オープンワールドおよびマルチモーダルなファウンデーションモデルを効果的に組み合わせることで、明示的な音声視覚統合なしに、強力で汎用性の高いAVSを実現できることを示すこと。
提案手法
- クロスモダリティセマンティックフィルタリング(CMSF)を提案する。これは、音声と視覚モダリティを交互に使用してセグメンテーション候補を生成・フィルタリングするファウンデーションモデルのスイカス。
- AT-GDINO-SAMを実装する。音声タギング(AST)モデルを用いて音声タグを生成し、それをDINOとSAMを介してオブジェクト検出およびセグメンテーションをガイドする。
- OWOD-BINDを実装する。オープンワールドオブジェクト検出器(OWOD)を用いてバウンディングボックス候補を生成し、その後、ImageBINDからの音声埋め込みとのコサイン類似度を用いてフィルタリングする。
- 微調整なしに、AST(音声タギング用)、DINO(オブジェクト検出用)、ImageBIND(クロスモダリティアライメント用)などの事前学習モデルを活用する。
- SAMの画像エンコーダーとプロンプトエンコーダーをゼロショットセグメンテーションに活用し、ファウンデーションモデルからの音声または視覚的ヒントでガイドする。
- 視覚的候補と音声埋め込みを共通の潜在空間に投影するフィルタリング機構を適用し、意味的整合性を保証する。
実験結果
リサーチクエスチョン
- RQ1ファウンデーションモデルを活用することで、微調整やアノテーションデータなしに教師なし音声視覚セグメンテーションを実現できるか?
- RQ2市販のモデルに依存するトレーニングフリーなアプローチは、特に重なったオブジェクトが存在する複雑なシナリオにおいて、教師ありAVS手法と比較してどの程度の性能を示すか?
- RQ3オープンワールド検出とマルチモーダルアライメントモデルは、ゼロショットでオープンセット設定においてセグメンテーション精度を向上させられるか?
- RQ4SAM や ImageBIND などのファウンデーションモデルに依存する教師なしAVSの主な失敗モードは何か?
- RQ5音声ガイドドまたは視覚ガイドドの候補生成は、局所化精度と重なり処理の観点から、エンドツーエンドの教師あり手法をどの程度上回れるか?
主な発見
- OWOD-BINDは、AVSBenchのMS3設定においてM_IOUが0.58、F_scoreが0.67を達成し、微調整なしでAV-SAM(M_IOU: 0.40、F_score: 0.56)を上回る。
- S4設定において、SAM-BINDに比べてM_IOUとF_scoreがそれぞれ0.16向上し、オープンワールド検出と音声視覚フィルタリングの利点を実証した。
- 明示的な音声視覚統合なしで、ピアノと人のような重なった聴覚的オブジェクトを正確にセグメンテーションし、連続的かつ精密なマスクを生成できた。
- AVSBenchの平均性能(M_IOU: 0.78)よりは低いが、OWOD-BINDは人間のような非立方体のオブジェクトをより細分化された詳細で処理できている。
- 失敗事例には、SAMによる過剰セグメンテーション(例:ピアノキーを分割)、局所化の不正確さ(例:ピアノキーのみを特定しない)、発話中の人物と非発話人物の区別に失敗(時間的モデリングの欠如による)がある。
- 本手法は、SAM や ImageBIND などのファウンデーションモデルを段階的に組み合わせることで、ゼロショットで強力なAVS性能を達成できることを示しており、特にオープンセットおよび複雑なシナリオで顕著である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。