Skip to main content
QUICK REVIEW

[논문 리뷰] Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing

Yapeng Tian, Dingzeyu Li|arXiv (Cornell University)|2020. 07. 21.
Music and Audio Processing참고 문헌 70인용 수 9
한 줄 요약

이 논문은 오직 영상 수준의 레이블만을 사용하여 영상을 청각적, 시각적, 청각시각적 이벤트로 분할하는 약한 지도 학습 기반의 오디오-비주얼 영상 해석 프레임워크를 제안한다. 이는 단일 모odal 및 교차 모달 시간적 맥락을 모델링하기 위해 하이브리드 어텐션 네트워크를 도입하고, 적응형 다중모달 집계를 위해 주의 기반 MMIL 풀링을 활용하며, 개별 지도 학습 및 레이블 스무딩을 통해 모달성 편향과 노이즈가 있는 레이블을 완화한다. 이로 인해 약한 지도 학습 환경에서 강력한 성능을 달성하였다.

ABSTRACT

In this paper, we introduce a new problem, named audio-visual video parsing, which aims to parse a video into temporal event segments and label them as either audible, visible, or both. Such a problem is essential for a complete understanding of the scene depicted inside a video. To facilitate exploration, we collect a Look, Listen, and Parse (LLP) dataset to investigate audio-visual video parsing in a weakly-supervised manner. This task can be naturally formulated as a Multimodal Multiple Instance Learning (MMIL) problem. Concretely, we propose a novel hybrid attention network to explore unimodal and cross-modal temporal contexts simultaneously. We develop an attentive MMIL pooling method to adaptively explore useful audio and visual content from different temporal extent and modalities. Furthermore, we discover and mitigate modality bias and noisy label issues with an individual-guided learning mechanism and label smoothing technique, respectively. Experimental results show that the challenging audio-visual video parsing can be achieved even with only video-level weak labels. Our proposed framework can effectively leverage unimodal and cross-modal temporal contexts and alleviate modality bias and noisy labels problems.

연구 동기 및 목표

  • 통합 다감각 영상 이해의 부족을 해결하기 위해 오디오-비주얼 영상 해석을 약한 지도 학습 문제로 재정의하는 것.
  • 청각 및 시각 모달 간의 복잡한 시간적 관계, 특히 이질성까지 고려하여 이벤트 탐지를 향상시키기 위한 모델링.
  • 새로운 학습 전략을 통해 약한 지도 학습 기반 다중모달 학습에서의 모달성 편향과 노이즈가 있는 레이블을 완화하는 것.
  • 오직 영상 수준의 애너테이션만을 사용하여 청각적, 시각적, 청각시각적 이벤트의 정확한 시간 경계 예측을 가능하게 하는 것.
  • 통합 다감각 인식 맥락에서 오디오-비주얼 영상 해석을 위한 새로운 벤치마크 및 데이터셋 제공

제안 방법

  • 단일 모달 시간적 반복, 다중모달 동시 발생, 청각시각적 이질성을 동시에 모델링하는 하이브리드 어텐션 네트워크(HAN)를 제안한다.
  • 다양한 시간 범위와 모달 간에 유용한 청각 및 시각적 특징을 적응적으로 집계하기 위해 주의 기반 MMIL 풀링 메커니즘을 도입한다.
  • 각 모달이 독립적인 예측을 하도록 강제함으로써 모달성 편향을 줄이기 위해 개별 지도 학습 전략을 활용한다.
  • 예측의 과도한 확신을 줄이고 노이즈가 있는 영상 수준의 레이블 영향을 완화하기 위해 레이블 스무딩을 적용한다.
  • 학습에 오직 영상 수준의 이벤트 레이블이 필요로 하는 약한 지도 학습 파рад림을 사용한다.
  • 11,849개의 YouTube 클립과 25개의 카테고리로 구성된 새로운 대규모 데이터셋인 LLP를 활용하여 학습 및 평가를 수행한다.

실험 결과

연구 질문

  • RQ1오직 영상 수준의 약한 레이블만으로도 오디오-비주얼 영상 해석을 효과적으로 학습할 수 있는가?
  • RQ2단일 모달 및 교차 모달 시간적 맥락을 동시에 모델링하여 이벤트 탐지 성능를 향상시킬 수 있는가?
  • RQ3약한 지도 학습 기반 다중모달 학습에서 모달성 편향을 어느 정도 완화할 수 있는가?
  • RQ4레이블 스무딩이 오디오-비주얼 해석에서 노이즈가 있는 영상 수준 애너테이션에 대한 모델의 강건성을 향상시키는가?
  • RQ5정확한 오디오-비주얼 영상 해석 및 시간 경계 예측을 통해 어떤 실용적 응용이 가능해지는가?

주요 결과

  • 제안된 프레임워크는 오직 영상 수준의 약한 레이블만을 사용하여도 오디오-비주얼 영상 해석에서 강력한 성능을 달성하여, 이 작업에 대해 약한 지도 학습의 실현 가능성을 입증한다.
  • 하이브리드 어텐션 네트워크는 동기화 및 이질성 있는 청각시각적 이벤트 패턴을 효과적으로 포착하여, 시간적 이질성을 忽시하는 모델보다 우수한 성능을 보인다.
  • 개별 지도 학습 전략은 모달성 편향을 크게 감소시켜 주로 청각적 또는 시각적인 이벤트에서의 성능 향상을 이룬다.
  • 레이블 스무딩은 모델의 강건성을 향상시키지만, 부트스트랩 기반 레이블 업데이트는 오류 전파로 인해 성능을 떨어뜨린다.
  • LLP 데이터셋은 대규모 평가를 가능하게 하며, 정밀한 시간 애너테이션을 제공함으로써 오디오-비주얼 영상 해석의 새로운 벤치마크를 수립한다.
  • 이 프레임워크는 이질성 있는 소리 분리 및 오디오-비주얼 시나리오 인식 기반 영상 이해와 같은 새로운 응용을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.