Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Audio-Visual Video Parsing with Pseudo Visual Labels

Jinxing Zhou, Dan Guo|arXiv (Cornell University)|2023. 03. 04.
Cancer-related molecular mechanisms research인용 수 7
한 줄 요약

이 논문은 CLIP 기반의 시각적 이벤트 검출을 사용하여 고품질의 세그먼트 수준 가짜 레이블을 생성하는 새로운 방법인 VPLAN을 제안한다. Richness-aware 손실과 레이블 노이즈 제거 전략을 도입함으로써 감독을 향상시켜 LLP 데이터셋에서 최신 기술 수준의 성능을 달성한다. 세그먼트 수준의 시각적 이벤트 정확도는 MM-Pyramid와 결합했을 때 52.3%에서 64.8%로 상승한다.

ABSTRACT

Audio-Visual Video Parsing is a task to predict the events that occur in video segments for each modality. It often performs in a weakly supervised manner, where only video event labels are provided, i.e., the modalities and the timestamps of the labels are unknown. Due to the lack of densely annotated labels, recent work attempts to leverage pseudo labels to enrich the supervision. A commonly used strategy is to generate pseudo labels by categorizing the known event labels for each modality. However, the labels are still limited to the video level, and the temporal boundaries of event timestamps remain unlabeled. In this paper, we propose a new pseudo label generation strategy that can explicitly assign labels to each video segment by utilizing prior knowledge learned from the open world. Specifically, we exploit the CLIP model to estimate the events in each video segment based on visual modality to generate segment-level pseudo labels. A new loss function is proposed to regularize these labels by taking into account their category-richness and segmentrichness. A label denoising strategy is adopted to improve the pseudo labels by flipping them whenever high forward binary cross entropy loss occurs. We perform extensive experiments on the LLP dataset and demonstrate that our method can generate high-quality segment-level pseudo labels with the help of our newly proposed loss and the label denoising strategy. Our method achieves state-of-the-art audio-visual video parsing performance.

연구 동기 및 목표

  • 오직 영상 수준의 레이블만 제공되는 약한 감독 기반의 음성-시각 영상 파싱 문제를 해결하기 위해.
  • 기존의 가짜 레이블 방법이 세그먼트 수준의 시간적 감독을 결여하고 있는 한계를 극복하기 위해.
  • 음성 및 시각 모odal리티 모두에 대해 신뢰할 수 있고 카테고리가 풍부하며 세그먼트가 풍부한 가짜 레이블을 생성함으로써 모델의 일반화 능력을 향상시키기 위해.
  • 가짜 레이블을 노이즈 제거 메커니즘을 통해 정제함으로써 애매한 영상 수준의 레이블이 초래하는 간섭을 줄이기 위해.
  • 기존 AVVP 모델에 대한 아키텍처 변경 없이도 적용 가능한 일반화 가능한 프레임워크를 제공하기 위해.

제안 방법

  • 가짜 레이블 생성 모듈은 CLIP 모델을 사용해 각 영상 세그먼트의 시각적 이벤트를 예측하고, 세그먼트 수준의 가짜 레이블을 생성한다.
  • 카테고리 다양성과 세그먼트 커버리지의 최대화를 통해 가짜 레이블을 정규화하기 위해 richness-aware 손실 함수를 제안한다.
  • 학습 중 높은 이진 교차 엔트로피 손실이 감지될 경우 예측을 뒤집는 방식으로 동적으로 가짜 레이블을 수정하는 레이블 노이즈 제거 전략을 도입한다.
  • 기본 모델인 HAN 모델과의 동시 학습 및 손실 계산을 통해 반복적으로 가짜 레이블을 정교화한다.
  • 기존의 AVVP 모델과 호환되며, 플러그인 모듈로 직접 적용할 수 있다.
  • 가짜 레이블이 음성 및 시각적 이벤트 정위치에 대한 감독으로 사용되며, 전체 프로세스는 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1약한 감독 기반의 영상 수준 레이블에서 시각어휘 미리 학습된 모델을 활용해 효과적으로 세그먼트 수준의 가짜 레이블을 생성할 수 있는가?
  • RQ2손실 함수에 카테고리 풍부성과 세그먼트 풍부성을 통합함으로써 가짜 레이블의 품질을 어떻게 향상시킬 수 있는가?
  • RQ3높은 손실 예측을 수정하는 동적 레이블 노이즈 제거 전략이 AVVP에서 모델의 일반화 능력을 향상시키는가?
  • RQ4제안된 방법이 아키텍처 수정 없이도 여러 최신 기술 수준의 AVVP 모델에서 성능 향상을 이끌 수 있는가?
  • RQ5정확도와 견고성 측면에서 기존의 가짜 레이블 생성 기법과 비교해 어떻게 성능을 냈는가?

주요 결과

  • 제안된 VPLAN 방법은 음성-시각 영상 파싱 분야에서 LLP 데이터셋에서 최신 기술 수준의 성능을 달성한다.
  • MM-Pyramid 모델과 결합했을 때, 시각적 이벤트 파싱 정확도가 전체 VPLAN 파이프라인을 사용해 52.3%에서 64.8%로 향상된다.
  • 레이블 노이즈 제거 전략이 성능 향상에 크게 기여하며, 기초 가짜 레이블링과 MA [48]와 같은 이전 방법보다 뛰어난 성능을 보인다.
  • 가짜 레이블의 오분류를 성공적으로 수정한다. 예를 들어, 움직임을 박수로 잘못 분류하거나 흐린 물체를 이벤트로 오분류하는 경우를 정정한다.
  • Richness-aware 손실은 세그먼트와 카테고리 간에 다양하고 균형 잡힌 가짜 레이블을 유도함으로써 레이블 정렬을 향상시킨다.
  • 해당 방법은 일반화 능력이 뛰어나며, 플러그인 모듈로 적용했을 때 MM-Pyramid와 MGN 모델 양쪽에서 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.