Skip to main content
QUICK REVIEW

[논문 리뷰] Crossmodal learning for audio-visual speech event localization

Rahul Sharma, Krishna Somandepalli|arXiv (Cornell University)|2020. 03. 09.
Speech and Audio Processing참고 문헌 17인용 수 11
한 줄 요약

이 논문은 시각적 표현을 활용하여 청각-시각적 언어 이벤트를 국소화하는 크로스모달 신경망을 제안한다. 영상 프레임으로부터 시간적 및 공간적 힌트를 학습함으로써 청각-시각적 음성 활성도 검출 및 활성 화자 국소화에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

An objective understanding of media depictions, such as about inclusive portrayals of how much someone is heard and seen on screen in film and television, requires the machines to discern automatically who, when, how and where someone is talking. Media content is rich in multiple modalities such as visuals and audio which can be used to learn speaker activity in videos. In this work, we present visual representations that have implicit information about when someone is talking and where. We propose a crossmodal neural network for audio speech event detection using the visual frames. We use the learned representations for two downstream tasks: i) audio-visual voice activity detection ii) active speaker localization in video frames. We present a state-of-the-art audio-visual voice activity detection system and demonstrate that the learned embeddings can effectively localize to active speakers in the visual frames.

연구 동기 및 목표

  • 영상 콘텐츠에서 누가, 언제, 어디서 말을 하고 있는지 자동으로 감지할 수 있도록 하는 것.
  • 다중모态 신호를 사용하여 청각-시각 미디어에서 활성 화자를 식별하는 과제를 해결하는 것.
  • 말하기 시기와 공간적 위치를 암묵적으로 코딩하는 시각적 표현을 개발하는 것.
  • 크로스모달 학습을 통해 청각-시각적 음성 활성도 검출 및 활성 화자 국소화를 향상시키는 것.
  • 학습된 시각 임베딩이 영상 프레임 내에서 말하기 이벤트를 국소화하는 데 효과적인지 입증하는 것.

제안 방법

  • 이 방법은 시각적 및 청각적 특징을 융합하여 언어 이벤트를 탐지하는 크로스모달 신경망을 사용한다.
  • 영상 프레임이 처리되어 말하기가 발생하는 시점과 위치를 암묵적으로 코딩하는 표현을 추출한다.
  • 통합된 시각적 및 청각적 감독을 사용하여 청각-시각적 언어 이벤트를 예측하도록 모델을 훈련시킨다.
  • 학습된 시각 임베딩을 두 가지 후행 작업인 음성 활성도 검출 및 활성 화자 국소화에 맞춤 조정한다.
  • 더 나은 탐지 성능을 위해 시각적 및 청각적 모달 간의 정렬을 위해 어텐션 메커니즘을 활용한다.
  • 청각-시각적 언어 탐지 및 국소화를 위한 공동 표현 최적화를 위해 엔드 투 엔드 훈련을 사용한다.

실험 결과

연구 질문

  • RQ1시각적 표현만으로도 말하기 이벤트에 대한 시간적 및 공간적 힌트를 암묵적으로 코딩할 수 있는가?
  • RQ2비모달 기반 기준 대비 크로스모달 학습이 청각-시각적 음성 활성도 검출에 얼마나 효과적으로 기여하는가?
  • RQ3학습된 시각 임베딩이 영상 프레임에서 활성 화자를 높은 정확도로 국소화할 수 있는가?
  • RQ4제안된 방법이 이전 접근법 대비 활성 화자 국소화에서 얼마나 높은 성능 향상을 이룰 수 있는가?
  • RQ5시각적 특징이 복잡한 영상 장면에서 강력한 말하기 이벤트 탐지에 얼마나 기여하는가?

주요 결과

  • 제안된 방법은 청각-시각적 음성 활성도 검출에서 최신 기술 수준의 성능을 달성한다.
  • 학습된 시각 임베딩은 영상 프레임 내에서 활성 화자를 효과적으로 국소화한다.
  • 청각 및 시각 모달 간의 크로스모달 상호작용을 활용함으로써 탐지 정확도가 향상됨을 보여준다.
  • 시각적 표현은 말하기 시기와 공간적 위치에 대한 암묵적 정보를 포함하고 있어, 후행 국소화 작업에 기여한다.
  • 음성 활성도 검출 및 활성 화자 국소화 작업 모두에서 기존 방법을 능가하는 성능을 보인다.
  • 결과는 크로스모달 학습과 결합할 경우 시각 데이터만으로도 정밀한 청각-시각적 언어 이벤트 국소화가 가능함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.