Skip to main content
QUICK REVIEW

[논문 리뷰] MAAS: Multi-modal Assignation for Active Speaker Detection

Juan León-Alcázar, Fabian Caba Heilbron|arXiv (Cornell University)|2021. 01. 11.
Speech and Audio Processing참고 문헌 59인용 수 9
한 줄 요약

MAAS는 그래프 신경망을 사용하여 다중 시각적 화자 임베딩을 공통 음성 임베딩에 매칭하는 방식으로 활동 중인 화자 검출을 다루는 새로운 다중 모odal 할당 프레임워크를 제안한다. 프레임 수준의 유사도를 모델링하고 동적 그래프 구조를 통해 시간적 일관성을 강제함으로써, MAAS는 AVA-ActiveSpeaker에서 88.8%의 새로운 최고 성능 mAP를 달성했으며, 피팅 트레이닝 없이도 더 어려운 새로운 벤치마크인 Talkies에서 이전 방법보다 1.7% 높은 성능을 기록했다.

ABSTRACT

Active speaker detection requires a solid integration of multi-modal cues. While individual modalities can approximate a solution, accurate predictions can only be achieved by explicitly fusing the audio and visual features and modeling their temporal progression. Despite its inherent muti-modal nature, current methods still focus on modeling and fusing short-term audiovisual features for individual speakers, often at frame level. In this paper we present a novel approach to active speaker detection that directly addresses the multi-modal nature of the problem, and provides a straightforward strategy where independent visual features from potential speakers in the scene are assigned to a previously detected speech event. Our experiments show that, an small graph data structure built from a single frame, allows to approximate an instantaneous audio-visual assignment problem. Moreover, the temporal extension of this initial graph achieves a new state-of-the-art on the AVA-ActiveSpeaker dataset with a mAP of 88.8\%.

연구 동기 및 목표

  • 현재 활동 중인 화자 검출 방법이 짧은 시간 프레임 수준의 모델링에 집중하고, 다중 화자 모호성과 시간적 일관성 문제를 해결하지 못하는 데서 비롯되는 한계를 해결하기 위해.
  • 시각적 특징을 다수의 화자로부터 추출하여 단일 공통 음성 임베딩에 매칭하는 다중 모달 할당 문제로 활동 중인 화자 검출을 재정의하기 위해.
  • 비말의 얼굴 표정(예: 웃음)이나 프레임 외부에서 발생하는 말소리 등으로 인한 잘못된 경고를 줄이기 위해 그래프 기반 시간 모델링을 활용하여 강건성을 향상시키기 위해.
  • 기존 데이터셋을 초월해 일반화 능력을 평가하기 위해 다양한 도전적인 클립 10,000개로 구성된 새로운 벤치마크인 Talkies를 제안하기 위해.
  • 지역적 특징에서 유도된 단순한 그래프 구조가 순간적인 음성-시각 할당 문제를 근사할 수 있으며, 동시에 장기적인 시간적 일관성을 확보할 수 있음을 보여주기 위해.

제안 방법

  • 이 방법은 정적이고 프레임 수준의 연결을 가지는 두 번째 스트림과, 임베딩 공간 내 최근접 이웃을 기반으로 학습된 특징 기반 동적 연결을 가지는 두 번째 스트림을 사용하는 이중 스트림 그래프 신경망이다.
  • 각 노드는 얼굴 쿠퍼(시각적 특징)를 나타내며, 프레임당 하나의 공통 음성 노드를 포함하는 그래프를 구성하며, 간선은 음성-시각 유사도를 표현한다.
  • 활성 화자는 그래프 컬러리 필터링 레이어를 통해 전파되고 집계된 다중 모달 정보를 기반으로 계산된 음성 노드와 가장 높은 유사도를 가지는 시각적 노드로 식별된다.
  • 시간적 일관성을 확보하기 위해 그래프를 더 긴 윈도우로 확장하여 시간에 따라 정보가 흐르고 예측이 안정화되도록 한다.
  • 동적 스트림은 특징 공간에서 유연한 그래프 구조를 학습함으로써 고정된 토폴로지 외부의 화자 간 상호작용, 교차 모달 연결 및 장거리 음성-음성 연결을 가능하게 한다.
  • 모델은 AVA-ActiveSpeaker에서 사전 훈련된 후 피팅 트레이닝 없이 Talkies에서 평가되며, 훈련 중에 프레임 외부 음성 소리를 시뮬레이션하기 위한 증강 전략을 적용한다.

실험 결과

연구 질문

  • RQ1그래프 기반 다중 모달 할당 프레임워크는 다수의 화자에 걸쳐 음성-시각 대응을 직접 모델링함으로써 활동 중인 화자 검출 성능을 향상시킬 수 있는가?
  • RQ2그래프 전파를 통한 시간적 일관성 강제가 화자 교체가 빈번한 장기적이고 역동적인 대화에서 성능에 어떤 영향을 미치는가?
  • RQ3표준 벤치마크에서 사전 훈련된 모델이 피팅 트레이닝 없이도 더 어려운 다양성 있는 실세계 시나리오로의 일반화 능력은 어느 정도인가?
  • RQ4동적이고 특징 기반의 그래프 연결은 프레임 외부 음성 또는 말소리처럼 보이는 얼굴 표정과 같은 모호한 경우를 해결하는 데 어떤 역할을 하는가?
  • RQ5훈련 중에 프레임 외부 음성을 시뮬레이션하는 것이 새로운 복잡한 음성-시각 시나리오에 대한 강건성을 향상시키는가?

주요 결과

  • MAAS는 AVA-ActiveSpeaker 데이터셋에서 기존 방법보다 최소 1.7% 이상 높은 88.8%의 새로운 최고 성능 mAP를 달성했다.
  • 새로운 Talkies 벤치마크에서 MAAS는 AVA 베이스라인보다 7.6% 높고, SOTA 앙상블 모델보다 1.7% 높은 성능을 기록했으며, 피팅 트레이닝 없이도 가능했다.
  • 프레임 외부 음성 소리가 포함된 어려운 서술 클립에서 mAP는 64%에서 97.9%로 향상되어 잘못된 경고에 대한 강건성을 입증했다.
  • 동적 그래프 스트림은 장거리 음성-음성 연결 및 시간을 초월한 교차 모달 아크와 같은 유용한 연결 패턴을 제공하여 시간적 일관성을 향상시켰다.
  • 훈련 중에 침묵된 음성 트랙을 무작위로 말소리로 교체하는 단순한 증강 전략이 Talkies에서 성능을 0.6% 향상시켜, 새로운 시나리오로의 일반화 능력 향상을 시사했다.
  • 이 방법은 도메인 간 일반화 능력이 뛰어나다: AVA-ActiveSpeaker에서 사전 훈련하고 Talkies에서 테스트할 경우 강력한 제로샷 성능을 기록하여, 이 방법의 강건성과 전이 가능성 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.