[논문 리뷰] Who said that?: Audio-visual speaker diarisation of real-world meetings
이 논문은 깊이 있는 음성-시각 동기화를 활용해 비디오와 음성에서 자가 등록된 발화자 모델을 추출하는 음성-시각 발화자 다이어라이제이션 시스템을 제안한다. 이는 비지도 클러스터링을 지도 학습 분류로 전환함으로써 성능을 향상시킨다. 시각적 단서를 활용해 발화 세그먼트를 탐지하고 발화자 임베딩을 등록함으로써, AMI 미팅 코퍼스에서 최신 기술 수준의 성능을 달성하며, 음성 전용 기준 대비 48% (ES) 및 26% (IS)의 상대적 오차 감소를 이룬다. 비음향 기반의 보정 및 다중 모odal 융합을 통해 추가적인 성능 향상이 이루어진다.
The goal of this work is to determine 'who spoke when' in real-world meetings. The method takes surround-view video and single or multi-channel audio as inputs, and generates robust diarisation outputs. To achieve this, we propose a novel iterative approach that first enrolls speaker models using audio-visual correspondence, then uses the enrolled models together with the visual information to determine the active speaker. We show strong quantitative and qualitative performance on a dataset of real-world meetings. The method is also evaluated on the public AMI meeting corpus, on which we demonstrate results that exceed all comparable methods. We also show that beamforming can be used together with the video to further improve the performance when multi-channel audio is available.
연구 동기 및 목표
- 실세계 미팅 환경에서 '누가 언제 말했는지'를 높은 정확도로 파악하는 데 도전한다.
- 기존 음성 전용 다이어라이제이션의 한계를 극복한다. 이는 문제를 비지도 클러스터링으로 간주하며, 겹침 음성과 알려지지 않은 발화자에 대해 어려움을 겪는다.
- 시각 정보를 통합해 발화자 모델을 등록함으로써 발화자 이동 및 가림 현상에 대한 강건성을 향상시킨다.
- 특히 실세계의 제약 없는 미팅 환경에서 음성과 영상의 다중 모달 융합을 통해 성능 향상을 입증한다.
- 다중 채널 음성 자료가 가용할 경우 비음향 기반의 보정 및 공간 음성 단서가 미치는 영향을 평가한다.
제안 방법
- 입술 움직임이 영상에서 명확하게 확인될 때 시각 기반 말하기 세그먼트를 탐지하기 위해 깊이 있는 음성-시각 동기화 네트워크를 사용한다. 이를 통해 자가 등록된 발화자 모델을 생성한다.
- 음성 세그먼트에서 추출한 발화자 임베딩(x-벡터)을 적용하며, 시각적으로 확인된 말하기 동안에만 모델을 등록한다.
- 자신의 등록된 발화자 모델을 사용해 각 세그먼트에 확률을 할당함으로써, 비지도 클러스터링에서 지도 학습 분류로 다이어라이제이션 문제를 재구성한다.
- 다중 채널 음성에 대해 비음향 기반의 보정을 적용하여 음원 위치를 추정하고, 이를 시각적 단서와 융합하여 활성 발화자 탐지 성능을 향상시킨다.
- 추론 시 음성, 시각, 공간 단서를 확률적 융합 프레임워크로 통합하며, 검증 데이터에 맞춰 적응형 가중치를 조정한다.
- JHU Sys4 기반의 VAD 및 다이어라이제이션 파이프라인을 적용하며, PLDA 점수 및 AHC 클러스터링을 사용하지만, 클러스터링 대신 모델 기반 분류로 대체한다.

실험 결과
연구 질문
- RQ1사전 발화자 정보 없이도 음성-시각 일치를 활용해 신뢰할 수 있게 발화자 모델을 자가 등록할 수 있는가?
- RQ2자신의 등록된 모델을 사용해 다이어라이제이션을 클러스터링에서 분류로 전환하면 실세계 미팅 환경에서 성능 향상이 이루어지는가?
- RQ3시각적 말하기 탐지와 비음향 기반의 보정이 가림 및 배경 잡음에 대한 강건성에 어떻게 기여하는가?
- RQ4음성, 영상, 공간 단서의 다중 모달 융합이 단일 모달 또는 조기 융합 기반 기준 대비 발화자 오차를 얼마나 줄이는가?
- RQ5제안된 방법이 발화자 수와 이동이 다양하게 변하는 제약 없는 실세계 미팅 환경에 일반화 가능한가?
주요 결과
- 제안된 음성-시각 발화자 다이어라이제이션 시스템은 AMI 코퍼스의 ES 서브셋에서 음성 전용 기준 대비 48%의 상대적 오차 감소율(SPKER ERROR RATE, SPKE)을 달성한다.
- IS 서브셋에서는 SPKE에서 26%의 상대적 오차 감소율을 기록하며, 다양한 미팅 조건에 대한 강력한 일반화 능력을 입증한다.
- 음성-시각 일치(AVC) 및 음원 위치 추정(SSL)의 추가로 각각 20–40% 및 19–39%의 상대적 성능 향상이 이루어지며, 테스트 세트에 따라 다소 차이가 있다.
- AMI 코퍼스의 모든 테스트 조건에서 이전의 최신 기술 수준의 음성-시각 방법, [cabanas2018multimodal]을 포함해 모두 초월한다.
- 내부 실세계 미팅 데이터셋에서도 잘 일반화되며, 음성 전용 기준이 실패하는 상황에서도 성능을 유지함으로써 제약 없는 환경에서의 강건성을 입증한다.
- 다중 채널 음성 자료를 활용한 비음향 기반의 보정은 공간 단서를 강화함으로써 성능 향상에 기여하며, 특히 시각 정보와 조합할 경우 더욱 두드러진다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.