[논문 리뷰] A Multi-View Approach To Audio-Visual Speaker Verification
이 논문은 공유 분류기와 함께 음성 및 영상 스트림을 공유 임bedding 공간으로 매핑하는 다중 시각 음성-영상 화자 확인 시스템을 제안한다. 이는 한 모odal이 가용하지 않을 경우에도 교차 모달 확인을 가능하게 한다. 교차 모달 테스트에서 VoxCeleb1에서 28.0%의 EER을 달성하여 이 어려운 상황에서 이전 방법들을 능가하며, 표준 음성-영상 융합 설정에서는 0.7%의 EER을 달성한다.
Although speaker verification has conventionally been an audio-only task, some practical applications provide both audio and visual streams of input. In these cases, the visual stream provides complementary information and can often be leveraged in conjunction with the acoustics of speech to improve verification performance. In this study, we explore audio-visual approaches to speaker verification, starting with standard fusion techniques to learn joint audio-visual (AV) embeddings, and then propose a novel approach to handle cross-modal verification at test time. Specifically, we investigate unimodal and concatenation based AV fusion and report the lowest AV equal error rate (EER) of 0.7% on the VoxCeleb1 dataset using our best system. As these methods lack the ability to do cross-modal verification, we introduce a multi-view model which uses a shared classifier to map audio and video into the same space. This new approach achieves 28% EER on VoxCeleb1 in the challenging testing condition of cross-modal verification.
연구 동기 및 목표
- 실제 환경에서 한 모달이 손실되거나 열악한 경우에 음성과 영상 모달 간의 상호보완적 특성을 활용하여 화자 확인 성능을 향상시키기 위해.
- 테스트 중에 모달 가용성에 따라 음성과 영상 입력이 일치하지 않는 교차 모달 확인의 과제를 해결하기 위해.
- 단일 프레임워크 내에서 단모달, 다중모달, 교차 모달 확인을 모두 지원하는 통합 모델을 개발하기 위해.
- VoxCeleb 데이터셋에서 표준 음성-영상 융합 및 도전적인 교차 모달 확인 설정 모두에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 공유 분류기 레이어를 사용하여 음성 및 영상 임베딩을 공통 공간으로 매핑하는 다중 시각 모델을 훈련시켜 교차 모달 매칭을 가능하게 한다.
- 단모달 인코더(음성 및 영상)를 별도로 훈련한 후 공유 분류기를 통해 모달 간 임베딩을 정렬한다.
- 일치하는 화자 쌍(음성-영상)이 공유 공간에서 가까이 매핑되도록, 대조 손실 또는 유사 목적 함수를 사용한다.
- 표준 확인 설정에서 성능 향상을 위해 단모달 시스템(음성 전용 및 영상 전용)의 점수 융합을 적용한다.
- 실제 손실된 데이터 시나리오를 시뮬레이션하기 위해, 확인 쌍의 각 측면에서 한 모달을 제거하여 교차 모달 확인을 평가한다.
- 모델은 VoxCeleb2에서 훈련하고 VoxCeleb1 테스트 세트에서 평가하며, 모달 가용성 및 융합 전략에 대한 분석 연구를 수행한다.
실험 결과
연구 질문
- RQ1한 쪽에서 음성 또는 영상만 가용할 경우에도 교차 모달 화자 확인을 가능하게 하기 위해 효과적으로 공유 임베딩 공간을 학습할 수 있는가?
- RQ2제안된 다중 시각 모델은 표준 음성-영상 확인 설정에서 단모달 및 후기 융합 기반 모델과 비교해 어떻게 성능을 내는가?
- RQ3음성 및 영상 인코더의 공유 훈련이 단모달 성능에 어떤 영향을 미치며, 성능 저하를 어떻게 완화할 수 있는가?
- RQ4교차 모달 테스트 중 양쪽 스트림에서 알려지지 않은 화자들이 존재하는 극한 조건에서 모델의 성능은 어떠한가?
- RQ5부분적으로 손실된 모달 조건에서 임베딩의 선형 평균화보다 단모달 시스템의 점수 융합이 더 효과적인가?
주요 결과
- 제안된 다중 시각 모델은 한 모달이 쌍의 각 쪽에서 손실되는 도전적인 교차 모달 확인 설정에서 VoxCeleb1에서 28.0%의 등오류률(EER)을 달성한다.
- 단모달 및 중간 수준의 AV 융합 시스템의 점수 융합을 사용하여 VoxCeleb1에서 보고된 바 중 가장 낮은 음성-영상 EER 0.7%를 달성한다.
- 다중 시각 모델의 단모달 음성 전용 성능(VC1에서 6.1% EER)은 독립형 시스템(2.0% EER)보다 약간 떨어지며, 이는 공유 임베딩 차원과 배치 정규화 제거 때문일 수 있다.
- 다중 시각 모델의 영상 전용 성능(VC1에서 3.7% EER)은 독립형 시스템(3.4% EER)과 거의 유사하여 공유 훈련으로 인한 성능 저하가 최소한임을 시사한다.
- 다중 시각 모델에서 음성 및 영상 유사도 점수의 융합은 VC1에서 EER을 1.8%로 낮추며, 개별 단모달 시스템을 능가한다.
- 교차 모달 설정에서 이전의 연구[15], [16], [17]을 능가하며, 비표준 평가 분할을 사용함에도 불구하고 VC1에서 28.0%의 EER을 달성하여 기존 방법과 유사하거나 더 우수한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.