Skip to main content
QUICK REVIEW

[논문 리뷰] Intel Labs at Ego4D Challenge 2022: A Better Baseline for Audio-Visual Diarization

Kyle Min|arXiv (Cornell University)|2022. 10. 14.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 음성-시각 다이어라이제이션을 위한 개선된 베이스라인을 제시한다. 이는 스펙트로그램에 대해 ResNet-18을 위한 정교한 훈련 체계를 적용하여 카메라 착용자(CW)의 음성 활동 탐지 성능을 향상시키고, 사전 학습된 VAD 모델(Silero)을 후처리기로 사용하여 CW 음성에서의 잘못된 양성 결과를 줄이며, 최신 기술인 ASD 모델(SPELL)을 활용하여 더 나은 활동 중인 화자 탐지 성능을 달성한다. 이 방법은 Ego4D 테스트 세트에서 65.9%의 다이어라이제이션 오류율(DER)을 기록하여 기존 베이스라인을 크게 능가하고 2022년 도전 대회에서 1등을 차지한다.

ABSTRACT

This report describes our approach for the Audio-Visual Diarization (AVD) task of the Ego4D Challenge 2022. Specifically, we present multiple technical improvements over the official baselines. First, we improve the detection performance of the camera wearer's voice activity by modifying the training scheme of its model. Second, we discover that an off-the-shelf voice activity detection model can effectively remove false positives when it is applied solely to the camera wearer's voice activities. Lastly, we show that better active speaker detection leads to a better AVD outcome. Our final method obtains 65.9% DER on the test set of Ego4D, which significantly outperforms all the baselines. Our submission achieved 1st place in the Ego4D Challenge 2022.

연구 동기 및 목표

  • 카메라 착용자가 일반적으로 시각적으로 확인되지 않는 이고세트릭 비디오에서 다이어라이제이션 문제를 해결하기 위해 음성 중심 탐지 기반의 강력한 성능이 요구된다.
  • 음성 기반 VAD 모델의 훈련 체계를 수정하여 카메라 착용자 음성 활동 탐지 성능을 향상시키고, mAP를 72.0%에서 80.4%로 개선한다.
  • 사전 학습된 VAD 모델이 후처리기로 사용될 경우, 카메라 착용자 음성에서 잘못된 양성 결과를 걸러내는 데 효과적인지 조사한다.
  • 향상된 활동 중인 화자 탐지(ASD) 성능이 직접적으로 더 나은 종합 AVD 성능으로 이어지는지 확인한다. 이는 공식 Ego4D 베이스라인에서는 입증되지 않은 관계이다.
  • Ego4D 2022 AVD 도전 대회에서 최고 성능을 달성하여, 테스트 세트에서 65.9% DER을 기록하는 1등 제출을 이끌어낸다.

제안 방법

  • 5ms 음성 프레임의 로그 스케일 스펙트로그램(0–4000 Hz)에 대해 2D ResNet-18을 훈련하여 카메라 착용자 음성 활동 탐지를 수행한다. 0.32초의 시간 윈도우를 사용하며, mAP를 72.0%에서 80.4%로 향상시키기 위해 수정된 훈련 체계를 적용한다.
  • 사전 학습된 VAD 모델(Silero, 버전 3.1)을 카메라 착용자 예측 음성 세그먼트에만 전용으로 후처리기로 적용하여 잘못된 양성 결과를 효과적으로 감소시키고, 최종 다이어라이제이션 성능을 4% 이상 향상시킨다.
  • 활동 중인 화자 탐지(ASD) 구성 요소는 최신 기술인 SPELL 모델을 사용하며, 이는 이전 베이스라인 대비 ASD mAP와 후속 AVD 성능 모두를 크게 향상시킨다.
  • 프레임워크는 얼굴 검출, 음성-시각적 말하기 세그먼트 분할, 음성 임베딩 분석을 통합하며, 카메라 착용자 VAD 및 후처리된 출력을 활용해 화자 전환 경계를 정밀하게 보정한다.
  • Silero VAD의 후처리는 카메라 착용자 출력에만 적용되며, 저신호 대 잡음비로 인해 다른 화자 탐지 결과에 대해 효과적이거나 해로울 수 있다.
  • 전체 훈련 파이프라인은 단일 TITAN V GPU에서 1시간 이내에 실행되며, 고정된 5×10⁻⁴ 학습률과 0.5 드롭아웃을 사용한 Adam 옵timizer를 적용한다.

실험 결과

연구 질문

  • RQ1스펙트로그램에 대해 ResNet-18에 대해 수정된 훈련 체계를 적용하면, 이고세트릭 비디오에서 카메라 착용자 음성 활동 탐지 성능이 크게 향상되는가?
  • RQ2사전 학습된 VAD 모델을 카메라 착용자 음성 출력에 후처리기로 적용하면 잘못된 양성 결과가 감소하고 종합 AVD 성능이 향상되는가?
  • RQ3향상된 활동 중인 화자 탐지(ASD) 성능과 Ego4D 데이터셋에서의 더 나은 음성-시각 다이어라이제이션 결과 사이에 직접적인 측정 가능한 상관관계가 존재하는가?
  • RQ4왜 사전 학습된 VAD 모델의 후처리는 카메라 착용자 출력에만 효과가 있고 다른 화자 탐지 결과에는 효과가 없는가?
  • RQ5SPELL과 같은 더 나은 ASD 모델을 사용하면 이전 베이스라인 대비 Ego4D 벤치마크에서 AVD 성능 향상이 상당히 이루어지는가?

주요 결과

  • 카메라 착용자 VAD 모델의 수정된 훈련 체계는 검증 세트에서 mAP를 72.0%에서 80.4%로 상승시켜 탐지 신뢰도를 크게 향상시켰다.
  • Silero VAD 모델을 카메라 착용자 음성 출력에 후처리기로 적용하여 다이어라이제이션 오류율(DER)을 4% 이상 감소시켰고, 검증 세트에서 66.6% DER을 기록했다.
  • SPELL 모델을 사용한 활동 중인 화자 탐지에서는 mAP@0.5가 60.7%였으며, 검증 세트에서 DER은 66.6%였으며, 이는 이전 베이스라인 대비 뚜렷한 성능 향상을 보였다.
  • 최종 방법은 Ego4D 테스트 세트에서 65.9% DER을 기록하여 기존 TalkNet 기반 베이스라인 대비 7.4%포인트 향상되었으며, 도전 대회에서 1등을 차지했다.
  • 연구는 더 나은 ASD 성능이 직접적으로 더 나은 AVD 결과로 이어지는 관계를 경험적으로 확인하였으며, 이는 공식 Ego4D 베이스라인에서 입증되지 않았다.
  • 사전 학습된 VAD 모델의 후처리는 카메라 착용자 출력에만 성능 향상을 가져왔으며, 이는 시각적 단서 없이 먼 거리나 낮은 에너지의 화자에 대해서는 효과가 떨어지기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.