Skip to main content
QUICK REVIEW

[논문 리뷰] AVA-Speech: A Densely Labeled Dataset of Speech Activity in Movies

Sourish Chaudhuri, Joseph Roth|arXiv (Cornell University)|2018. 08. 02.
Speech and Audio Processing참고 문헌 28인용 수 4
한 줄 요약

이 논문은 190편의 영화에서 총 약 46시간에 이르는 음성 활동에 대한 공개된, 프레임 단위로 레이블이 부여된 밀도 높은 데이터셋인 AVA-Speech를 소개한다. 이 데이터셋은 청소화이음, 음악이 함께하는 음성, 소음이 함께하는 음성을 포함한 세 가지 조건에 대해 프레임 수준의 레이블을 제공한다. 최신 음성 및 시각 모델을 평가한 결과, 음성 모델은 소음 조건에서 성능이 저하되는 반면, 시각적 음성 분류(VSC)는 안정성을 유지함을 확인하였으며, 향후 음성-시각 음성 탐지 분야의 연구를 위한 기준이 되었다.

ABSTRACT

Speech activity detection (or endpointing) is an important processing step for applications such as speech recognition, language identification and speaker diarization. Both audio- and vision-based approaches have been used for this task in various settings, often tailored toward end applications. However, much of the prior work reports results in synthetic settings, on task-specific datasets, or on datasets that are not openly available. This makes it difficult to compare approaches and understand their strengths and weaknesses. In this paper, we describe a new dataset which we will release publicly containing densely labeled speech activity in YouTube videos, with the goal of creating a shared, available dataset for this task. The labels in the dataset annotate three different speech activity conditions: clean speech, speech co-occurring with music, and speech co-occurring with noise, which enable analysis of model performance in more challenging conditions based on the presence of overlapping noise. We report benchmark performance numbers on AVA-Speech using off-the-shelf, state-of-the-art audio and vision models that serve as a baseline to facilitate future research.

연구 동기 및 목표

  • 실제 다채로운 미디어 환경에서 음성 활동 탐지(VAD)를 위한 표준화되고 공개 가능한 기준 데이터셋의 부족을 해결하기 위해.
  • 음성 및 영상 레이블이 부여된 대규모이고 시간적으로 밀도 높은 데이터셋을 구축하여, 음성 전용 및 음성-시각 병합 VAD 모델의 평가를 지원하기 위해.
  • 청결한 음성, 음악이 함께하는 음성, 소음이 함께하는 음성의 세 가지 도전적인 조건에서 음성 활동을 명시적으로 레이블링하여 모델의 강인성 분석을 가능하게 하기 위해.
  • 향후 비교를 위한 기준 성능 결과를 공개된 최신 음성 및 시각 모델을 사용하여 제공하기 위해.
  • 향후 음성-시각 병합 모델링 및 관련 작업으로의 확장에 기여할 수 있는 공동 기준을 마련하기 위해.

제안 방법

  • 185편의 영화 클립(각 15분씩)을 유튜브에서 확보하여 총 약 46시간의 영상 자료를 확보하였으며, 다양한 발화 상황을 반영하도록 선택하였다.
  • 인간 평가자가 정의된 지침에 따라 밀도 높은 프레임 수준의 음성 활동 레이블링을 수행하였으며, 각 프레임을 NoSpeech, CleanSpeech, SpeechWithMusic, 또는 SpeechWithNoise로 분류하였다.
  • 음성 기반 모델 평가에 WebRTC VAD, 소형 CNN(tiny_320), 그리고 더 큰 ResNet-50 기반 모델(resnet_960)을 사용하였으며, 10ms 멜 스펙트로그램 입력을 활용하였다.
  • 시각적 음성 분류(VSC)는 얼굴를 검출하고 추적한 후, 얼굴 썸네일의 3프레임 시퀀스에 가벼운 CNN을 적용하여 음성 활동을 예측하였다.
  • 모델 성능 평가에서는 모든 조건에서 고정된 위양성률(FPR = 0.315)을 기준으로 하였으며, 각 조건 및 종합적으로 TPR을 보고하였다.
  • ROC 곡선은 분류 임계값을 다양하게 조정하여 운영 지점 전반에서의 성능 평가를 위해 생성하였으며, 지연 시간은 단일 스레드 CPU에서 측정하였다.

실험 결과

연구 질문

  • RQ1최신 음성 및 시각적 음성 탐지 모델은 배경 소음 조건이 다양하게 변화하는 실제 세계의 다양한 영화 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ2배경 소음(예: 음악 또는 환경 소음)은 음성 전용 음성 활동 탐지 모델의 성능을 어느 정도 저하시키는가?
  • RQ3음성 모델이 실패하는 조건에서도 시각적 음성 분류 모델은 일관된 성능을 유지할 수 있는가?
  • RQ4실제 운영 환경의 제약 조건을 반영하기 위해 고정된 위양성률에서 평가했을 때, 음성 및 시각 모델의 성능는 어떻게 비교되는가?
  • RQ5이 모델들의 추론 지연 시간은 얼마이며, 실시간 시스템에 대한 실제 구현에 어떤 영향을 미치는가?

주요 결과

  • WebRTC VAD는 청결한 음성에서 진짜 양성률(TPR)이 0.786이었지만, 소음이 있는 음성에서는 0.706으로 떨어졌고, 종합적으로는 0.733로 나타나 배경 소음에 민감한 것으로 나타났다.
  • tiny_320 음성 모델은 청결한 음성에서 TPR이 0.965였고, 음악이 함께하는 음성에서는 0.826, 소음이 함께하는 음성에서는 0.623으로 나타나 소음 조건에서 심각한 성능 저하를 보였다.
  • 더 큰 resnet_960 모델은 청결한 음성에서 최고의 TPR 0.992를 기록했고, 음악이 함께하는 음성에서는 0.944였지만, 소음이 함께하는 음성에서는 0.787로 떨어져 음성 모델의 소음 조건에서의 성능 저하를 확인하였다.
  • 시각적 음성 분류(VSC) 모델은 청결한 음성에서 TPR이 0.588, 음악이 함께하는 음성에서는 0.568, 소음이 함께하는 음성에서는 0.556으로 나타나 조건 간에 비교적 안정된 성능 유지를 보였다.
  • 낮은 절대 성능에도 불구하고 VSC는 다양한 소음 유형에서 일관된 성능을 유지하여 도전적인 음향 환경에서의 강인성을 시사하였다.
  • VSC 모델의 지연 시간은 40.0 ms로, 음성 모델들(0.06–2.23 ms)보다 뚜렷이 높았으며, 주로 얼굴 검출 및 추적 오버헤드 때문이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.