Skip to main content
QUICK REVIEW

[논문 리뷰] MUSAN: A Music, Speech, and Noise Corpus

David Snyder, Guoguo Chen|arXiv (Cornell University)|2015. 10. 28.
Speech Recognition and Synthesis참고 문헌 5인용 수 922
한 줄 요약

이 논문은 공공도메인 및 크리에이티브 커먼즈 자료에서 유래한 음악, 언어, 잡음 총 109시간 분량의 자유롭게 재배포 가능한 오디오 코퍼스인 MUSAN을 소개한다. 이 코퍼스는 음성 활성 검출(VAD) 및 음악/언어 식별 시스템의 훈련을 위해 설계되었다. 코퍼스를 바탕으로 GMM 기반 모델을 사용한 결과, 특히 저자원 조건에서 VAD 성능이 경쟁적으로 높아졌으며, 에너지 기반 VAD와 결합한 GMM+에너지 하이브리드 모델이 음성 인식 EER을 최대 23.16% 향상시켰다.

ABSTRACT

This report introduces a new corpus of music, speech, and noise. This dataset is suitable for training models for voice activity detection (VAD) and music/speech discrimination. Our corpus is released under a flexible Creative Commons license. The dataset consists of music from several genres, speech from twelve languages, and a wide assortment of technical and non-technical noises. We demonstrate use of this corpus for music/speech discrimination on Broadcast news and VAD for speaker identification.

연구 동기 및 목표

  • 음성 활성 검출(VAD) 및 음악/언어 식별 시스템 훈련을 위한 공개 가능하고 법적으로 재배포 가능한 오디오 코퍼스를 구축하기 위해.
  • 특히 상용 사용에 적합한 라이선스가 명시된 음원이 없는 원시 오디오 데이터셋의 부족 문제를 해결하기 위해.
  • 다양한 언어와 장르를 포함한 음성, 음악, 환경 잡음 데이터를 포함하여 음성 처리 응용 분야의 내구성을 향상시키기 위해.
  • Broadcase News 및 NIST SRE 2010과 같은 표준 벤치마크에서 GMM 기반 모델을 사용한 기준 실험을 통해 코퍼스의 유용성을 입증하기 위해.
  • 제한된 음성 자료가 존재하는 조건에서 VAD 품질이 후속 음성 인식 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 코퍼스는 미국 공공도메인 및 크리에이티브 커먼즈 라이선스를 가진 자료에서 수집되었으며, Librivox(읽힌 언어), Jamendo, Free Music Archive, Incompetech, HD Classical Music(음악), Free Sound 및 Sound Bible(잡음)를 포함한다.
  • 오디오 파일은 16kHz 단일 채널 WAV 형식으로 저장되며, 각 오디오 세그먼트의 메타데이터 및 라이선스 정보는 LICENSE 및 ANNOTATIONS 파일에 별도로 기록된다.
  • 음악/언어 식별을 위해, 20개의 MFCC에 델타 및 가속도 특징을 추가한 GMM을 사용하였으며, 구성 요소 수는 4~128개로 설정하고, Broadcast News 데이터에서 등오차율(EER) 기준으로 평가하였다.
  • VAD를 위해 하이브리드 시스템은 음성, 음악, 잡음 서브셋에서 훈련된 GMM 기반 VAD와 에너지 기반 VAD를 조합하였으며, 외부 도메인 데이터를 기반으로 사전 확률를 조정하였다.
  • 음성 인식 실험은 i-vector 시스템을 사용하였으며, GMM 기반 유니버설 배경 모델(UBM)과 PLDA 후처리 모듈을 활용하였고, VAD 결정 결과를 바탕으로 무음 프레임을 필터링하였다.
  • 성능 평가는 NIST SRE 2010 코어 세트에서 수행되었으며, 테스트 음성은 1~60초로 잘라내어 실시간 처리 제약 조건을 시뮬레이션하였다.

실험 결과

연구 질문

  • RQ1공공도메인 및 크리에이티브 커먼즈 자료에서 유래한 대규모, 법적으로 재배포 가능한 음악, 언어, 잡음 오디오 코퍼스를 구축할 수 있는가?
  • RQ2MUSAN에서 훈련한 모델의 음악/언어 식별 성능는 일반적으로 사용되지만 재배포가 불가능한 GTZAN 데이터셋에서 훈련한 모델과 비교해 어떻게 되는가?
  • RQ3제한된 음성 자료가 존재하는 조건에서 MUSAN에서 훈련한 GMM 기반 VAD는 음성 인식 성능에 얼마나 기여하는가?
  • RQ4다양한 유형의 잡음과 비영어 언어의 음성 포함 여부가 VAD 및 식별 시스템의 내구성에 어떤 영향을 미치는가?
  • RQ5저자원 음성 인식 환경에서 GMM+에너지 하이브리드 VAD는 기존의 에너지만 사용하는 VAD보다 성능이 얼마나 뛰어나게 되는가?

주요 결과

  • MUSAN 코퍼스는 총 109시간의 오디오를 포함하고 있으며, 이 중 60시간은 Librivox 및 미국 정부 기록 자료에서 확보한 언어, 42.5시간은 다양한 장르와 출처에서 확보한 음악, 6시간은 다양한 유형의 잡음 샘플로 구성되어 있다.
  • MUSAN에서 훈련한 GMM 기반 음악/언어 식별 모델은 16개의 구성 요소를 사용할 경우 EER이 3.75%로, GTZAN 데이터셋에서 훈련한 모델의 3.85%와 유사한 성능을 보였다.
  • GMM 기반 VAD를 추가한 결과, 음성 자료가 1초 뿐일 경우 기존의 에너지만 사용하는 VAD 대비 음성 인식 EER이 최대 23.16% 향상되었다.
  • GMM+에너지 VAD는 모든 테스트 지속시간에서 에너지만 사용하는 VAD를 능가했으며, 특히 음성 자료가 1초일 경우 상대적 개선 폭이 가장 크게 23.16% 기록되었다.
  • 코퍼스는 영리한 크리에이티브 커먼즈 라이선스에 따라 완전히 재배포 가능하며, 모든 오디오 파일은 정확한 출처 기재 및 라이선스 정보를 포함하여 상용 사용이 가능하다.
  • 결과적으로 MUSAN은 기존 데이터셋에 비해 법적으로 안정적이며, 내구성 있는 VAD 및 음악/언어 식별 시스템 훈련을 위한 실용적인 대안임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.