Skip to main content
QUICK REVIEW

[논문 리뷰] The Zero Resource Speech Challenge 2020: Discovering discrete subword and word units

Ewan Dunbar, Julien Karadayi|arXiv (Cornell University)|2020. 10. 12.
Speech Recognition and Synthesis참고 문헌 28인용 수 19
한 줄 요약

이 논문은 원시 음성에서 어떠한 텍스트적 지시 없이도 이산적인 서음 및 어휘 단위를 탐지함으로써 비지도 학습 기반 음성 표현 학습을 발전시킨 2020년 제로 리소스 음성 챌린지의 결과를 제시한다. 음성 합성 품질 향상과 말어휘 탐지 성능 향상이 뚜렷하게 이루어졌으며, 최상위 시스템들은 낮은 비트레이트에서도 인간 수준의 음성 학습에 가까운 수준의 음소 수준 단위 품질을 달성하였다. 이는 레이블 없이도 인간과 유사한 언어 습득 방식을 모방할 수 있음을 보여준다.

ABSTRACT

We present the Zero Resource Speech Challenge 2020, which aims at learning speech representations from raw audio signals without any labels. It combines the data sets and metrics from two previous benchmarks (2017 and 2019) and features two tasks which tap into two levels of speech representation. The first task is to discover low bit-rate subword representations that optimize the quality of speech synthesis; the second one is to discover word-like units from unsegmented raw speech. We present the results of the twenty submitted models and discuss the implications of the main findings for unsupervised speech learning.

연구 동기 및 목표

  • 원시 음성에서 어떠한 텍스트 자원 없이도 이산적인 서음 및 어휘 단위를 탐지할 수 있는 비지도 음성 표현 학습 방법을 개발하기 위해.
  • 골드 음소 및 어휘 전사 자료를 사용하여 음성 합성 성능, 단위 비트레이트, 언어학적 정확도 측면에서 탐지된 단위의 품질을 평가하기 위해.
  • 음성 단위 탐지 및 말어휘 탐지에 중점을 두었던 이전 벤치마크를 통합하고 재개방함으로써 제로 리소스 음성 기술 분야의 최첨단 기술을 발전시키기 위해.
  • 원시 음성에서만 학습하여 고품질, 저비트레이트의 이산 단위(음소나 어휘와 유사)를 얻을 수 있는지, 인간의 언어 습득 방식을 모방할 수 있는지 탐구하기 위해.
  • 비지도 환경에서 단위 품질, 비트레이트, 커버리지, 분할 정확도 간의 상호 상충 관계를 평가하기 위해.

제안 방법

  • 참가자들은 영어 및 인도네시아어의 레이블이 없는 원시 음성 데이터를 사용하여 세 가지 데이터셋(음성 클로닝용 트레이닝 음성, 발화자 독립적 단위 탐지용 트레이닝 단위 탐지, 평가용 테스트)에서 모델을 학습시켰다.
  • 음성 합성에서는 모델이 원시 음성을 이산 단위(가짜 텍스트)로 인코딩한 후 보코더를 사용해 웨이브폼으로 디코딩하였으며, 합성 품질은 CER, MOS, 음성 유사도 평가를 통한 인간 평가로 평가되었다.
  • 단위 품질은 ABX 오차율로 측정되었으며, 비트레이트는 테스트 세트 내의 고유한 단위 벡터의 엔트로피로부터 계산되었다.
  • 말어휘 탐지에서는 클러스터링과 동적 시간 왜곡(DTW)을 사용해 연속된 음성에서 어휘 유사 단위를 탐지하였으며, 경계 탐지 성능은 NED(정규화된 편집 거리)와 F-스코어로 평가되었다.
  • 챌린지는 표준화된 평가 지표와 기준 모델을 사용하였으며, LSH 기반의 쌍 매칭 기준 모델과 유니그램 문법 및 텍스트 전사 자료를 사용한 지도 학습 최상위 모델을 제공하였다.
  • 모든 평가에서는 골드 음소 및 어휘 전사 자료를 사용하였으며, 캐치 트라이얼과 인간 평가를 통해 엄격한 품질 제어를 실시하였다.

실험 결과

연구 질문

  • RQ1원시 음성에서만 학습하여도 고품질, 저비트레이트의 음성 합성을 가능하게 하는 이산 서음 단위를 탐지할 수 있는가?
  • RQ2비지도 모델은 비분할 음성에서 얼마나 잘 어휘 유사 단위를 탐지할 수 있으며, 지도 학습 기준 모델과 비교해 커버리지와 정확도 측면에서 어떤가?
  • RQ3비지도 음성 표현 학습에서 단위 품질, 비트레이트, 자연스러움 간의 상호 상충 관계는 어떠한가?
  • RQ4클러스터링 기반 접근 방식은 이전 방법 대비 일치 정확도와 커버리지 간의 균형을 더 잘 달성할 수 있는가?
  • RQ5이산 오토에인코더 기반의 엔드 투 엔드 모델은 전통적인 파이프라인 접근 방식에 비해 단위 탐지 및 음성 합성에서 더 우수한 성능을 보이는가?

주요 결과

  • 최상위 시스템들은 이전 년도 최고 성능 모델 대비 ABX 오차율을 20% 감소시켜 유사한 비트레이트에서 단위 품질 향상을 입증하였다.
  • 최고의 시스템들은 평균 의견 점수(MOS) 4.0 이상, 문자 오차율(CER) 15% 이하의 음성 합성을 생성하여 높은 이해 가능성과 자연스러움을 입증하였다.
  • 자기 표현 오토에인코더를 사용한 시스템들은 말어휘 탐지에서 이전 최첨단 성능과 유사한 경계 F-스코어를 달성하여 강력한 분할 성능을 보였다.
  • 확률적 동적 시간 왜곡을 사용한 R1 및 R2 시스템은 커버리지와 일치 정확도 간의 균형을 향상시켰으며, R1은 높은 커버리지, R2는 낮은 NED(정규화된 편집 거리)를 달성하였다.
  • 다행히도 진전이 있었음에도 불구하고, 최고의 비지도 이산 코드는 여전히 음소 수준 표현보다 약 10배 더 세밀하여 음소 수준의 추상화에 도달하지 못한 격차가 존재함을 시사하였다.
  • 지도 학습 최상위 모델은 저비트레이트이면서도 고품질의 이산 코드를 텍스트 지시로 달성할 수 있음을 보여주었으며, 이는 비지도 환경에서 동일한 성능을 재현하는 것이 얼마나 어려운지 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.