Skip to main content
QUICK REVIEW

[논문 리뷰] Convolutional Speech Recognition with Pitch and Voice Quality Features

Guillermo Cámbara, Jordi Luque|arXiv (Cornell University)|2020. 09. 02.
Speech Recognition and Synthesis참고 문헌 28인용 수 4
한 줄 요약

이 논문은 종단간 자동 음성 인식을 위한 컨volution 신경망(Conv GLU)에 피치, 잼프, 샤이머 특징을 메르-주파수 스펙트럼 계수(MFSCs)와 통합하는 방법을 제안한다. MFSC 입력에 이들 프로소디크 및 음성 품질 특징을 첨가함으로써, 스페인어 컨몬바이스 및 리브리스피치에서 각각 최대 7% 상대적 WER 감소를 달성하였으며, 다양한 또는 청소되지 않은 조건에서의 강건성 향상이 뚜렷하게 나타났다.

ABSTRACT

The effects of adding pitch and voice quality features such as jitter and shimmer to a state-of-the-art CNN model for Automatic Speech Recognition are studied in this work. Pitch features have been previously used for improving classical HMM and DNN baselines, while jitter and shimmer parameters have proven to be useful for tasks like speaker or emotion recognition. Up to our knowledge, this is the first work combining such pitch and voice quality features with modern convolutional architectures, showing improvements up to 7% and 3% relative WER points, for the publicly available Spanish Common Voice and LibriSpeech 100h datasets, respectively. Particularly, our work combines these features with mel-frequency spectral coefficients (MFSCs) to train a convolutional architecture with Gated Linear Units (Conv GLUs). Such models have shown to yield small word error rates, while being very suitable for parallel processing for online streaming recognition use cases. We have added pitch and voice quality functionality to Facebook's wav2letter speech recognition framework, and we provide with such code and recipes to the community, to carry on with further experiments. Besides, to the best of our knowledge, our Spanish Common Voice recipe is the first public Spanish recipe for wav2letter.

연구 동기 및 목표

  • 현대의 컨볼루션 기반 ASR 모델에서 피치 및 음성 품질 특징(jitter, shimmer)이 성능 향상에 기여하는지 조사하는 것.
  • 수작업된 프로소디크 특징과 종단간 딥 러닝 아키텍처 사이의 격차를 메우는 것.
  • wav2letter 프레임워크에 피치 및 음성 품질 특징을 위한 오픈소스 레시피 및 코드 통합을 제공하는 것.
  • wav2letter용 첫 번째 공개된 스페인어 컨몬바이스 레시피를 구축하는 것.
  • 이러한 특징이 다양한 음성 조건(예: 다양한 억양, 음성 이상)에서 강건성에 미치는 영향을 평가하는 것.

제안 방법

  • 모델는 깊이 있는 병렬 학습이 가능하고 낮은 WER를 달성할 수 있도록 게이트드 선형 유닛을 사용하는 Conv GLU 아키텍처를 사용한다.
  • 피치, 잼프, 샤이머 특징은 원시 오디오에서 추출되어 아키텍처 수정 없이 입력 레이어에서 MFSCs와 연결된다.
  • 프레임워크는 피치 및 음성 품질 특징 추출 파이프라인을 통합한 페이스북의 wav2letter를 확장한다.
  • 실험은 두 개의 공개 데이터셋인 스페인어 컨몬바이스 및 리브리스피치 100시간을 대상으로 수행되며, 표준 학습 및 디코딩 프로토콜을 사용한다.
  • 후처리나 전용 필터를 피하고 입력 레이어에서의 특징 연결에 집중함으로써 단순성을 유지한다.
  • 성능 평가는 개발-클린, 개발-다른, 테스트-클린, 테스트-다른 분할에서 단어 오류율(WER)을 통해 평가된다.

실험 결과

연구 질문

  • RQ1피치 및 음성 품질 특징(jitter, shimmer)은 현대의 컨볼루션 기반 ASR 모델인 Conv GLU에서 성능 향상에 기여하는가?
  • RQ2이러한 특징은 비청소 또는 억양이 다양한 조건에서 ASR의 강건성에 어떻게 영향을 미치는가?
  • RQ3MFSCs와 결합했을 때 피치, 잼프, 샤이머의 상대적 기여도는 어떠한가?
  • RQ4입력 레이어에서 프로소디크 특징을 단순히 연결함으로써 아키텍처 변경 없이도 상당한 WER 향상이 달성될 수 있는가?
  • RQ5스페인어와 같이 자원이 적은 언어에서 학습된 모델에 비해 영어와 같이 자원이 풍부한 언어에서 이러한 특징이 어떻게 영향을 미치는가?

주요 결과

  • 피치, 잼프, 샤이머 특징의 추가로 스페인어 컨몬바이스 데이터셋에서 최대 7% 상대적 WER 감소가 발생하였으며, 특히 dev-other 및 test-other 세트에서 유의미한 향상이 나타났다.
  • 리브리스피치 100시간 데이터셋에서, MFSC+pitch+jitter+shimmer 조합은 dev-clean 세트에서 2.94% 상대적 WER 향상, test-other 세트에서 2.87% 향상 달성.
  • 피치, 잼프, 샤이머의 세 가지 프로소디크 특징을 모두 조합한 경우가 모든 테스트 세트에서 가장 일관되고 강건한 성능을 보였다.
  • MFSC+pitch+jitter+shimmer는 MFSC 전용 및 MFSC+pitch 기준 모델보다 뛰어난 성능을 보였으며, 음성 품질 특징의 추가적 가치를 입증했다.
  • 비청소 및 다양한 프로소디 조건(예: dev-other)에서의 성능 향상이 더 두드러져, 억양 및 변동성에 대한 강건성이 향상된 것으로 나타났다.
  • 이 연구는 피치 및 음성 품질 특징이 최소한의 아키텍처 적응으로도 현대의 컨볼루션 기반 ASR에서 효과적이라는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.