[논문 리뷰] A Cycle-GAN Approach to Model Natural Perturbations in Speech for ASR Applications
이 논문은 병행 학습 데이터가 필요 없이 자연스러운 방해 요소가 포함된 음성(예: 웃는 음성, 케이크리한 음성)을 정상 음성으로 변환하는 Cycle-GAN 기반 프론트엔드를 제안한다. 이는 ASR의 강인성을 향상시키며, 비병행 음성 데이터를 이용한 사이클 일致성 생성 학습을 통해 다양한 ASR 시스템에서 단어 오류율(WER)을 상당히 감소시킨다(최대 21.0%).
Naturally introduced perturbations in audio signal, caused by emotional and physical states of the speaker, can significantly degrade the performance of Automatic Speech Recognition (ASR) systems. In this paper, we propose a front-end based on Cycle-Consistent Generative Adversarial Network (CycleGAN) which transforms naturally perturbed speech into normal speech, and hence improves the robustness of an ASR system. The CycleGAN model is trained on non-parallel examples of perturbed and normal speech. Experiments on spontaneous laughter-speech and creaky-speech datasets show that the performance of four different ASR systems improve by using speech obtained from CycleGAN based front-end, as compared to directly using the original perturbed speech. Visualization of the features of the laughter perturbed speech and those generated by the proposed front-end further demonstrates the effectiveness of our approach.
연구 동기 및 목표
- 최신 ASR 시스템에 자연스러운 음성 방해 요소(예: 웃음, 케이크리 음성)가 미치는 영향을 조사하는 것.
- 병행 학습 데이터가 필요 없는 자료 효율적인 프론트엔드를 개발하여 방해 요소가 포함된 음성을 정상 음성으로 변환하는 것.
- 사이클 일치 생성 모델링을 이용해 정서적 및 음성 품질 기반 방해 요소에 대한 ASR 강인성을 향상시키는 것.
- 제안된 프론트엔드의 효과성을 다양한 ASR 시스템과 음성 유형에 걸쳐 검증하는 것.
제안 방법
- 두 개의 생성자(G_XY 및 G_YX)와 두 개의 판별자(D_X 및 D_Y)로 구성된 Cycle-GAN 아키텍처를 사용하여, 방해 요소가 포함된 음성과 정상 음성 간의 도메인 변환을 학습한다.
- 스펙트럼 및 비주기적 특징(MFBs 및 APs)을 더 잘 학습하기 위해 게이트드 컨벌루션과 인스턴스 정규화를 사용하는 잔차 블록을 생성자에 적용한다.
- 모델의 훈련 목표는 생성적 적대적 손실, 사이클 일관성 손실, 식별 손실을 조합하여 실제적이고 일관된 음성 변환을 보장한다.
- 프론트엔드는 원시 음성 신호를 처리하여 멜 필터뱅크 특징(MFBs)과 비주기적 성분(APs)을 추출하고, 이를 정상 음성 분포와 유사하게 변환한다.
- 모델은 병행 예제가 없는 웃는 음성 및 케이크리한 음성 데이터셋에서 비병행 데이터를 이용해 훈련되며, 쌍이 없는 예시 없이 제로샷 도메인 전이가 가능하다.
실험 결과
연구 질문
- RQ1Cycle-GAN 기반 프론트엔드는 자연스러운 음성 방해 요소(예: 웃음, 케이크리성)가 ASR 성능에 악영향을 미치는 데 효과적으로 대응할 수 있는가?
- RQ2Mel 필터뱅크 특징(MFBs) 외에 비주기적 성분(APs)을 함께 포함할 경우, 변환된 음성의 품질과 후속 ASR 정확도에 어떤 영향을 미치는가?
- RQ3제안된 프론트엔드는 다양한 ASR 시스템과 음성 유형에 얼마나 일반화되는가?
- RQ4변환된 음성의 학습된 특징들이 정상 음성의 분포와 구조 측면에서 어떻게 비교되는가?
주요 결과
- ASpIRE ASR 시스템에서 웃는 음성을 정상 음성으로 변환할 때 제안된 프론트엔드가 단어 오류율(WER)을 21.0% 감소시켰다.
- 케이크리한 음성에 대해 Google ASR 시스템에서는 WER이 11.0% 감소했고, IBM ASR 시스템에서는 MFBs+APs 프론트엔드를 사용해 7.9% 감소시켰다.
- Google ASR 시스템에서 웃는 음성에 대해 문장 오류율(SER)이 최대 22.2% 감소하여 문장 수준의 인식 성능 향상이 확인되었다.
- 딥스피치 모델은 언어 모델 없이도 프론트엔드를 사용할 경우 문자 오류율(CER)을 15.6% 감소시켜 자원이 제한된 환경에서도 효과가 있음을 확인했다.
- t-SNE 시각화 결과, 변환된 음성의 특징 분포가 정상 음성과 유사하게 집중되어 있음을 확인했고, 웃는 음성의 특징은 더 산산이 흩어져 있고 구분이 뚜렷했다.
- 멜 필터뱅크 출력의 바이올린 플롯을 통해 변환된 음성 특징이 정상 음성 분포를 정확히 모방하고 있음을 확인했으며, 이는 프론트엔드가 음향 특징을 유지하는 능력을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.