[논문 리뷰] Completely Unsupervised Speech Recognition By A Generative Adversarial Network Harmonized With Iteratively Refined Hidden Markov Models
이 논문은 레이블이 없는 음성 및 텍스트 데이터에서 학습할 수 있도록, 생성적 적대적 네트워크(GAN)와 반복적으로 개선되는 은닉 마르코프 모델(HMM)을 결합한 완전히 비지도 음성 인식 프레임워크를 제안한다. GAN의 생성자는 음성 프레임을 분류하고 세그먼트 단위로 샘플링하여 음소 시퀀스를 생성하며, 구분자는 진짜 시퀀스와 생성된 시퀀스를 구분한다. HMM은 반복적으로 분할을 개선하여 TIMIT에서 33.1%의 음소 오류율(PER)을 달성하였으며, 이는 이전 최고 성능 대비 8.5% 상대적 감소이다.
Producing a large annotated speech corpus for training ASR systems remains difficult for more than 95% of languages all over the world which are low-resourced, but collecting a relatively big unlabeled data set for such languages is more achievable. This is why some initial effort have been reported on completely unsupervised speech recognition learned from unlabeled data only, although with relatively high error rates. In this paper, we develop a Generative Adversarial Network (GAN) to achieve this purpose, in which a Generator and a Discriminator learn from each other iteratively to improve the performance. We further use a set of Hidden Markov Models (HMMs) iteratively refined from the machine generated labels to work in harmony with the GAN. The initial experiments on TIMIT data set achieve an phone error rate of 33.1%, which is 8.5% lower than the previous state-of-the-art.
연구 동기 및 목표
- 저자원 언어의 음성 인식(ASR) 문제를 해결하기 위해 순수하게 레이블이 없는 음성 및 텍스트 데이터에서 학습이 가능하도록 하는 것.
- 기존 비지도 ASR 방법이 오라클 또는 강제 정렬 경계에 의존하는 한계를 극복하는 것.
- 감독 신호 없이 GAN과 HMM이 상호 반복적으로 향상시키는 공동 학습 프레임워크를 개발하는 것.
- 오직 레이블이 없는 데이터만을 사용하여 완전히 비지도 음성 인식에서 최고 성능을 달성하는 것.
제안 방법
- 생성자는 프레임 단위 음소 분류기와 세그먼트 기반 샘플링 과정을 포함한 GAN 아키텍처를 사용하여 음성 특징에서 음소 시퀀스를 생성한다.
- 구분자는 실제 음소 시퀀스(텍스트 문장에서 유래)와 생성자로부터 생성된 시퀀스를 구분하도록 훈련된다.
- 초기 분할 경계는 비지도 방법(GAS)을 통해 자동으로 유도되며, 이후 생성자 출력에 기반한 반복적인 HMM 훈련을 통해 개선된다.
- 각 반복에서 HMM은 생성자가 예측한 음소 시퀀스를 사용하여 재학습되며, 분할 정확도를 향상시키고 GAN으로 피드백한다.
- 세그먼트 내에서의 매끄러움을 유도하기 위해 새로운 내부 세그먼트 손실이 도입되어 시간적 일관성을 향상시킨다.
- 데이터 증강과 분류 특징(LDA, MLLT 등)을 활용하여 강인성과 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1GAN 기반 프레임워크는 레이블이 전혀 없는 데이터로도 경쟁 가능한 비지도 음성 인식 성능을 달성할 수 있는가?
- RQ2HMM을 이용한 반복적 개선이 비지도 ASR에서 분할 및 음소 시퀀스 생성에 어떻게 기여하는가?
- RQ3GAN과 HMM 간의 조율이 독립적으로 사용된 GAN 또는 HMM 대비 오류율을 얼마나 감소시키는가?
- RQ4강제 정렬이 없는 일치하지 않는 텍스트-음성 쌍 간에도 제안된 방법이 일반화 가능한가?
주요 결과
- 제안된 GAN/HMM 프레임워크는 일치하지 않는 경우 TIMIT 데이터셋에서 33.1%의 음소 오류율(PER)을 달성하였으며, 이는 이전 최고 성능 대비 8.5% 상대적 감소이다.
- 세 번의 반복 후, 일치하는 경우 PER는 26.1%로 감소하였으며, 이는 4,000개의 레이블이 있는 음성 데이터로 훈련된 감독 기반 HMM보다도 뛰어난 성능을 보였다.
- 제거 실험 결과, HMM의 트라이포네, LDA, MLLT가 성능 향상에 기여했으며, 데이터 증강 또는 내부 세그먼트 손실을 제거할 경우 성능 저하가 발생했다.
- 생성자 내 DNN를 RNN으로 대체한 결과 성능 급격히 저하됨(FER: 75.5%, PER: 71.6%), 이는 RNN이 정렬 학습을 방해할 수 있음을 시사한다.
- 세 번의 반복 후 수렴하였으며, 일치 및 일치하지 않는 설정 모두에서 모든 평가 지표에서 일관된 향상이 관찰되었다.
- 감독 기반 기준 모델과 비교했을 때, 레이블이 15%만 있는 경우에도 비지도 GAN/HMM 방법이 표준 HMM 시스템의 성능을 재현하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.