[논문 리뷰] Towards Unsupervised Automatic Speech Recognition Trained by Unaligned Speech and Text only
이 논문은 자기지도 학습 및 다중 모odal 임베딩 정렬을 통해 정렬되지 않은 음성과 텍스트에서 단어 수준의 음성 표현을 학습하는 세 단계의 비지도 ASR 프레임워크를 제안한다. 순차적-순차적 오토인코더에 적대적 훈련을 적용하여 음소적 정보와 발화자 정보를 분리하고, 음성에서 빈도어 모델을 통해 의미 임베딩을 학습하며, MBC-ICP를 사용해 이를 텍스트 임베딩과 정렬함으로써, 60.68%의 상위 10개 이웃 정확도를 달성하여, 정렬 정보가 전혀 없는 비지도 ASR의 가능성을 입증한다.
Automatic speech recognition (ASR) has been widely researched with supervised approaches, while many low-resourced languages lack audio-text aligned data, and supervised methods cannot be applied on them. In this work, we propose a framework to achieve unsupervised ASR on a read English speech dataset, where audio and text are unaligned. In the first stage, each word-level audio segment in the utterances is represented by a vector representation extracted by a sequence-of-sequence autoencoder, in which phonetic information and speaker information are disentangled. Secondly, semantic embeddings of audio segments are trained from the vector representations using a skip-gram model. Last but not the least, an unsupervised method is utilized to transform semantic embeddings of audio segments to text embedding space, and finally the transformed embeddings are mapped to words. With the above framework, we are towards unsupervised ASR trained by unaligned text and speech only.
연구 동기 및 목표
- 음성-텍스트 정렬 정보가 없는 저자원 환경에서 비지도 자동 음성 인식을 가능하게 하기 위해.
- 자기지도 방법을 사용하여 정렬되지 않은 음성과 텍스트에서 의미적이고 음소적인 표현을 학습하기 위해.
- 쌍화된 예제 없이도 음성과 텍스트 임베딩 간의 의미적 격차를 해소하기 위해 선형 변환을 학습함으로써 비지도로 양식화된 음성과 텍스트 간의 매칭을 가능하게 하기 위해.
- 오직 정렬되지 않은 음성과 텍스트 데이터만을 사용하여 종단간 비지도 ASR의 가능성에 대한 검증을 위해.
제안 방법
- 적대적 훈련을 적용한 순차적-순차적 오토인코더를 통해 단어 수준의 음성 세그먼트에서 음소적 정보와 발화자 정보를 분리하고, 음소적 임베딩을 생성한다.
- 분리된 음소적 벡터에서 빈도어 모델을 사용해 의미 임베딩을 학습하며, 이는 Word2Vec에 유사하지만 음성 표현에 적용된 것이다.
- 무 supervision으로 정렬하는 방법인 미니배치 사이클 반복 최접점 방법(MBC-ICP)을 사용하여 주성분 분석과 애핀 변환을 통해 음성 의미 임베딩을 텍스트 의미 임베딩 공간으로 매핑한다.
- 이 방법은 세 단계로 구성된다: (1) 분리된 표현을 통한 음소적 임베딩 추출, (2) 의미 임베딩 학습, (3) 다중 모달 임베딩 정렬.
- 차원 축소를 위해 상위 100개의 주성분을 사용하고, 최종 정렬 단계의 훈련을 위해 학습률 감소를 적용한 확률적 경사 하강법을 적용한다.
- 모델 평가에는 벤치마크 단어 유사도 데이터셋에서 슔피어만의 순위 상관관계와 단어 검색을 위한 상위-k 최근접 이웃 정확도를 사용한다.
실험 결과
연구 질문
- RQ1자기지도 음성 및 텍스트 모델링을 통해 정렬되지 않은 음성과 텍스트에서 의미 표현을 효과적으로 학습할 수 있는가?
- RQ2음소적 정보와 발화자 정보를 분리하는 것이 후속 ASR 작업을 위한 음성 임베딩 품질을 향상시키는가?
- RQ3쌍화된 예제 없이도 선형 변환을 통해 음성 의미 임베딩을 텍스트 의미 임베딩으로 정렬할 수 있는가?
- RQ4비지도 또는 준지도 정렬이 정렬되지 않은 음성과 텍스트에서 단어 수준의 대응 관계를 어느 정도 복구할 수 있는가?
주요 결과
- SE/SAD 방법—분리된 음소적 벡터에서 학습된 의미 임베딩—는 5000개의 레이블된 쌍을 사용해 최고의 상위 10개 이웃 정확도 60.68%를 달성하였다.
- 분리 기법은 의미 상관관계 점수를 크게 향상시켰으며, OHW 및 PEW 벤치마크에서 모두 슈피어만 순위 상관관계가 증가하였다.
- 5000개의 레이블된 쌍을 사용한 준지도 미세조정은 상위 10개 정확도를 86.38%로 향상시켜, 제한된 지도 정보가 정렬 성능을 크게 향상시킨다는 것을 시사한다.
- MBC-ICP 방법은 음성과 텍스트 의미 임베딩 간에 애핀 변환을 성공적으로 학습하여, 쌍화된 데이터 없이도 선형 매핑이 존재한다는 것을 검증하였다.
- 원시 오토인코더 임베딩보다 음성 의미 임베딩이 의미 유사도 작업에서 더 높은 성능을 보였으며, 이는 빈도어 사전 훈련 단계의 유용성을 확인한다.
- 결과적으로 완전히 비지도 정렬은 여전히 도전 과제이지만, 이 프레임워크는 최소한의 지도 정보를 통해 비지도 ASR로 향하는 실현 가능한 길을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.