Skip to main content
QUICK REVIEW

[논문 리뷰] XLST: Cross-lingual Self-training to Learn Multilingual Representation for Low Resource Speech Recognition

Ziqiang Zhang, Yan Song|arXiv (Cornell University)|2021. 03. 15.
Speech Recognition and Synthesis참고 문헌 43인용 수 8
한 줄 요약

이 논문은 소량의 고자원 언어(예: 영어)에서의 애너테이션 데이터와 대규모 비애너테이션 다국어 데이터를 활용하여 다국어 음성 표현 학습을 향상시키는 XLST라는 다국어 자기학습 프레임워크를 제안한다. 이중 네트워크 구조를 사용하며, 이는 이동 평균 타겟 네트워크와 다중 시각 데이터 증강 기법을 적용한 교사-학생 설정을 포함한다. 이로 인해 다섯 개의 저자원 ASR 작업에서 최신 자기학습 방법보다 18.6% 상대적 WER 감소를 달성하였으며, 더 작은 모델을 사용함에도 불구하고 뚜렷한 성능 향상을 보였다.

ABSTRACT

In this paper, we propose a weakly supervised multilingual representation learning framework, called cross-lingual self-training (XLST). XLST is able to utilize a small amount of annotated data from high-resource languages to improve the representation learning on multilingual un-annotated data. Specifically, XLST uses a supervised trained model to produce initial representations and another model to learn from them, by maximizing the similarity between output embeddings of these two models. Furthermore, the moving average mechanism and multi-view data augmentation are employed, which are experimentally shown to be crucial to XLST. Comprehensive experiments have been conducted on the CommonVoice corpus to evaluate the effectiveness of XLST. Results on 5 downstream low-resource ASR tasks shows that our multilingual pretrained model achieves relatively 18.6% PER reduction over the state-of-the-art self-supervised method, with leveraging additional 100 hours of annotated English data.

연구 동기 및 목표

  • 대부분의 언어에서 애너테이션 데이터가 부족한 저자원 음성 인식 문제를 해결하기 위해.
  • 고자원 언어에서의 소량의 애너테이션 데이터를 활용하여 다국어 표현 학습을 향상시키기 위해.
  • 병렬 데이터가 필요 없이 언어 간 지식을 전이할 수 있는 약한 지도 학습 전훈 프레임워크를 개발하기 위해.
  • 이동 평균과 다중 시각 데이터 증강 기법이 다국어 표현 학습에 미치는 영향을 조사하기 위해.

제안 방법

  • XLST는 동일한 입력에 대한 다양한 증강된 시각에서 프레임 단위의 임베딩을 생성하는 학생 모델과 타겟 네트워크(교사)로 구성된 이중 네트워크 아키텍처를 사용한다.
  • 손실는 학생의 출력과 타겟 네트워크의 출력 간 이질성으로 정의되며, 이는 학생이 정교화되고 실시간으로 업데이트되는 타겟에서 학습하도록 유도한다.
  • 이동 평균 기법을 통해 학생의 가중치를 가중 평균하여 타겟 네트워크의 가중치를 업데이트함으로써 학습 안정성과 성능 향상을 도모한다.
  • 시간 도메인의 스팸 마스킹과 주파수 마스킹을 통해 시간 도메인에서의 데이터 증강을 실시하여 강건성과 맥락 모델링 능력을 향상시킨다.
  • 동일 샘플의 다양한 증강된 시각 간의 일치도를 극대화하는 대비 유사 손실을 사용하여 엔드 투 엔드로 프레임워크를 훈련시킨다.
  • 이 방법은 다국어 설정에서 적용되며, 교사는 고자원 언어(예: 영어)에서 초기화되고, 학생은 여러 저자원 언어의 비애너테이션 데이터에서 학습한다.

실험 결과

연구 질문

  • RQ1고자원 언어에서 소량의 애너테이션 데이터가 저자원 언어의 다국어 표현 학습에 기여할 수 있는가?
  • RQ2다국어 ASR에서 자기학습 기반 전훈과 자기학습 기반 전훈 간의 성능 차이는 어떠한가?
  • RQ3이동 평균과 다중 시각 데이터 증강 기법이 XLST 성능에 미치는 영향은 무엇인가?
  • RQ4XLST는 저자원 ASR 작업에서 단일 언어 또는 다국어 자기학습 전훈보다 더 잘 일반화되는가?

주요 결과

  • XLST는 저자원 ASR 작업 다섯 개에서 최신 자기학습 방법인 XLSR-10 대비 18.6% 상대적 WER 감소를 달성하였으며, 추가로 100시간의 영어 애너테이션 데이터만을 사용하였다.
  • 다국어 전훈 모델(XLST-Multi)은 최고의 영어 전용 전훈 모델(ST-en1250) 대비 34.7% 상대적 WER 감소를 기록하였다.
  • 이동 평균 기법은 언어 불일치로 인해 초기 타겟 품질이 열 劣한 다국어 설정에서 성능 향상에 크게 기여하지만, 단일 언어 전훈에서는 유의미한 이점이 없다.
  • 시간 차원에서의 스팸 마스킹이 가장 효과적인 데이터 증강 전략으로, 증강 없이 비교했을 때 평균 후행 WER을 6.8% 감소시켰다.
  • XLST-mono(단일 언어 전훈)는 XLSR-단일 언어와 비교해도 슈퍼어리어지며, 더 적은 데이터와 더 작은 모델을 사용함에도 불구하고 Unispeech+보다 뛰어난 성능을 보였다.
  • 제거 실험 결과, 이동 평균과 다중 시각 증강 기법이 모두 필수적임을 확인하였으며, 이들의 조합이 다섯 개의 저자원 언어 전부에서 최고의 성능을 내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.