[논문 리뷰] XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale
XLS-R는 128개의 언어에서 436,000시간에 이르는 다국어 음성 데이터를 활용해 대규모 wav2vec 2.0 프레임워크를 기반으로 훈련된 자기지도 학습형 다국어 음성 표현 모델이다. CoVoST-2에서 음성 번역 분야에 7.4 BLEU 향상, 음성 인식 분야에선 상대 오차 감소율 14–34%를 기록하며 최신 기술 수준(SOTA)을 달성했으며, 언어 식별 분야에서도 기존 단일 언어 모델을 능가한다. 영어에서 다른 언어로의 번역 분야에서 충분히 큰 모델일 경우 특히 뛰어난 성능을 발휘한다.
This paper presents XLS-R, a large-scale model for cross-lingual speech representation learning based on wav2vec 2.0. We train models with up to 2B parameters on nearly half a million hours of publicly available speech audio in 128 languages, an order of magnitude more public data than the largest known prior work. Our evaluation covers a wide range of tasks, domains, data regimes and languages, both high and low-resource. On the CoVoST-2 speech translation benchmark, we improve the previous state of the art by an average of 7.4 BLEU over 21 translation directions into English. For speech recognition, XLS-R improves over the best known prior work on BABEL, MLS, CommonVoice as well as VoxPopuli, lowering error rates by 14-34% relative on average. XLS-R also sets a new state of the art on VoxLingua107 language identification. Moreover, we show that with sufficient model size, cross-lingual pretraining can outperform English-only pretraining when translating English speech into other languages, a setting which favors monolingual pretraining. We hope XLS-R can help to improve speech processing tasks for many more languages of the world.
연구 동기 및 목표
- 이전 연구보다 훨씬 더 많은 다국어 데이터를 활용해 다국어 음성 표현 학습의 스케일을 확장하는 것.
- 다양한 작업, 언어, 데이터 제약 조건(저자원, 중간자원 설정 포함)에서 대규모 다국어 모델의 성능을 평가하는 것.
- 영어 전용 사전 훈련이 유리한 영어→다른 언어 번역 설정에서, 다국어 사전 훈련된 모델이 단일 언어 모델의 성능을 따라잡거나 능가할 수 있는지 조사하는 것.
- 단일 다국어 모델이 다양한 음성 처리 작업과 저자원 언어에 대해 얼마나 일반화 가능한지 보여주는 것.
- 다국어 음성 처리 분야의 연구를 가속화하기 위해 대규모 공개 모델과 코드베이스를 제공하는 것.
제안 방법
- XLS-R는 raw 오디오에서 잠재 표현을 학습하기 위해 컨volutional 특징 인코더와 Transformer 기반의 컨텍스트 인코더를 사용하는 wav2vec 2.0 프레임워크에 기반한다.
- 대조 학습을 위해 잠재 표현을 코드북 항목으로 이산화하기 위해 Gumbel-Softmax 전략을 사용하는 양자화 모듈을 활용한다.
- 사전 훈련 중에는 10개의 연속된 시간 단위가 마스킹되며, 모델은 100개의 음성 샘플에서 올바른 양자화 표현을 예측하도록 대조 목표를 사용한다.
- 코드북 항목의 균일한 사용을 장려하고 표현 품질을 향상시키기 위해 코드북 다양성 페널티를 적용한다.
- VoxPopuli, MLS, CommonVoice, BABEL, VoxLingua107에서 공개된 비번역 음성 데이터를 활용해 총 128개 언어의 혼합 데이터로 훈련한다.
- 모든 파rameter가 업데이트되는 방식으로 음성 번역, 음성 인식, 언어 식별 등의 최종 작업에 대해 엔드 투 엔드로 피니튜닝을 수행한다.

실험 결과
연구 질문
- RQ1128개 언어에서 436,000시간의 데이터를 활용해 훈련된 대규모 다국어 자기지도 학습 모델이 이전의 다국어 모델보다 음성 번역 및 음성 인식 작업에서 더 뛰어난 성능을 보일 수 있는가?
- RQ2충분한 모델 용량을 갖춘 다국어 사전 훈련이 영어 전용 사전 훈련보다 영어→다른 언어 번역 분야에서 성능을 따라잡거나 능가할 수 있는가?
- RQ3모델 규모와 데이터 다양성이 저자원, 중간자원, 고자원 언어의 다국어 음성 작업에서 성능에 어떤 영향을 미치는가?
- RQ4단일 다국어 모델이 음성 처리 분야의 다양한 도메인과 데이터 제약 조건에서 얼마나 일반화 가능한가?
- RQ5다국어 사전 훈련이 특히 저자원 언어에서 언어 식별 분야에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- CoVoST-2에서 XLS-R는 영어로의 21개 번역 방향 전반에서 평균 7.4 BLEU 향상을 기록하며 이전 최고 기록을 초월했으며, 저자원 및 중간자원 언어에서 가장 큰 향상을 보였다.
- 음성 인식 분야에서 XLS-R는 BABEL, MLS, CommonVoice, VoxPopuli에서 평균적으로 상대 오차 감소율 14–34%를 기록했으며, MLS를 제외한 모든 벤치마크에서 새로운 최고 기록을 수립했다.
- VoxLingua107 언어 식별 벤치마크에서 XLS-R는 강력한 다국어 일반화 능력을 보여주며 새로운 최고 기록을 수립했다.
- 가장 큰 XLS-R 모델(20억 파라미터)은 영어→다른 언어 번역 분야에서 강력한 영어 전용 사전 훈련 모델과 동등하거나 뛰어난 성능을 기록했으며, 일반적으로 단일 언어 사전 훈련이 유리한 설정임을 고려할 때 놀라운 성과를 보였다.
- VoxCeleb1에서 XLS-R는 95.8%의 발화자 식별 정확도를 기록했으며, 이는 이전 연구를 능가하는 성능을 보였으며, 대부분의 데이터가 영어일 경우에도 강력한 내성성을 보였다.
- 더 많은 훈련 데이터와 모델 용량이 증가할수록 일관된 성능 향상이 관찰되었으며, 다른 요소가 동일한 조건에서 더 큰 모델일수록 모든 벤치마크에서 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.