Skip to main content
QUICK REVIEW

[논문 리뷰] VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation

Changhan Wang, Morgane Rivière|arXiv (Cornell University)|2021. 01. 02.
Natural Language Processing Techniques인용 수 5
한 줄 요약

VoxPopuli는 23개의 언어에서 400,000시간의 레이블이 없는 음성 데이터와 15개 언어 쌍에서 17,300시간의 정렬된 구두 번역이 포함된 1,800시간의 음성 번역 데이터를 포함하는 대규모 다국어 음성 코퍼스를 소개한다. 이 코퍼스는 특히 도메인 외부 설정에서의 준지도 학습 기반 음성 인식(ASR) 및 음성-텍스트 번역에서의 향상된 성능을 가능하게 하며, 표현 학습 및 해석 모델링에 있어 높은 전이 가능성과 실용성을 입증한다.

ABSTRACT

We introduce VoxPopuli, a large-scale multilingual corpus providing 100K hours of unlabelled speech data in 23 languages. It is the largest open data to date for unsupervised representation learning as well as semi-supervised learning. VoxPopuli also contains 1.8K hours of transcribed speeches in 16 languages and their aligned oral interpretations into 5 other languages totaling 5.1K hours. We provide speech recognition baselines and validate the versatility of VoxPopuli unlabelled data in semi-supervised learning under challenging out-of-domain settings. We will release the corpus at https://github.com/facebookresearch/voxpopuli under an open license.

연구 동기 및 목표

  • 영어와 같은 고자원 언어를 초월해 무 supervision 및 준지도 학습에 활용 가능한 대규모 다국어 음성 데이터의 부족 문제를 해결한다.
  • 동시 해석 전략을 모델링하기 위해 정렬된 구두 번역이 포함된 종합적인 다국어 음성 데이터셋을 제공한다.
  • 다양하고 실제 세계의 음성 데이터를 제공함으로써 저자원 및 도메인 외부 음성-텍스트 번역 및 음성-음성 번역 분야의 연구를 가능하게 한다.
  • 풍부한 레이블이 없는 데이터와 약한 레이블이 부여된 데이터를 통해 강건한 자기지도 학습 및 약한 지도 학습 모델의 개발을 지원한다.
  • 기존의 문장 번역과는 다름을 보이는 자연스러운 구두 번역을 포함함으로써, 해석 전용 음성 패턴 연구를 촉진한다.

제안 방법

  • 2009~2020년 동안의 유럽의회 전원 회의 및 위원회 회의에서 원시 오디오, 원문, 타임스탬프를 수집하였다.
  • 음성 단위로 분할하고, 원문을 오디오에 정렬하며, 잘못되거나 불완전한 세그먼트를 걸러내기 위한 자동화된 파이프라인을 구축하였다.
  • 음성-음성 정렬을 활용하여, 구두 번역을 사용해 음성-텍스트 번역을 위한 약한 지도 학습 데이터를 생성하였다.
  • 도메인 외부 테스트 세트에서의 성능 향상을 위해, 레이블이 없는 데이터를 활용한 자기학습(self-training)을 적용하였다.
  • 레이블이 있는 데이터와 약한 레이블이 있는 데이터를 함께 학습하여 모델의 일반화 능력과 성능을 향상시켰다.
  • 내부 도메인(EP) 및 도메인 외부(Common Voice) 벤치마크를 사용해 모델의 전이 가능성과 강건성을 평가하였다.

실험 결과

연구 질문

  • RQ1대규모 레이블이 없는 다국어 음성 데이터가 다양한 저자원 언어에서 준지도 학습 기반 음성 인식(ASR) 및 음성 번역 성능 향상에 기여할 수 있는가?
  • RQ2정렬된 구두 번역을 활용한 약한 지도 학습이 기존의 지도 학습 또는 가짜 레이블 학습 방법에 비해 음성-텍스트 번역 품질 향상에 얼마나 기여하는가?
  • RQ3VoxPopuli 데이터를 활용한 자기학습이 도메인 외부 테스트 세트에서 모델의 일반화 능력을 얼마나 향상시키는가?
  • RQ4기존의 문장 번역과는 다름을 보이는 자연스러운 구두 번역을 포함함으로써, 종단 간(end-to-end) 모델에서 동시성과 해석 전략을 더 잘 모델링할 수 있는가?
  • RQ5레이블이 있는 데이터와 약한 레이블이 있는 데이터를 병합한 학습이 저자원 환경에서 각각의 학습 방식보다 더 높은 성능을 내는가?

주요 결과

  • VoxPopuli의 400,000시간의 레이블이 없는 데이터를 활용한 자기학습은 여러 언어에서 내부 도메인(EP) 및 도메인 외부(CV) ASR 성능 향상에 일관된 성과를 보였다.
  • 17,300시간의 정렬된 구두 번역 데이터를 활용한 약한 지도 학습은 0.3배에서 1.8배 더 많은 데이터가 필요한 지도 학습 베이스라인과 유사하거나 뛰어난 성능을 달성하여 높은 데이터 효율성을 입증하였다.
  • 레이블이 있는 데이터와 약한 레이블이 있는 데이터를 함께 학습한 결과, 자기학습 및 지도 학습 베이스라인을 모두 초월하여, 약한 레이블 데이터가 매우 유용하고 보완적인 정보를 제공함을 보였다.
  • 이 코퍼스를 통해 음성-텍스트 번역 성능 향상이 크게 이루어졌으며, 추가적인 레이블 데이터 없이도 종단 간 모델과 계단식 모델 간의 격차를 좁히는 데 기여하였다.
  • VoxPopuli의 레이블이 없는 데이터는 강력한 전이 가능성과 함께, 저자원 언어의 경우에도 도메인 외부 테스트 세트(예: Common Voice)에서 성능 향상을 보였다.
  • 정렬 파이프라인은 높은 품질의 약한 지도 학습을 제공하였으며, 이는 약한 레이블이 부여된 데이터로 학습된 모델의 뛰어난 성능을 통해 간접적으로 정렬 과정의 신뢰성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.