Skip to main content
QUICK REVIEW

[논문 리뷰] CoVoST 2: A Massively Multilingual Speech-to-Text Translation Corpus

Changhan Wang, Anne Wu|arXiv (Cornell University)|2020. 07. 20.
Natural Language Processing Techniques인용 수 40
한 줄 요약

CoVoST 2는 21개의 원본 언어에서 영어로, 영어에서 15개의 대상 언어로 이르는 다국어 음성-텍스트 번역 코퍼스를 포함하는 대규모 공개 다국어 음성-텍스트 번역 데이터셋으로, 지금까지 가장 큰 규모의 데이터셋이다. 이 데이터셋은 다양한 언어 조합에서 음성 번역 모델의 광범위한 훈련과 평가를 가능하게 하며, 정합성 검증을 통해 데이터 품질을 확보하고 CC0 라이선스 하에 공개된다.

ABSTRACT

Speech translation has recently become an increasingly popular topic of research, partly due to the development of benchmark datasets. Nevertheless, current datasets cover a limited number of languages. With the aim to foster research in massive multilingual speech translation and speech translation for low resource language pairs, we release CoVoST 2, a large-scale multilingual speech translation corpus covering translations from 21 languages into English and from English into 15 languages. This represents the largest open dataset available to date from total volume and language coverage perspective. Data sanity checks provide evidence about the quality of the data, which is released under CC0 license. We also provide extensive speech recognition, bilingual and multilingual machine translation and speech translation baselines.

연구 동기 및 목표

  • 저자원 언어 조합을 포함한 대규모 다국어 음성-텍스트 번역 데이터셋의 부족 문제를 해결하기 위해.
  • 넓은 언어 커버리지와 높은 데이터 양을 갖춘 데이터셋을 제공하여 대규모 다국어 음성 번역 연구를 지원하기 위해.
  • 다양한 언어적 및 청각적 변형을 포함한 다국어 데이터를 통해 모델의 일반화 능력과 성능을 향상시키기 위해.
  • 다양한 언어 조합에서 음성 인식, 기계 번역, 종단 간 음성 번역 모델의 벤치마킹을 가능하게 하기 위해.

제안 방법

  • 기존의 다국어 음성 및 텍스트 자료, 예를 들어 Common Voice와 OPUS 데이터셋을 기반으로 하며, 강제 정렬 기법을 사용해 오디오와 텍스트를 자동으로 정렬한다.
  • 자동화된 데이터 정합성 검사를 통해 오디오와 텍스트 쌍을 정제하고 필터링하여 품질과 일관성을 확보한다.
  • 21개의 원본 언어에서 영어로, 15개의 영어에서 대상 언어로의 평행 데이터를 포함하며, 다양한 언어적 다양성을 반영한다.
  • 이 데이터셋을 사용해 음성 인식, 双어 번역 및 다국어 기계 번역, 종단 간 음성 번역 모델의 기준 모델을 훈련한다.
  • 연구의 접근성과 재사용성을 극대화하기 위해 CC0 라이선스 하에 데이터셋을 공개한다.
  • 음성 번역, 번역, ASR 작업 간 일관된 벤치마킹을 지원하기 위해 평가 프로토콜과 지표를 수립한다.

실험 결과

연구 질문

  • RQ1대규모 다국어 환경에서 음성 번역 모델의 성능은 고자원 언어 조합과 저자원 언어 조합 간에 어떻게 달라지나?
  • RQ2CoVoST 2에서의 다국어 미리 훈련된 모델이 새로운 언어 조합으로의 제로샷 전이 성능을 얼마나 향상시키는가?
  • RQ3CoVoST 2에서 훈련된 다국어 음성 번역 모델은 다양한 언어 유형과 청각적 구조에 효과적으로 일반화될 수 있는가?
  • RQ421개의 원본 언어와 15개의 대상 언어를 포함하는 것이 종단 간 음성 번역 시스템의 확장성과 효율성에 어떤 영향을 미치는가?
  • RQ5대규모 공개 다국어 음성 번역 코퍼스를 구축할 때의 주요 품질과 커버리지 간의 상충 관계는 무엇인가?

주요 결과

  • CoVoST 2는 공개로 이용 가능한 가장 큰 다국어 음성-텍스트 번역 데이터셋으로, 21개의 원본 언어에서 영어로, 15개의 영어에서 대상 언어로의 포괄적인 커버리지가 이루어져 있다.
  • 데이터 정합성 검사를 통해 오디오와 텍스트 간의 높은 정확도의 정렬이 확인되어 신뢰할 수 있는 모델 훈련과 평가를 가능하게 한다.
  • 저자원 조합을 포함한 다양한 언어 조합에서 강력한 다국어 음성 번역 기준 모델을 훈련할 수 있도록 한다.
  • 음성 인식, 기계 번역, 음성 번역을 위한 기준 모델이 경쟁적인 성능을 보이며, 이 데이터셋이 벤치마킹에 유용함을 입증한다.
  • CC0 라이선스 하에 데이터셋이 공개되어 다국어 음성 번역 연구 분야에서 넓은 재사용과 재현 가능성을 촉진한다.
  • 광범위한 언어 커버리지가 다양한 언어 조합 간 제로샷 및 소수 샘플 일반화 능력 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.