[논문 리뷰] MaSS: A Large and Clean Multilingual Corpus of Sentence-aligned Spoken Utterances Extracted from the Bible
이 논문은 CMU Wilderness Multilingual Speech Dataset에서 유래한 8개 언어(Basque, English, Finnish, French, Hungarian, Romanian, Russian, Spanish)의 8,130개의 병렬 음성 발화문을 포함하는 대규모 다국어 문장 정렬 음성 코퍼스인 MaSS를 소개한다. 자동 강제 정렬과 인간 평가를 적용하여 고품질의 음성-음성 및 음성-텍스트 정렬을 구축하였으며, 이는 이중어 음성 검색에서 중앙값 순위가 최소 9에 이르는 등 유용성을 입증하였고, 자원이 적고 문법적 특성이 다양한 언어 쌍에 대해서도 가능성을 보여주었다.
The CMU Wilderness Multilingual Speech Dataset (Black, 2019) is a newly published multilingual speech dataset based on recorded readings of the New Testament. It provides data to build Automatic Speech Recognition (ASR) and Text-to-Speech (TTS) models for potentially 700 languages. However, the fact that the source content (the Bible) is the same for all the languages is not exploited to date.Therefore, this article proposes to add multilingual links between speech segments in different languages, and shares a large and clean dataset of 8,130 parallel spoken utterances across 8 languages (56 language pairs). We name this corpus MaSS (Multilingual corpus of Sentence-aligned Spoken utterances). The covered languages (Basque, English, Finnish, French, Hungarian, Romanian, Russian and Spanish) allow researches on speech-to-speech alignment as well as on translation for typologically different language pairs. The quality of the final corpus is attested by human evaluation performed on a corpus subset (100 utterances, 8 language pairs). Lastly, we showcase the usefulness of the final product on a bilingual speech retrieval task.
연구 동기 및 목표
- CMU Wilderness 데이터셋에 포함된 700개 이상의 언어에서 공통된 원천 자료(성경)를 활용하여 대규모 고품질 다국어 음성 코퍼스를 구축하기 위해.
- 다양한 언어 쌍 간의 문장 정렬 병렬 음성 발화문을 제공하여 음성-음성 정렬 및 번역 연구를 가능하게 하기 위해.
- 8개 언어 쌍에서 100개 발화문의 대표적 서브셋에 대한 인간 평가를 통해 코퍼스 품질을 확보하기 위해.
- 학습된 음성 임베딩을 사용한 이중어 음성 검색 작업을 통해 코퍼스의 유용성을 입증하기 위해.
- 새로운 언어로의 확장 지원을 위해 전체 파이프라인과 정렬 데이터를 공개하기 위해.
제안 방법
- 저자들은 Kaldi를 사용하여 8개 언어의 음성 발화문과 해당 텍스트 전사문을 정렬하기 위해 강제 정렬을 적용한다.
- 일치하는 발화문 쌍 간의 코사인 거리 최소화를 위해, 대비 손실 함수를 사용하는 시아모이드 신경망을 사용하여 공통 다국어 음성 임베딩을 학습한다.
- 손실 함수는 $ L(v_A, v_B, α) = \sum_{v_A,v_B} \Bigg{(} \sum_{v_A^\prime} \max[0, \alpha + d(v_A,v_B) - d(v_A^\prime,v_B)] + \sum_{v_B^\prime} \max[0, \alpha + d(v_A,v_B) - d(v_A,v_B^\prime)] \Bigg{)} $ 로 정의되며, 여기서 $ d $ 는 코사인 거리이고 $ \alpha $ 는 마진이다.
- 모델은 8,160개의 공통 성경 구절을 80% 훈련, 10% 검증, 10% 테스트 세트로 나누어 배치 크기 16, 100 에포크 동안 훈련한다.
- 8개 언어 쌍에서 100개 발화문의 서브셋에 대해 이중어 모국어 사용자들이 정렬 품질을 평가하기 위해 인간 평가를 실시한다.
- 파이프라인과 정렬 스크립트는 공개되어 있어 새로운 언어로의 확장이 용이하다.
실험 결과
연구 질문
- RQ1공통 원천 텍스트(예: 성경)에서 자동 강제 정렬이 고품질의 문장 정렬 다국어 음성 코퍼스를 생성할 수 있는가?
- RQ2자동 정렬의 품질과 음성-음성 검색의 최종 성능 간 상관관계는 어떻게 되는가?
- RQ3다국어 음성 임베딩이 문법적 특성이 다양하고 상이한 언어 쌍 간의 효과적인 이중어 음성 검색을 가능하게 할 수 있는 정도는 어느 정도인가?
- RQ4인간 평가가 비용이 많이 들 때, 음성-음성 검색 성능이 정렬 품질을 대체로 사용할 수 있는가?
주요 결과
- MaSS 코퍼스는 8개 언어에서 8,130개의 병렬 음성 발화문을 포함하며, 고품질의 문장 정렬 음성-텍스트 및 음성-음성 정렬을 제공하는 56개 언어 쌍을 형성한다.
- 100개 발화문 서브셋에 대한 인간 평가 결과 평균 정렬 품질 점수는 5점 만점에 4.44점으로, 코퍼스의 높은 신뢰성을 확인한다.
- 음성-음성 검색 작업에서 모델은 Basque-English의 경우 중앙값 순위 9, Spanish-English의 경우 중앙값 순위 12를 기록하였으며, 이는 우연의 중앙값 순위 408.5보다 유의미하게 뛰어나다.
- 검색 중앙값 순위와 인간 평가 점수 간 강한 반비례 상관관계(r = -0.76, p < 0.1)가 확인되어, 검색 성능이 정렬 품질을 대체로 사용할 수 있음을 시사한다.
- 특히 문법적 특성이 상이한 언어 쌍인 Finnish-English(중앙값 순위 26) 및 Romanian-English(중앙값 순위 17)에서도 음성-음성 검색 성능이 유의미하게 확보되어, 이 방법의 타당성이 입증된다.
- 파이프라인이 확장 가능하며, 동일한 방법론을 사용해 새로운 언어로의 적용이 쉬운 공개된 스크립트를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.