Skip to main content
QUICK REVIEW

[논문 리뷰] FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech

Alexis Conneau, Min Ma|arXiv (Cornell University)|2022. 05. 25.
Speech Recognition and Synthesis인용 수 15
한 줄 요약

FLEURS는 FLoRes-101을 기반으로 인간이 검증한 녹음과 고품질 텍스트 전사로 구성된 102개 언어의 다국어, n-방향 병렬 음성 및 텍스트 벤치마크를 제공한다. 이는 유니버설 음성 표현의 소수 샘플 평가를 가능하게 하며, mSLAM을 사용하여 음성-텍스트 검색에서 76.9%의 P@1, 텍스트-음성 검색에서 74.4%의 P@1을 기록하여 다양한 언어에서 강력한 제로샷 및 다국어 능력을 입증한다.

ABSTRACT

We introduce FLEURS, the Few-shot Learning Evaluation of Universal Representations of Speech benchmark. FLEURS is an n-way parallel speech dataset in 102 languages built on top of the machine translation FLoRes-101 benchmark, with approximately 12 hours of speech supervision per language. FLEURS can be used for a variety of speech tasks, including Automatic Speech Recognition (ASR), Speech Language Identification (Speech LangID), Translation and Retrieval. In this paper, we provide baselines for the tasks based on multilingual pre-trained models like mSLAM. The goal of FLEURS is to enable speech technology in more languages and catalyze research in low-resource speech understanding.

연구 동기 및 목표

  • 저자원 언어에서의 소수 샘플 학습을 위한 대규모, 고품질, 다국어 음성 및 텍스트 데이터셋의 부족 문제를 해결하기 위해.
  • 다양한 어족과 저자원 환경에서 유니버설 음성 표현의 평가를 가능하게 하기 위해.
  • ASR, 음성 언어 식별, 음성 번역, 다국어 간 검색과 같은 다양한 작업을 지원하기 위해.
  • 표준화된 벤치마크와 강력한 품질 관리를 통해 데이터 효율적이고 다국어 음성 이해 연구를 촉진하기 위해.

제안 방법

  • FLoRes-101 개발 및 개발테스트 세트에서 102개 언어의 문장당 세 명의 인간이 녹음한 음성을 수집하여 균형 잡힌 성비 비율을 확보했다.
  • 엄격한 품질 관리 도입: 각 녹음은 인간 평가자에 의해 원본 텍스트와 일치하는지 검증되었으며, 일치하지 않는 녹음은 기각되었다.
  • 데이터 증강(예: SpecAugment 또는 속도 변형 등) 없이 원본 오디오를 유지하여 실제 세계의 변동성을 그대로 보존했다.
  • ASR, 음성 언어 식별, 다중모달 검색과 같은 최종 작업을 위해 mSLAM(0.6B) 및 w2v-BERT와 같은 다국어 모델을 FLEURS에서 미세조정했다.
  • 검색 작업에서 교차 어텐션 기반 다중모달 임베딩을 학습하기 위해 인-배치 음성 샘플링을 사용한 추가 마진 소프트맥스 손실을 적용했다.
  • 음성-텍스트 및 텍스트-음성 검색의 P@1 점수를 통해 검색 성능을 평가하였으며, 제로샷 및 알려지지 않은 언어 일반화 능력도 포함했다.
Figure 1: Distributions of language families in FLEURS (y-axis is the count).
Figure 1: Distributions of language families in FLEURS (y-axis is the count).

실험 결과

연구 질문

  • RQ1mSLAM과 같은 다국어 사전학습 모델이 저자원 언어나 알려지지 않은 언어에서 소수 샘플 음성 이해 작업으로 얼마나 잘 일반화되는가?
  • RQ2자동으로 정렬되거나 합성된 데이터와 비교할 때, 인간이 검증한, n-방향 병렬 음성 및 텍스트 데이터의 품질과 다양성이 소수 샘플 학습 성능에 얼마나 기여하는가?
  • RQ3음성-텍스트 및 텍스트-음성 검색에서 어족과 언어 집단(예: CJK, 남아시아, 유럽) 간 모델 성능은 어떻게 변하는가?
  • RQ4토크나이저 불일치 또는 발음 유사성으로 인해 토크나이저 불일치 또는 발음 유사성으로 인해 사전학습 모델이 저자원 언어나 문자 체계가 다른 언어(예: 오디아, 우르두어)에서 실패하는 원인는 무엇인가?
  • RQ5단일 통합 다국어 표현 모델이 하나의 벤치마크에서 ASR, 음성 언어 식별, 다중모달 검색과 같은 다양한 작업을 효과적으로 지원할 수 있는가?

주요 결과

  • FLEURS는 mSLAM를 사용하여 음성-텍스트 검색에서 평균 P@1 76.9%, 텍스트-음성 검색에서 74.4%를 기록하여 강력한 제로샷 및 다국어 능력을 입증했다.
  • CJK 언어에서는 성능이 크게 저하되며(예: 음성-텍스트 검색에서 4.7% P@1), 주로 사전학습 데이터와 미세조정 데이터 간 토크나이저 불일치가 원인이다.
  • 오디아(or)와 같이 텍스트 사전학습 코퍼스(MC4)에 포함되지 않은 언어는 음성에는 존재하지만 텍스트-음성 검색에서 성능이 열악하다. 이는 데이터 불균형 문제를 드러낸다.
  • 우르두어(ur)는 텍스트-음성 검색에서 음성-텍스트 검색보다 성능이 열악한 편이지만, 주로 남아시아 언어들 간의 발음 유사성으로 인해 구분이 어려워지며, 음성 전용 사전학습이 이루어지지 않은 경우에 해당한다.
  • 모든 작업에서 볼 때, 볼 수 있는 언어는 항상 알려지지 않은 언어보다 성능이 뛰어나며, 특히 남아시아(SA) 및 동남아시아(SEA) 그룹에서 성능 격차가 가장 크다.
  • mSLAM 모델은 모든 작업에서 w2v-BERT를 능가하며, 음성 언어 식별에서 F1 점수 73.4%, 음성-텍스트 검색에서 87.8%를 기록하여 음성-텍스트 동시 사전학습의 이점을 입증한다.
Figure 2: Distributions of writing systems in FLEURS (y-axis is the count).
Figure 2: Distributions of writing systems in FLEURS (y-axis is the count).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.