Skip to main content
QUICK REVIEW

[논문 리뷰] SDS-200: A Swiss German Speech to Standard German Text Corpus

Michel Plüss, Manuela Hürlimann|arXiv (Cornell University)|2022. 05. 19.
Natural Language Processing Techniques인용 수 6
한 줄 요약

이 논문은 다국어 스위스 독일어 말하기 자료를 포함한 200시간 분량의 스위스 독일어 말하기-표준 독일어 텍스트 코퍼스인 SDS-200을 소개한다. 이 코퍼스는 공개 웹 녹음 도구를 통해 참가자들이 표준 독일어 텍스트를 자신의 지역 스위스 독일어 방언으로 번역하고 녹음함으로써 수집되었으며, 방언, 연령, 성별 정보가 포함되어 있다. 이 코퍼스를 통해 말하기 번역, 방언 인식, 음성 합성 시스템을 훈련할 수 있으며, XLS-R 모델을 미세조정했을 때 21.6 WER와 64.0 BLEU 점수를 기록하여 기준 Transformer 모델보다 유의하게 뛰어난 성능을 보였다.

ABSTRACT

We present SDS-200, a corpus of Swiss German dialectal speech with Standard German text translations, annotated with dialect, age, and gender information of the speakers. The dataset allows for training speech translation, dialect recognition, and speech synthesis systems, among others. The data was collected using a web recording tool that is open to the public. Each participant was given a text in Standard German and asked to translate it to their Swiss German dialect before recording it. To increase the corpus quality, recordings were validated by other participants. The data consists of 200 hours of speech by around 4000 different speakers and covers a large part of the Swiss-German dialect landscape. We release SDS-200 alongside a baseline speech translation model, which achieves a word error rate (WER) of 30.3 and a BLEU score of 53.1 on the SDS-200 test set. Furthermore, we use SDS-200 to fine-tune a pre-trained XLS-R model, achieving 21.6 WER and 64.0 BLEU.

연구 동기 및 목표

  • 저자원 방언을 위한 공개적으로 이용 가능한 고품질의 다국어 스위스 독일어 말하기-텍스트 데이터셋이 부족한 문제를 해결하기 위해.
  • 스위스 전역의 다양한 스위스 독일어 방언을 포괄하는 공개 접근 가능한 다각도의 코퍼스를 구축하기 위해.
  • 스위스 독일어를 위한 종단간 말하기 번역, 방언 인식, 음성 합성 시스템 개발을 지원하기 위해.
  • 공개 데이터 수집과 자기지도 학습 미세조정을 조합하여 저자원 말하기-텍스트 번역 성능을 향상시키기 위해.
  • 향후 반복에서 공개 참여와 게임화를 통해 코퍼스의 크기와 다양성을 증가시키기 위해.

제안 방법

  • 스위스 독일어 말하기 번역을 위한 공개 웹 기반 녹음 도구를 개발하여 스위스 전역의 참가자들이 참여할 수 있도록 하였다.
  • 참가자들은 주어진 표준 독일어 문장을 자신의 지역 스위스 독일어 방언으로 읽도록 요청받았으며, 이로 인해 언어 다양성과 실제 방언의 다양성이 보장되었다.
  • 녹음 자료는 다른 참가자들이 검토하여 데이터 품질을 확보하고 번역 및 정렬 오류를 줄였다.
  • 코퍼스는 음성과 텍스트 간 자동 정렬을 통해 구성되었으며, 참가자의 방언, 연령, 성별에 대한 메타데이터가 포함되어 있다.
  • 기준 모델은 FAIRSEQ S2T 라이브러리의 Transformer 기반 아키텍처를 사용하여 훈련되었으며, 하이퍼파라미터는 기본값으로 설정되었다.
  • 436,000시간 분량의 다국어 비라벨 음성 데이터로 사전 훈련된 XLS-R Wav2vec 모델을 SDS-200 데이터셋에 대해 미세조정하여 자기지도 학습의 이점 평가를 수행하였다.

실험 결과

연구 질문

  • RQ1공개적으로 수집된, 방언적으로 다양성이 확보된 말하기-텍스트 코퍼스는 스위스 독일어 말하기 번역 성능 향상에 기여할 수 있는가?
  • RQ2대규모 비라벨 음성 데이터에서 자기지도 학습을 수행하면 저자원 스위스 독일어 말하기 번역 성능이 어떻게 향상되는가?
  • RQ3기존 코퍼스(SPC 등)와 SDS-200을 결합할 경우 모델의 일반화 능력과 성능은 어느 정도 향상되는가?
  • RQ4SDS-200의 방언 커버리지가 스위스 캔톤 전역의 실제 언어 분포와 얼마나 유사한가?
  • RQ5참가자의 인구통계적 다양성(연령, 성별, 방언)은 말하기 번역에서 모델의 강건성과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • 기준 Transformer 모델은 단독으로 SDS-200 코퍼스에 훈련된 경우 테스트 세트에서 30.3의 단어 오류율(WER)과 53.1의 BLEU 점수를 기록하였다.
  • XLS-R (0.3B) 모델을 SDS-200에 대해 미세조정함으로써 WER는 21.6으로 감소하고 BLEU 점수는 64.0으로 상승하여, 사전 훈련 데이터에 스위스 독일어가 포함되지 않았음에도 불구하고 자기지도 학습의 이점이 입증되었다.
  • 코퍼스는 넓은 범위의 스위스 독일어 방언을 커버하고 있으며, 바이스 및 취리히 캔톤에서 강력한 표현이 이루어졌고, 일부 지역에서 개인 참가자의 기여도가 두드러졌다.
  • 코퍼스에는 약 3,816명의 고유 참가자로부터 142,545개의 발화가 포함되어 있으며, 참가자의 86%는 성별을 공개하지 않았고, 4명의 참가자는 비이원성으로 식별되었다.
  • 코퍼스에는 138,553개의 고유 문장과 41,289개의 독일어 어휘가 포함되어 있어 다양한 언어적 내용과 어휘 및 문법의 광범위한 커버리지를 지원한다.
  • 본 연구는 공개 데이터 수집와 검증 메커니즘을 조합함으로써 저자원 언어를 위한 고품질, 확장 가능하고 언어적으로 대표적인 음성 자원을 생성할 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.