Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Lingual Machine Speech Chain for Javanese, Sundanese, Balinese, and Bataks Speech Recognition and Synthesis

Sashi Novitasari, Andros Tjandra|arXiv (Cornell University)|2020. 11. 04.
Natural Language Processing Techniques참고 문헌 2인용 수 12
한 줄 요약

이 논문은 단지 단일 언어의 인도네시아어 ASR/TTS를 기반으로 하여, 자바어, 수다네시어, 발리어, 바타크어와 같은 저자원 인도네시아 소수민족 언어에 대해 종단 간 자동 음성 인식(ASR)과 음성 합성(TTS)을 가능하게 하는 교차 언어 음성 체인 프레임워크를 제안한다. 목표 언어의 쌍화된 음성-텍스트 데이터가 필요로 하지 않고, ASR와 TTS 간에 반복적인 준감독 피드백 루프를 활용함으로써, 최소한의 감독 아래 효과적인 모델 훈련을 달성하며, 멸종 위험에 처한 언어의 음성 기술 발전을 크게 이끌어낸다.

ABSTRACT

Even though over seven hundred ethnic languages are spoken in Indonesia, the available technology remains limited that could support communication within indigenous communities as well as with people outside the villages. As a result, indigenous communities still face isolation due to cultural barriers; languages continue to disappear. To accelerate communication, speech-to-speech translation (S2ST) technology is one approach that can overcome language barriers. However, S2ST systems require machine translation (MT), speech recognition (ASR), and synthesis (TTS) that rely heavily on supervised training and a broad set of language resources that can be difficult to collect from ethnic communities. Recently, a machine speech chain mechanism was proposed to enable ASR and TTS to assist each other in semi-supervised learning. The framework was initially implemented only for monolingual languages. In this study, we focus on developing speech recognition and synthesis for these Indonesian ethnic languages: Javanese, Sundanese, Balinese, and Bataks. We first separately train ASR and TTS of standard Indonesian in supervised training. We then develop ASR and TTS of ethnic languages by utilizing Indonesian ASR and TTS in a cross-lingual machine speech chain framework with only text or only speech data removing the need for paired speech-text data of those ethnic languages.

연구 동기 및 목표

  • 제한된 음성-텍스트 데이터가 있는 상황에서 멸종 위험에 처한 인도네시아 소수민족 언어에 대한 음성 기술의 심각한 부족을 해결한다.
  • 자바어, 수다네시어, 발리어, 바타크어와 같은 저자원 언어에 대해 대규모 쌍화된 음성 및 텍스트 데이터가 필요로 하는 장벽을 극복한다.
  • 단일 언어 데이터만을 사용하여 ASR 및 TTS 구성 요소 간 상호 준감독 학습을 가능하게 하는 교차 언어 기계 음성 체인을 개발한다.
  • 말하기-말하기 번역을 가능하게 하여 인도네시아의 언어 다양성을 보존하고 증진한다.

제안 방법

  • 가용한 쌍화된 음성-텍스트 데이터를 기반으로 감독 학습을 통해 표준 인도네시아어의 ASR 및 TTS 모델을 사전 훈련한다.
  • 교차 언어 전이 학습 프레임워크를 통해 사전 훈련된 인도네시아어 ASR 및 TTS 모델을 목표 소수민족 언어에 적응시킨다.
  • ASR(청취)와 TTS(발화) 구성 요소가 반복적으로 상호 보완하는 비감독 방식의 폐쇄 루프 피드백 메커니즘을 갖춘 기계 음성 체인을 구현한다.
  • 목표 언어에 대해 음성-텍스트 쌍화된 데이터가 필요 없도록, 오직 텍스트 전용 또는 음성 전용 데이터만을 사용한다.
  • 피드백 루프 내 이산 음성 토큰을 통해 기울기 역전파를 수행하기 위해 직선 추정기(straight-through estimator)를 적용하여 종단 간 훈련을 수행한다.
  • 인도네시아어와 소수민족 언어 간 공유되는 언어적 구조와 발음 유사성을 활용하여 제로샷 전이 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1쌍화된 음성-텍스트 데이터가 없는 조건에서 교차 언어 기계 음성 체인 프레임워크가 저자원 인도네시아 소수민족 언어의 ASR 및 TTS를 효과적으로 훈련시킬 수 있는가?
  • RQ2준감독 피드백 루프 내에서 ASR과 TTS 간의 상호 작용은 목표 언어의 모델 성능을 어떻게 향상시키는가?
  • RQ3단일 언어의 인도네시아어 ASR 및 TTS 모델이 소수민족 언어로의 제로샷 또는 피셔샷 적응에 강력한 사전 지식로 기능할 수 있는 정도는 어느 정도인가?
  • RQ4텍스트 또는 음성 전용 데이터만을 사용할 경우, 자바어, 수다네시어, 발리어, 바타크어의 최종 ASR 및 TTS 성능에 어떤 영향을 미치는가?

주요 결과

  • 교차 언어 기계 음성 체인 프레임워크는 목표 언어에 대해 쌍화된 음성-텍스트 데이터가 전혀 없이도 인도네시아어 단일 언어 데이터만을 사용하여 자바어, 수다네시어, 발리어, 바타크어의 ASR 및 TTS를 성공적으로 구현하였다.
  • ASR와 TTS 간의 피드백 루프는 제한된 감독 아래에서도 준감독 학습을 통해 모델 성능을 크게 향상시켰다.
  • 쌍화된 훈련 데이터가 없는 상황에서도 경쟁력 있는 단어 오류율(WER)과 자연스러움 점수를 달성하였다.
  • 이 방법은 인도네시아어에서 소수민족 언어로의 강력한 제로샷 전이 능력을 보였으며, 교차 언어 적응의 효과성을 입증하였다.
  • 비용이 많이 드는 데이터 수집에 대한 의존도를 감소시켜, 자원이 극히 제한된 멸종 위험에 처한 언어에 대해서도 음성 기술 개발이 가능하게 하였다.
  • 결과는 다국어 저자원 음성 처리를 위한 통합 음성 체인의 타당성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.