Skip to main content
QUICK REVIEW

[논문 리뷰] Speech-to-Speech Translation For A Real-world Unwritten Language

Peng‐Jen Chen, Kevin Tran|arXiv (Cornell University)|2022. 11. 11.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 인간이 주석을付けた 데이터, 가짜 레이블이 부여된 약한 지도 학습 데이터, 그리고 채굴된 병렬 음성 데이터를 조합하여, 글이 없는 언어인 대만 훈련어로의 영어에서 대만 훈련어로의 엔드 투 엔드 음성-음성 번역(S2ST) 시스템을 처음으로 제안한다. 이는 문맥적 지도를 위해 중국어를 텍스트 기반 보조 수단으로 활용함으로써 최신 기술 수준의 성능을 달성하였으며, 글이 없는 언어를 위한 저자원 S2ST 연구를 촉진하기 위해 60시간 분량의 기준 데이터셋을 공개한다.

ABSTRACT

We study speech-to-speech translation (S2ST) that translates speech from one language into another language and focuses on building systems to support languages without standard text writing systems. We use English-Taiwanese Hokkien as a case study, and present an end-to-end solution from training data collection, modeling choices to benchmark dataset release. First, we present efforts on creating human annotated data, automatically mining data from large unlabeled speech datasets, and adopting pseudo-labeling to produce weakly supervised data. On the modeling, we take advantage of recent advances in applying self-supervised discrete representations as target for prediction in S2ST and show the effectiveness of leveraging additional text supervision from Mandarin, a language similar to Hokkien, in model training. Finally, we release an S2ST benchmark set to facilitate future research in this field. The demo can be found at https://huggingface.co/spaces/facebook/Hokkien_Translation .

연구 동기 및 목표

  • 글이 없는 표준 문법 체계가 없는 언어인 대만 훈련어로의 저자원, 엔드 투 엔드 S2ST 시스템을 개발하기 위해.
  • 글이 없는 언어에 대해 병렬 음성 데이터 부족 문제를 해결하기 위해 인간 주석, 가짜 레이블링, 그리고 비주얼되지 않은 음성 데이터에서의 채굴을 조합하여 데이터를 생성하기 위해.
  • 저자원 S2ST에서 관련된 문맥적 글자 언어인 중국어를 데이터 생성 및 모델 훈련에 활용함으로써 효과적인지 평가하기 위해.
  • 향후 연구를 가능하게 하기 위해 공개 기준 데이터셋과 평가 모델을 제공하기 위해.

제안 방법

  • 타겟 대만 훈련어 음성에서 이산 단위를 추출하기 위해 HuBERT 기반의 자기지도 학습 음성 인코더를 사용하여 단위-웨이브포맷 생성을 가능하게 하였다.
  • 모델 일반화를 향상시키기 위해 실제 대만 훈련어 음성 데이터를 사용하여 음성 정규화를 적용하였다.
  • 비주얼되지 않은 영어 및 대만 훈련어 음성 쌍에서의 데이터 채굴을 가능하게 하기 위해 영어와 대만 훈련어 간의 공동 임베딩 공간을 중국어를 통해 구축하였다.
  • 이중 단계 S2ST 모델을 훈련: 하나는 단일 단계 음성-단위 번역(S2UT)을 사용하고, 다른 하나는 중국어 텍스트 지도를 활용한 이중 단계 디코딩을 사용하였다.
  • 채굴된 영어-대만 훈련어 음성 쌍에서 중국어 S2T를 통한 가짜 레이블링을 통해 약한 지도 학습 데이터를 생성하였다.
  • 인간 주석, 약한 지도 학습, 채굴된 데이터를 결합하여 UnitY 기반 S2ST 모델을 훈련하였으며, 유사도 점수 기반 필터링을 통해 데이터 품질을 향상시켰다.

실험 결과

연구 질문

  • RQ1글이 없는 언어인 대만 훈련어와 같이 병렬 데이터가 제한된 상황에서 엔드 투 엔드 S2ST 시스템을 효과적으로 훈련시킬 수 있는가?
  • RQ2유사한 문맥적 글자 언어인 중국어를 활용하여 저자원 S2ST에서 데이터 생성 및 모델 훈련을 얼마나 효과적으로 향상시킬 수 있는가?
  • RQ3비주얼되지 않은 코퍼스에서 병렬 음성 데이터를 채굴하는 것이 약한 지도 학습 및 인간 주석 데이터와 결합되었을 때 S2ST 성능을 얼마나 향상시키는가?
  • RQ4실제 타겟 언어 음성 데이터를 사용한 음성 정규화가 저자원 S2ST에서 합성 기반 기준 방법보다 더 우수한 성능을 보일 수 있는가?
  • RQ5채굴된 데이터의 품질과 도메인 불일치가 S2ST 시스템 성능에 미치는 영향은 어느 정도인가?

주요 결과

  • UnitY 모델은 197시간의 채굴된 S2ST 데이터를 사용할 때 4.5 BLEU 포인트 향상된 성능을 기록하여, 저자원 환경에서 노이즈가 있는 가짜 레이블 데이터의 가치를 입증하였다.
  • 4.7천 시간의 채굴된 대만 훈련어→영어 S2T 데이터를 인간 주석 데이터와 결합하여 BLEU 점수를 3.6 포인트 향상시켰지만, 더 큰 데이터량에서는 도메인 불일치로 인해 성능 향상 폭이 감소하였다.
  • 인간 주석, 약한 지도 학습, 채굴된 데이터의 조합은 인간 주석 및 약한 지도 학습 데이터만을 사용한 경우보다 1.6 BLEU 포인트 향상된 성능을 기록하여, 이들의 누적 효과를 입증하였다.
  • 중국어 텍스트 지도를 활용한 이중 단계 디코딩 전략은 단일 단계 S2UT를 능가하는 성능을 기록하였으며, En→Hokkien 작업에서 7.8 BLEU를 달성하여 추가적인 텍스트 지도의 강력한 기여를 확인하였다.
  • 기준 데이터셋(인간 주석 데이터 60시간 포함)과 평가 모델이 성공적으로 공개되어 향후 글이 없는 언어의 S2ST 연구를 지원하였다.
  • 중국어 S2T를 통한 가짜 레이블링은 효과적인 데이터 증강을 제공하여, 약한 지도 학습 모델과 완전 지도 학습 모델 간의 성능 격차를 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.