Skip to main content
QUICK REVIEW

[논문 리뷰] Code-Switching without Switching: Language Agnostic End-to-End Speech Translation

Christian Huber, Enes Yavuz Ugan|arXiv (Cornell University)|2022. 10. 04.
Speech Recognition and Synthesis인용 수 8
한 줄 요약

이 논문은 언어를 구분하지 않고 음성 인식과 번역을 하나의 통합된 시스템으로 통합하는 언어에 구애받지 않는 엔드 투 엔드 음성 번역(LAST) 모델을 제안한다. 언어 식별 또는 파이프라인 처리가 필요 없도록 설계되었으며, 명시적인 언어 태그 없이 多국어 음성 입력으로 훈련함으로써 단일 목표 언어로의 번역 성능는 유사한 수준을 유지하면서 지연 시간을 줄이고 코드 스위칭(CS)에 대한 강건성을 향상시켰다. 문장 간 코드 스위칭에서 7.3 BLEU 향상과 데이터 증강을 통해 추가로 3.3 BLEU 향상된 성과를 기록하였다.

ABSTRACT

We propose a) a Language Agnostic end-to-end Speech Translation model (LAST), and b) a data augmentation strategy to increase code-switching (CS) performance. With increasing globalization, multiple languages are increasingly used interchangeably during fluent speech. Such CS complicates traditional speech recognition and translation, as we must recognize which language was spoken first and then apply a language-dependent recognizer and subsequent translation component to generate the desired target language output. Such a pipeline introduces latency and errors. In this paper, we eliminate the need for that, by treating speech recognition and translation as one unified end-to-end speech translation problem. By training LAST with both input languages, we decode speech into one target language, regardless of the input language. LAST delivers comparable recognition and speech translation accuracy in monolingual usage, while reducing latency and error rate considerably when CS is observed.

연구 동기 및 목표

  • 언어 식별 및 별도의 인식/번역 파이프라인 없이도 코드 스위칭 문제를 해결하기 위해.
  • 입력 언어에 관계없이 다국어 음성을 단일 목표 언어로 디코딩할 수 있는 통합형 엔드 투 엔드 모델을 개발하기 위해.
  • 대규모 애너테이션된 코드 스위칭 데이터셋이 필요 없이 문장 간 코드 스위칭에서의 성능 향상 달성하기 위해.
  • 다중 단계 시스템을 단일 통합 모델로 대체함으로써 구현을 단순화하고 지연 시간을 줄이기 위해.
  • 말문자리 연결을 통한 데이터 증강 기법이 코드 스위칭 일반화 능력 향상에 미치는 영향 평가하기 위해.

제안 방법

  • 두 언어의 단일 언어 음성 데이터로 단일 엔드 투 엔드 트랜스포머 기반 인코더-디코더 모델을 훈련하여, 어떤 입력 음성이라도 단일 목표 언어로 디코딩할 수 있도록 하였다.
  • 다른 원천 언어의 음성과 번역문을 연결하여 새로운 훈련 발화를 생성하는 데이터 증강 전략을 사용하여 코드 스위칭를 시뮬레이션하였다.
  • 일관된 비율(5%에서 75%까지)을 다양하게 적용하여 증강 전략이 모델 일반화 및 강건성에 미치는 영향을 분석하였다.
  • 문장 간 코드 스위칭을 포함한 커스터마이즈된 테스트 세트(tst-inter)에서 성능을 평가하였으며, 언어 식별 및 별도의 ASR/ST 모델 기반 베이스라인과 비교하였다.
  • 모델의 단순성 유지 및 인식과 번역의 공동 최적화를 위해 공유된 인코더 및 디코더 아키텍처를 적용하였다.
  • 명시적인 언어 태그나 언어별 특화 구성 요소 없이 혼합 언어 입력을 처리할 수 있는 모델의 능력을 활용하였다.

실험 결과

연구 질문

  • RQ1단일 엔드 투 엔드 음성 번역 모델이 언어 식별 없이도 단일 언어 음성에서 경쟁 가능한 성능을 내며 코드 스위칭을 처리할 수 있는가?
  • RQ2다국어 음성 입력으로 훈련할 경우, 파이프라인 기반 접근 방식에 비해 문장 간 코드 스위칭에 대해 얼마나 더 강건한가?
  • RQ3말문자리 연결을 통한 데이터 증강 기법이 언어에 구애받지 않는 모델의 코드 스위칭 일반화 능력 향상에 어느 정도 기여하는가?
  • RQ4기존의 다단계 ASR+ST 파이프라인에 비해 통합 모델이 지연 시간과 복잡성을 얼마나 줄이는가?
  • RQ5훈련 중에 이러한 데이터가 사용되지 않았음에도 불구하고, 모델은 문장 내 코드 스위칭에서 어떤 성능을 보이는가?

주요 결과

  • LAST는 베이스라인 모델과 유사한 수준의 자동 음성 인식(ASR) 및 음성 번역(ST) 성능를 단일 언어 테스트 세트에서 확보하였다.
  • 문장 간 코드 스위칭 테스트 세트(tst-inter)에서 LAST는 인간 애너테이션된 언어 식별 및 별도의 ASR 또는 ST 모델 기반 베이스라인보다 7.3 BLEU 향상되었다.
  • 데이터 증강 전략은 기본 LAST 모델 대비 tst-inter에서 3.3 BLEU 향상시켰으며, 이로 인해 총 10.6 BLEU의 성능 향상이 이루어졌다.
  • 훈련 데이터의 절반만으로도 LAST 모델이 tst-inter에서 기존 모델과 거의 유사한 성능를 기록하였으며, 이는 성능 향상이 데이터 양이 아닌 맥락 모델링에 기인함을 시사한다.
  • 언어 식별 및 파이프라인 라우팅이 필요 없어지면서 낮은 지연 시간을 유지하고 구현을 단순화하였다.
  • 정성적 분석 결과, 문장 내 코드 스위칭에서는 성능 향상이 없었으며, 이는 훈련 데이터에 해당 유형의 데이터가 포함되지 않았기 때문으로 보이며, 향후 연구가 필요한 분야임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.