Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Modal Data Augmentation for End-to-End ASR

Adithya Renduchintala, Shuoyang Ding|arXiv (Cornell University)|2018. 03. 27.
Speech Recognition and Synthesis참고 문헌 26인용 수 5
한 줄 요약

이 논문은 대규모 텍스트 코퍼스를 활용하여 성능을 향상시키기 위해 청각 입력과 합성 기호 입력(예: 음소 시퀀스)을 함께 훈련하는 엔드 투 엔드 ASR 프레임워크인 다중모달 데이터 증강(MMDA)을 제안한다. 청각 및 기호 인코더 간에 주의 메커니즘과 디코더 컴ponent를 공유함으로써 MMDA는 기준 모델 대비 최대 10% 상대적 WER 향상을 달성하며, 특히 음소 지속 시간을 모델링하는 Rep-Phonestream 증강 기법에서 뛰어난 성능을 보인다.

ABSTRACT

We present a new end-to-end architecture for automatic speech recognition (ASR) that can be trained using \emph{symbolic} input in addition to the traditional acoustic input. This architecture utilizes two separate encoders: one for acoustic input and another for symbolic input, both sharing the attention and decoder parameters. We call this architecture a multi-modal data augmentation network (MMDA), as it can support multi-modal (acoustic and symbolic) input and enables seamless mixing of large text datasets with significantly smaller transcribed speech corpora during training. We study different ways of transforming large text corpora into a symbolic form suitable for training our MMDA network. Our best MMDA setup obtains small improvements on character error rate (CER), and as much as 7-10\% relative word error rate (WER) improvement over a baseline both with and without an external language model.

연구 동기 및 목표

  • 제한된 음성 데이터셋에서 엔드 투 엔드 ASR 성능을 향상시키기 위해 대규모 텍스트 코퍼스를 활용하는 것.
  • Librispeech 및 Fisher와 같은 작은 벤치마크에서 엔드 투 엔드 모델과 전통적 시스템 간의 성능 격차를 해소하는 것.
  • 텍스트를 청각 특징을 모방하는 기호 입력으로 변환함으로써 ASR에서 다중모달 데이터 증강을 탐색하는 것.
  • 디코딩 절차를 수정하지 않고도 외부 언어 모델을 MMDA 프레임워크에 원활하게 통합할 수 있도록 하는 것.
  • 합성 기호 입력이 엔드 투 엔드 ASR의 강인성과 일반화 능력을 향상시킬 수 있는지 조사하는 것.

제안 방법

  • MMDA 모델은 청각 특징용 및 기호 입력(예: 문자 또는 음소 시퀀스)용 두 개의 별도 인코더를 사용하며, 둘 다 동일한 주의 메커니즘과 디코더를 공유한다.
  • 기호 입력은 세 가지 방법으로 생성된다: Charstream(원시 문자), Phonestream(음성-문자 변환(G2P)을 통한 음소), Rep-Phonestream(실제 음성 통계 기반의 음소 지속 시간 모델링).
  • 증강 인코더는 임bed된 기호 토큰을 처리하고 공유 주의 메커니즘을 통해 청각 표현과 융합되는 문맥 표현을 생성한다.
  • 쌍체 데이터를 기반으로 다중태스크 훈련이 수행되며, 실제 음성-번역 쌍과 합성 텍스트-합성 입력 쌍을 1:1 비율로 사용한다.
  • 디코딩 중에 외부 언어 모델과의 통합이 가능하여 아키텍처 변경 없이도 성능 향상을 이끌 수 있다.
  • 표준 비트 서치나 디코딩 파이프라인을 수정하지 않고도 출력 시퀀스에 대해 교차 엔트로피 손실을 사용해 엔드 투 엔드로 훈련된다.
(a)
(a)

실험 결과

연구 질문

  • RQ1제한된 음성 데이터와 함께 대규모 텍스트 코퍼스에서 파생된 기호 입력이 엔드 투 엔드 ASR 성능을 향상시킬 수 있는가?
  • RQ2합성 입력이 실제 청각 특징과 유사할수록 ASR 성능에 어떤 영향을 미치는가?
  • RQ3기호 입력을 통한 다중모달 데이터 증강이 비어 있는 단어(예: 'casino' 대신 'accino')를 생성하는 오류 유형을 줄일 수 있는가?
  • RQ4외부 언어 모델과 MMDA를 효과적으로 조합하여 WER 및 CER를 추가로 향상시킬 수 있는가?
  • RQ5합성 입력 표현 방식의 선택(예: Charstream 대비 Rep-Phonestream)이 모델의 일반화 능력과 오류 패턴에 어떤 영향을 미치는가?

주요 결과

  • Rep-Phonestream 증강 기법은 WSJ 영어 데이터셋에서 기준 모델 대비 2% 절대적 WER 향상과 10% 상대적 WER 향상을 달성했으며, Charstream 및 Phonestream보다 뛰어난 성능을 보였다.
  • MMDA 모델은 WSJ 개발/테스트 세트에서 낭만어 오류를 25% 감소시켰다(기준 모델 대비 32.93%에서 20.25%로), 이는 더 나은 일반화 능력을 의미한다.
  • 외부 언어 모델을 통합한 Rep-Phonestream MMDA 시스템은 WSJ 평가 세트에서 CER 6.7%, WER 16.0%를 기록했으며, 기준 모델 대비 10% 상대적 WER 향상을 달성했다.
  • 이탈리아어(Voxforge) 및 스페인어(HUB4)에서 MMDA는 Rep-Phonestream를 사용해 각각 WER을 2.9 및 2.0 포인트 감소시켜 다양한 언어에서 일관된 성능 향상을 보였다.
  • MMDA 시스템은 잘못된 단어를 전체적으로 유효한 단어로 교체하는 경향이 있다(예: 'quota' → 'colors'), 반면 기준 모델은 일반적으로 문자 수준의 치환으로 비어 있는 단어를 생성한다.
  • MMDA와 RNNLM 재평가의 조합은 낭만어 오류를 20.25%로 줄였으며, 두 방법 간의 상호보완적 효과를 시사한다.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.