Skip to main content
QUICK REVIEW

[논문 리뷰] Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion

Suyoun Kim, Siddharth Dalmia|arXiv (Cornell University)|2019. 06. 27.
Speech Recognition and Synthesis참고 문헌 44인용 수 11
한 줄 요약

이 논문은 복수의 발화 문장을 통한 대화 맥락 표현을 향상시키기 위해 사전 훈련된 단어(fastText) 및 문장(BERT) 임베딩을 통합한 게이팅(end-to-end) 음성 인식 모델을 제안한다. 음성, 단어, 맥락 임베딩 간의 게이팅 메커니즘을 활용한 융합을 통해, Switchboard에서는 15%의 상대적 WER 향상, CallHome에서는 5%의 상대적 WER 향상을 달성하여 장기 대화 이해에서 표준 엔드 투 엔드 모델을 능가한다.

ABSTRACT

We present a novel conversational-context aware end-to-end speech recognizer based on a gated neural network that incorporates conversational-context/word/speech embeddings. Unlike conventional speech recognition models, our model learns longer conversational-context information that spans across sentences and is consequently better at recognizing long conversations. Specifically, we propose to use the text-based external word and/or sentence embeddings (i.e., fastText, BERT) within an end-to-end framework, yielding a significant improvement in word error rate with better conversational-context representation. We evaluated the models on the Switchboard conversational speech corpus and show that our model outperforms standard end-to-end speech recognition models.

연구 동기 및 목표

  • 다양한 발화 문장을 포함한 장기 대화 환경에서 엔드 투 엔드 음성 인식 성능을 향상시키기 위해 다발화 맥락을 통합하는 것.
  • 사전 훈련된 텍스트 임베딩(fastText, BERT)을 활용하여 음성 인식에서 더 나은 맥락 표현을 달성하는 것.
  • 음성, 단어, 대화 맥락 임베딩을 효과적으로 융합하기 위한 게이팅 메커니즘 설계.
  • 대규모 레이블링된 음성 데이터셋에 대한 의존도를 줄이고 일반화 능력을 향상시키기 위해 텍스트 전용 데이터를 통한 공동 훈련을 탐색하는 것.
  • 발화 이력 길이와 샘플링 전략이 맥락 표현 품질에 미치는 영향을 평가하는 것.

제안 방법

  • 자음 출력을 가지는 통합 CTC/Attention 기반 인코더-디코더 아키텍처를 사용하여 엔드 투 엔드 음성 인식을 수행한다.
  • 맥락 모델링을 위해 디코더의 입력으로 외부 사전 훈련된 단어 및 문장 임베딩(fastText, BERT)을 통합한다.
  • 음성, 단어, 맥락 임베딩 간의 곱셈 상호작용을 수행하는 맥락 기반 게이팅 메커니즘을 도입하여 기여도를 동적으로 가중한다.
  • 발화 수준의 샘플링 전략—정답 또는 모델이 생성한 가설에서 이전 발화를 선택하는 방식—을 적용하여 과적합을 줄이고 일반화 능력을 향상시킨다.
  • 레이블링된 음성-텍스트 쌍과 텍스트 전용 데이터를 모두 활용하여 사전 훈련 및 공동 미세조정을 통해 맥락 학습 능력을 향상시킨다.
  • 대화 거리 점수를 평가하기 위해 BERT 문장 임베딩을 오라클로 사용하여 연속된 가설 간의 일관성 수준을 측정한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 텍스트 임베딩(fastText, BERT)이 엔드 투 엔드 음성 인식에서 대화 맥락 표현을 향상시킬 수 있는가?
  • RQ2이전 발화의 수와 샘플링 전략이 맥락 인식 기반 음성 인식 성능에 어떤 영향을 미치는가?
  • RQ3게이팅 융합 메커니즘이 음성, 단어, 대화 맥락 임베딩을 효과적으로 융합하여 정확도를 향상시키는가?
  • RQ4레이블링된 음성 데이터가 제한된 상황에서 텍스트 전용 데이터를 통한 공동 훈련이 모델 성능을 얼마나 향상시킬 수 있는가?
  • RQ5기준 모델 대비 모델이 인접한 발화 간의 대화 일관성을 얼마나 잘 유지하는가?

주요 결과

  • 제안된 모델은 기준 엔드 투 엔드 모델 대비 Switchboard 코퍼스에서 15%의 상대적 WER 감소를 달성한다.
  • CallHome 서브셋에서는 5%의 상대적 WER 향상을 보이며, 대화형 음성 인식에서 일관된 성능 향상을 입증한다.
  • 20%의 발화 샘플링 비율—이전 발화를 모델의 출력에서 부분적으로 샘플링하는 방식—에서 개발 세트 정확도가 최고를 기록하여 일반화 능력 향상의 증거가 된다.
  • BERT 임베딩 유사도로 측정한 대화 거리 기준으로, 모델의 가설은 기준 번역문과 7.4% 상대적으로 더 가까운 편이다. 이는 더 나은 맥락 일관성을 의미한다.
  • 외부 임베딩(fastText, BERT)과 게이팅 메커니즘의 조합은 이러한 통합이 없는 모델보다 훨씬 우수한 맥락 표현을 가능하게 한다.
  • 모델은 장기 대화에 잘 일반화되며, 대화 시스템 및 감성 분석과 같은 다른 맥락 민감성 음성 작업으로도 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.