Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Spoken Language Understanding using RNN-Transducer ASR.

Anirudh Raju, Gautam Tiwari|arXiv (Cornell University)|2021. 06. 30.
Speech Recognition and Synthesis참고 문헌 31인용 수 5
한 줄 요약

이 논문은 음성 인식(ASR) 모델과 신경망 자연어 이해(NLU) 모델을 미분 가능한 신경망 인터페이스를 통해 함께 훈련하는 종단간 음성 언어 이해(SLU) 시스템을 제안한다. 이는 다중 작업 및 의미 시퀀스 손실을 사용한 통합 최적화를 가능하게 하여 ASR 및 NLU 메트릭을 향상시킨다. 제안된 방법은 공개 및 기업 내부 SLU 데이터셋에서 전통적인 파이프라인 ASR-NLU 시스템과 직접 음성에서 의미로의 모델보다 우수한 성능을 보이며, 종단간 훈련을 통해 ASR와 NLU 성능을 동시에 향상시킨다.

ABSTRACT

We propose an end-to-end trained spoken language understanding (SLU) system that extracts transcripts, intents and slots from an input speech utterance. It consists of a streaming recurrent neural network transducer (RNNT) based automatic speech recognition (ASR) model connected to a neural natural language understanding (NLU) model through a neural interface. This interface allows for end-to-end training using multi-task RNNT and NLU losses. Additionally, we introduce semantic sequence loss training for the joint RNNT-NLU system that allows direct optimization of non-differentiable SLU metrics. This end-to-end SLU model paradigm can leverage state-of-the-art advancements and pretrained models in both ASR and NLU research communities, outperforming recently proposed direct speech-to-semantics models, and conventional pipelined ASR and NLU systems. We show that this method improves both ASR and NLU metrics on both public SLU datasets and large proprietary datasets.

연구 동기 및 목표

  • 파이프라인 ASR와 NLU 시스템의 한계를 극복하기 위해 오류 전파 문제와 공동 최적화 부족 문제를 해결한다.
  • ASR와 NLU 모듈 간의 미분 가능한 신경망 인터페이스를 통해 종단간 훈련을 가능하게 한다.
  • 비미분 가능한 SLU 평가 지표(예: 의도 정확도, 슬롯 F1)를 직접 최적화하기 위해 의미 시퀀스 손실을 도입함으로써 성능 향상을 도모한다.
  • ASR 및 NLU 분야의 최신 기술을 통합한 사전 훈련된 모델을 하나의 통합 프레임워크에 통합하여 성능을 극대화한다.
  • 다양한 SLU 벤치마크에서 기존의 파이프라인 시스템과 직접 음성에서 의미로의 모델보다 뛰어난 성능을 입증한다.

제안 방법

  • 시스템은 원시 음성 입력에서 텍스트를 생성하기 위해 스트리밍 순환 신경망 트랜듀서(RNNT)를 ASR 구성요소로 사용한다.
  • 신경망 자연어 이해(NLU) 모델은 RNNT가 생성한 텍스트를 처리하여 의도와 슬롯 레이블을 예측한다.
  • RNNT와 NLU 구성요소를 연결하는 미분 가능한 신경망 인터페이스를 통해 양 모듈 간 종단간 역전파가 가능해진다.
  • ASR를 위한 RNNT 손실과 NLU를 위한 의도 및 슬롯 예측 손실을 함께 사용하여 다중 작업 훈련을 수행함으로써 두 구성요소를 공동 최적화한다.
  • 비미분 가능한 SLU 평가 지표(예: 의도 정확도, 슬롯 F1)를 직접 최적화하기 위해 의미 시퀀스 손실을 도입한다.
  • ASR, NLU, 의미 시퀀스 손실을 조합하여 종단간 훈련을 수행함으로써 음성 이해의 통합 최적화를 실현한다.

실험 결과

연구 질문

  • RQ1ASR와 NLU 구성요소를 통합한 종단간 SLU 시스템이 기존의 파이프라인 ASR-NLU 시스템보다 ASR 및 NLU 메트릭 측면에서 우수한 성능을 보일 수 있는가?
  • RQ2ASR와 NLU 간의 미분 가능한 신경망 인터페이스 사용이 효과적인 종단간 훈련과 성능 향상에 기여하는가?
  • RQ3의미 시퀀스 손실의 도입이 비미분 가능한 SLU 평가 지표(예: 의도 정확도, 슬롯 F1)의 최적화를 향상시킬 수 있는가?
  • RQ4통합 모델이 ASR 및 NLU 연구 공동체에서 개발된 최신 사전 훈련된 모델을 얼마나 효과적으로 활용할 수 있는가?
  • RQ5제안된 종단간 프레임워크가 공개 및 대규모 기업 내부 SLU 데이터셋 모두에 잘 일반화되는가?

주요 결과

  • 제안된 종단간 SLU 시스템은 공개 SLU 데이터셋에서 기존의 파이프라인 ASR-NLU 시스템과 직접 음성에서 의미로의 모델보다 뛰어난 성능을 달성한다.
  • 다중 작업 및 의미 시퀀스 손실을 통한 공동 훈련이 ASR 및 NLU 메트릭에 측정 가능한 향상을 가져온다.
  • 통합 프레임워크 내에서 사전 훈련된 모델을 통합함으로써 최신 ASR 및 NLU 기술의 성과를 효과적으로 활용한다.
  • 의미 시퀀스 손실을 통해 비미분 가능한 SLU 평가 지표를 직접 최적화함으로써 실제 성능과의 일치도를 향상시킨다.
  • 공개 벤치마크와 대규모 기업 내부 데이터셋 모두에서 일관된 성능 향상이 나타나, 강력한 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.