Skip to main content
QUICK REVIEW

[논문 리뷰] Integration of Pre-trained Networks with Continuous Token Interface for End-to-End Spoken Language Understanding

Seunghyun Seo, Donghyun Kwak|arXiv (Cornell University)|2021. 04. 15.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 공통된 어휘와 연속 확률 분포를 활용하여 사전 훈련된 ASR 및 NLU 네트워크를 엔드 투 엔드로 통합할 수 있는 새로운 방법인 연속 토큰 인터페이스(CTI)를 제안한다. CTI는 Gumbel-Softmax와 같은 추가 모듈이 필요 없이 ASR 출력을 직접이고 미분 가능한 방식으로 NLU 모델에 융합할 수 있게 하여 SLURP에서 최고 성능을 기록한다: 의도 분류 정확도 82.93%, SLU-F1 71.12%. 더불어 합성 데이터를 활용하면 각각 86.92%와 74.66%로 향상된다.

ABSTRACT

Most End-to-End (E2E) SLU networks leverage the pre-trained ASR networks but still lack the capability to understand the semantics of utterances, crucial for the SLU task. To solve this, recently proposed studies use pre-trained NLU networks. However, it is not trivial to fully utilize both pre-trained networks; many solutions were proposed, such as Knowledge Distillation, cross-modal shared embedding, and network integration with Interface. We propose a simple and robust integration method for the E2E SLU network with novel Interface, Continuous Token Interface (CTI), the junctional representation of the ASR and NLU networks when both networks are pre-trained with the same vocabulary. Because the only difference is the noise level, we directly feed the ASR network's output to the NLU network. Thus, we can train our SLU network in an E2E manner without additional modules, such as Gumbel-Softmax. We evaluate our model using SLURP, a challenging SLU dataset and achieve state-of-the-art scores on both intent classification and slot filling tasks. We also verify the NLU network, pre-trained with Masked Language Model, can utilize a noisy textual representation of CTI. Moreover, we show our model can be trained with multi-task learning from heterogeneous data even after integration with CTI.

연구 동기 및 목표

  • 사전 훈련된 ASR 모델에만 의존하는 엔드 투 엔드 음성 언어 이해(E2E SLU) 시스템에서 발생하는 의미 이해 격차를 해결하기 위해.
  • 지식 정복, 공유 임베딩, 또는 이산 인터페이스와 같은 기존 통합 방법의 한계를 극복하기 위해 — 이러한 방법들은 사전 훈련된 표현을 떨어지게 하거나 복잡한 모듈을 필요로 한다.
  • 공통된 어휘 덕분에 최소한의 표현 갭을 유도하는 새로운 인터페이스를 통해 사전 훈련된 ASR 및 NLU 네트워크를 직접이고 미분 가능한 방식으로 융합할 수 있도록 하기 위해.
  • 의도 분류 및 슬롯 채우기 모두에서 도전적인 SLURP 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • ASR 및 NLU 네트워크를 동일한 어휘에서 사전 훈련함으로써 유도된 접합 표현인 연속 토큰 인터페이스(CTI)를 제안하며, 이는 ASR의 출력을 NLU 모델로 직접 전달할 수 있도록 한다.
  • ASR 네트워크의 소프트맥스 확률 분포를 NLU 모델의 노이즈 있는 텍스트 표현으로 사용하며, 이를 연속적이고 미분 가능한 입력으로 간주한다.
  • 공통된 어휘 덕분에 표현 갭이 최소화되어 이산 토크나이제이션 또는 미분 가능한 유도 기법(예: Gumbel-Softmax)이 필요 없도록 한다.
  • ASR 손실, SLU 손실(의도 및 슬롯), 그리고 NLU 사전 훈련 손실을 포함한 다중 태스크 손실을 사용하여 전체 E2E SLU 모델을 엔드 투 엔드로 훈련한다.
  • NLU 모델을 텍스트 전용 데이터에서 별도로 사전 훈련함으로써 언어적 능력을 유지할 수 있도록 한다.
  • SLURP-Synth 데이터 — 음성과 텍스트, 레이블가 짝지어진 합성된 데이터 — 를 활용하여 모델의 견고성과 성능을 더욱 향상시킨다.
(a)
(a)

실험 결과

연구 질문

  • RQ1Gumbel-Softmax와 같은 추가 모듈 없이도 사전 훈련된 ASR 및 NLU 네트워크를 통합할 수 있는 연속적이고 미분 가능한 인터페이스를 설계할 수 있는가?
  • RQ2노이즈 있는 ASR 출력을 입력으로 받을 때 제안된 CTI 인터페이스가 사전 훈련된 NLU 모델의 의미적 능력을 유지하는가?
  • RQ3지식 정복, 공유 임베딩, 또는 이산 인터페이스와 같은 기존 방법과 비교해 CTI 인터페이스의 성능 및 훈련 안정성은 어떠한가?
  • RQ4텍스트 전용 사전 훈련과 음성 데이터의 통합이 자원이 제한된 SLU 작업에서 일반화 능력과 성능을 향상시키는 데 기여하는가?
  • RQ5SLURP-Synth와 같은 합성 데이터를 사용할 경우, E2E SLU 모델의 견고성과 정확도는 어느 정도 향상되는가?

주요 결과

  • 제안된 CTI 기반 E2E SLU 모델은 SLURP 데이터셋에서 의도 분류 정확도 82.93%와 SLU-F1 점수 71.12%를 기록하여 최신 기술 수준(SOTA)을 달성한다.
  • NLU 사전 훈련 손실(L_NLU)을 추가하면 의도 분류 정확도가 0.54%p 향상되고 SLU-F1은 0.51%p 향상되어 CTI가 NLU 모델의 사전 훈련된 언어적 능력을 유지함을 확인한다.
  • 텍스트 전용 미세조정만을 사용해 SLURP-Synth 데이터를 적용하면 기준 모델 대비 의도 정확도가 2.5%p 향상된다.
  • SLURP-Synth 데이터를 전체 모델 훈련에 활용하면(음성, 텍스트, 레이블 포함) 의도 정확도는 86.92%로, SLU-F1은 74.66%로 상승하여 새로운 SOTA를 수립한다.
  • 동일한 조건에서 Gumbel-Softmax 기반 인터페이스보다 CTI 인터페이스가 의도 분류 정확도에서 0.83%p, SLU-F1에서 0.57%p 높은 성능을 기록한다.
  • 제거 실험 결과, NLU 모델이 CTI를 통해 노이즈 있는 연속적인 ASR 출력을 효과적으로 활용할 수 있음을 확인하여 인터페이스 설계의 견고성을 검증한다.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.