Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Sequence Transduction by Jointly Predicting Tokens and Durations

Xu H, Fei Jia|arXiv (Cornell University)|2023. 04. 13.
Speech Recognition and Synthesis인용 수 6
한 줄 요약

이 논문은 추론 중에 프레임 스킵을 가능하게 하여 더 빠른 디코딩을 가능하게 하는 새로운 시퀀스-투-시퀀스 아키텍처인 토큰 및 지속시간 트랜스듀서(TDT)를 제안한다. TDT는 음성 인식, 음성 번역, 의도 분류 작업 전반에서 기존의 RNN-트랜스듀서보다 최대 2.82배 빠른 추론 속도와 향상된 정확도를 달성하며, 반복적인 토큰 시퀀스에 대해 더 높은 강인성도 보여준다.

ABSTRACT

This paper introduces a novel Token-and-Duration Transducer (TDT) architecture for sequence-to-sequence tasks. TDT extends conventional RNN-Transducer architectures by jointly predicting both a token and its duration, i.e. the number of input frames covered by the emitted token. This is achieved by using a joint network with two outputs which are independently normalized to generate distributions over tokens and durations. During inference, TDT models can skip input frames guided by the predicted duration output, which makes them significantly faster than conventional Transducers which process the encoder output frame by frame. TDT models achieve both better accuracy and significantly faster inference than conventional Transducers on different sequence transduction tasks. TDT models for Speech Recognition achieve better accuracy and up to 2.82X faster inference than conventional Transducers. TDT models for Speech Translation achieve an absolute gain of over 1 BLEU on the MUST-C test compared with conventional Transducers, and its inference is 2.27X faster. In Speech Intent Classification and Slot Filling tasks, TDT models improve the intent accuracy by up to over 1% (absolute) over conventional Transducers, while running up to 1.28X faster. Our implementation of the TDT model will be open-sourced with the NeMo (https://github.com/NVIDIA/NeMo) toolkit.

연구 동기 및 목표

  • 기존 RNN-트랜스듀서의 순차적 추론으로 인한 높은 계산 비용 문제를 해결하기 위해 추론 중에 프레임 스킵을 가능하게 하는 것.
  • 기존 RNN-트랜스듀서에서 알려진 실패 모드인 반복적인 토큰 시퀀스에 대한 모델 강인성을 향상시키는 것.
  • 토큰과 지속시간 예측을 위한 미분 가능한 훈련 프레임워크를 개발하고 분석적 기울기 계산을 가능하게 하는 것.
  • 다양한 시퀀스 변환 작업 전반에서 정확도와 추론 속도 양면에서 일관된 성능 향상을 입증하는 것.

제안 방법

  • TDT는 표준 RNN-트랜스듀서를 확장하여 토큰과 지속시간에 대해 별도의 분포를 출력하는 공동 네트워크를 도입하며, 양측 모두 독립적으로 정규화된다.
  • 추론 중에 예측된 지속시간에 따라 몇 개의 입력 프레임을 스킵할지 결정함으로써 디코딩 단계 수를 줄인다.
  • 전진-역행 알고리즘을 확장하여 토큰 및 지속시간 예측에 대한 기울기를 계산함으로써 엔드 투 엔드 훈련을 가능하게 한다.
  • 함수 융합 기법을 활용하여 토큰 예측의 소프트맥스 이전 로그리트 기울기를 계산함으로써 훈련 안정성을 향상시킨다.
  • 공유된 인코더와 디코더를 사용하며, 공동 네트워크는 인코딩된 음성 특징과 디코더 상태를 입력으로 받는다.
  • 지속시간 예측은 입력 프레임 수에 대한 이산 확률 분포로 모델링되어 최적의 스킵 패턴 학습이 가능하다.

실험 결과

연구 질문

  • RQ1토큰과 지속시간의 공동 예측이 정확도를 희생시키지 않고도 시퀀스 변환 모델의 추론 속도를 향상시킬 수 있는가?
  • RQ2디코딩 중에 프레임 스킵 기능을 제공함으로써 계산 비용을 줄일 수 있으며, 이로 인해 성능이 유지되거나 향상되는가?
  • RQ3TDT 아키텍처는 기존의 RNN-트랜스듀서에 비해 음성 인식, 음성 번역, 구두 언어 이해 작업에서 어떻게 성능을 내는가?
  • RQ4TDT는 음성 입력에서 반복적인 토큰 시퀀스로 인한 성능 저하를 어느 정도 완화하는가?
  • RQ5토큰 및 지속시간 헤드의 공동 훈련이 분석적 기울기 계산을 통해 효과적으로 최적화될 수 있는가?

주요 결과

  • TDT 모델은 음성 인식 작업에서 기존 RNN-트랜스듀서 대비 최대 2.82배 빠른 추론 속도를 달성하며, 정확도 또한 향상된다.
  • MUST-C 음성 번역 벤치마크에서 TDT 모델은 절대 BLEU 점수 1점 이상 향상되었고, 표준 트랜스듀서 대비 2.27배 더 빠르게 작동한다.
  • 음성 의도 분류 및 슬롯 채우기 작업에서는 TDT가 의도 정확도를 최대 1.28%p 향상시키며, 최대 1.28배 빠른 속도로 작동한다.
  • TDT 모델은 반복적인 토큰 시퀀스에 대해 크게 향상된 강인성을 보이며, 반복적인 숫자를 포함한 합성 데이터셋에서 WER를 RNN-T의 59.95%에서 5.78%로 감소시킨다.
  • TDT 모델의 공동 훈련 프레임워크는 토큰 및 지속시간 헤드 양쪽에 대해 분석적 기울기를 활용한 안정적인 최적화를 가능하게 한다.
  • TDT의 구현은 NeMo 툴킷에 오픈소스로 제공되어 보급 및 향후 연구를 촉진할 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.