[논문 리뷰] Label-Synchronous Neural Transducer for End-to-End ASR
이 논문은 빈칸 토큰 예측을 제거하고, 자동회귀적 통합 및 화염(Autoregressive Integrate-and-Fire, AIF) 메커니즘을 통해 레이블 수준의 인코더 표현을 생성함으로써, 텍스트 전용 데이터를 사용한 예측 네트워크의 직접적 적응을 가능하게 하는 스트리밍 엔드 투 엔드 ASR 모델인 레이블-동기화 신경 트랜스듀서(LS-Transducer)를 제안한다. LS-Transducer는 도메인 간 설정에서 표준 신경 트랜스듀서 대비 최대 19%의 상대적 WER 감소를 달성하며, 내부 도메인 및 도메인 간 시나리오 모두에서 뚜렷한 성능 향상을 보인다.
Neural transducers provide a natural way of streaming ASR. However, they augment output sequences with blank tokens which leads to challenges for domain adaptation using text data. This paper proposes a label-synchronous neural transducer (LS-Transducer), which extracts a label-level encoder representation before combining it with the prediction network output. Hence blank tokens are no longer needed and the prediction network can be easily adapted using text data. An Auto-regressive Integrate-and-Fire (AIF) mechanism is proposed to generate the label-level encoder representation while retaining the streaming property. In addition, a streaming joint decoding method is designed to improve ASR accuracy. Experiments show that compared to standard neural transducers, the proposed LS-Transducer gave a 10% relative WER reduction (WERR) for intra-domain Librispeech-100h data, as well as 17% and 19% relative WERRs on cross-domain TED-LIUM2 and AESRC2020 data with an adapted prediction network.
연구 동기 및 목표
- 목표 도메인 레이블 데이터가 부족한 상황에서 엔드 투 엔드 ASR의 도메인 적응 문제를 해결하기 위해.
- 텍스트 전용 데이터를 사용한 언어 모델 적응을 방해하는 빈칸 토큰 예측을 제거하기 위해.
- 빈칸 토큰 생성에서 분리된 예측 네트워크가 독립적인 언어 모델로 기능할 수 있도록 하기 위해.
- 스트리밍 추론 능력을 유지하면서도 정렬 정확도를 향상시키고 음성 경계 오류에 대한 강건성을 높이기 위해.
- 지연 시간을 증가시키지 않으면서도 빔 서치 중에 검색 공간을 개선하는 스트리밍 공동 디코딩 방법을 설계하기 위해.
제안 방법
- LS-Transducer는 예측 네트워크 출력과 융합하기 전에 레이블 수준의 인코더 표현을 추출함으로써 빈칸 토큰 예측을 대체한다.
- 자동회귀적 통합 및 화염(AIF) 메커니즘이 학습 가능한 어텐션 가중치를 사용하여 프레임 수준의 인코더 출력을 누적하여 레이블 수준의 표현을 생성한다.
- AIF 메커니즘은 단조성 정렬을 보장하고 임계값 1.0에서 가중치를 분할하여 레이블 표현을 생성함으로써 정확하지 않은 경계에 대한 강건성을 향상시킨다.
- 예측 네트워크는 빈칸 예측에서 분리되어 있으며, 텍스트 데이터만으로 사전 훈련하거나 미세조정할 수 있어 표준 언어 모델과 유사하게 동작한다.
- 지연 시간을 증가시키지 않으면서도 빔 서치 중에 검색 공간을 개선하는 스트리밍 공동 디코딩 방법을 도입하였다.
- 입력 프레임을 실시간으로 처리하고 레이블 수준의 표현과 동기적으로 레이블을 출력함으로써 모델은 스트리밍 능력을 유지한다.
![Fig. 1 : Illustration of the CIF [ 14 ] mechanism. $\bm{\oplus}$ and $\bm{\otimes}$ denote addition and multiplication. $\mathbf{E}=(\bm{e_{1}},\cdots,\bm{e_{T}})$ represents the encoder output and $\bm{\alpha}=(\alpha_{1},\cdots,\alpha_{T})$ denotes predicted weights whose example values $(0.2,0.9,](https://ar5iv.labs.arxiv.org/html/2307.03088/assets/cif8.png)
실험 결과
연구 질문
- RQ1빈칸 토큰 예측을 제거하면서도 스트리밍 추론과 정렬 정확도를 유지할 수 있는 신경 트랜스듀서를 재설계할 수 있는가?
- RQ2스트리밍 ASR를 위해 효율적이고 강건한 레이블 수준의 인코더 표현을 생성할 수 있는 방법은 무엇인가?
- RQ3빈칸 토큰 예측이 더 이상 이루어지지 않을 경우, 텍스트 데이터만으로 예측 네트워크를 효과적으로 적응시킬 수 있는가?
- RQ4제안된 AIF 메커니즘이 WER 및 강건성 측면에서 기존의 연속적 통합 및 화염(CIF) 방법보다 우수한가?
- RQ5LS-Transducer는 표준 및 분할된 신경 트랜스듀서 모델 대비 내부 도메인 및 도메인 간 ASR 시나리오 모두에서 뛰어난 성능을 달성할 수 있는가?
주요 결과
- 표준 신경 트랜스듀서 대비 내부 도메인 LibriSpeech-100h 데이터에서 LS-Transducer는 10%의 상대적 WER 감소를 달성했다.
- 도메인 간 TED-LIUM2 및 AESRC2020 데이터에서 LS-Transducer는 각각 17%와 19%의 상대적 WER 감소를 기록했으며, 예측 네트워크가 적응된 상태였다.
- AIF 메커니즘이 베이스라인 CIF 방법보다 우수했으며, 깔끔한 LibriSpeech 개발 세트에서 WER을 2.8점 감소시키고, 다른 세트에서는 2.4점 감소시켰다.
- 표준 Transformer-Pred T-T 모델에서 예측 네트워크를 사전 훈련하면 성능이 저하되었지만, LS-Transducer는 저하 없이 사전 훈련된 언어 모델을 자연스럽게 활용할 수 있었다.
- 모든 테스트 세트에서 HAT 및 분할된 T-T 모델 대비 LS-Transducer는 상대적 WER 감소 폭이 8.1%에서 15.4%에 이르며 통계적 유의성 수준 0.1%에서 유의미한 성능 향상을 보였다.
- 제안된 스트리밍 공동 디코딩 방법은 빔 서치 중에 검색 공간을 개선함으로써 정확도를 향상시켰으며, 전체 성능 향상에 기여했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.