[논문 리뷰] Non-Autoregressive Transformer ASR with CTC-Enhanced Decoder Input
이 논문은 자동회귀 기반 모델 대비 50배 빠른 추론 속도를 유지하면서 정확도를 향상시키기 위해 탐욕적 CTC 예측을 디코더 입력에 통합한 비자동회귀(Non-Autoregressive, NAR) 트랜스포머 음성 인식(ASR) 모델을 제안한다. CTC 출력을 개선하는 방식으로 마스킹 또는 복사된 인코더 상태를 사용하는 대신, Aishell-1과 Aishell-2에서 기존 최고 수준의 NAR 성능을 달성하며, 강력한 자동회귀 모델 대비 절대 CER 저하가 0.0–0.3%에 불과하다.
Non-autoregressive (NAR) transformer models have achieved significantly inference speedup but at the cost of inferior accuracy compared to autoregressive (AR) models in automatic speech recognition (ASR). Most of the NAR transformers take a fixed-length sequence filled with MASK tokens or a redundant sequence copied from encoder states as decoder input, they cannot provide efficient target-side information thus leading to accuracy degradation. To address this problem, we propose a CTC-enhanced NAR transformer, which generates target sequence by refining predictions of the CTC module. Experimental results show that our method outperforms all previous NAR counterparts and achieves 50x faster decoding speed than a strong AR baseline with only 0.0 ~ 0.3 absolute CER degradation on Aishell-1 and Aishell-2 datasets.
연구 동기 및 목표
- 디코더 입력에서 타겟 측의 약한 또는 간접적인 문맥으로 인해 발생하는 비자동회귀(Non-Autoregressive, NAR) 트랜스포머 ASR 모델의 정확도 저하 문제를 해결하기 위해.
- 디코더에 더 강력하고 관련성이 높은 타겟 측 정보를 제공하여 NAR 디코딩 성능을 향상시키기 위해.
- NAR 모델과 자동회귀(AR) 모델 간의 ASR 정확도 격차를 줄이면서도 높은 추론 속도를 유지하기 위해.
- CTC 예측 출력을 직접적이고 정보적인 입력으로 사용하여 NAR 디코더 개선에 효과가 있는지 평가하기 위해.
제안 방법
- 모델은 고정 길이의 MASK 시퀀스나 복사된 인코더 상태를 대체하여 탐욕적 CTC 예측 결과를 주요 디코더 입력으로 사용한다.
- 디코더는 단일 순방향 전파를 통해 음성 문맥과 부분적인 타겟 측 문맥을 모두 활용하여 CTC 예측 결과를 개선한다.
- MP-CTC에서 사용하는 마스킹 기법을 피하고, CTC 출력을 직접적으로 NAR 디코더의 지시자로 활용한다.
- CTC 모듈은 길이에 대한 감독 정보를 제공하고 초기 타겟 시퀀스 예측을 수행하며, 이를 NAR 디코더가 보정한다.
- 디코더는 CTC 예측과 인코딩된 음성 특징에 조건을 두어 음성과 타겟 시퀀스 모델링을 함께 최적화할 수 있도록 한다.
- 이 방법은 CTC와 어텐션 손실을 함께 최적화하여 CTC 출력과 최종 예측 간의 정렬을 보장한다.
실험 결과
연구 질문
- RQ1CTC 예측 결과를 디코더 입력으로 사용하는 것이 비자동회귀 트랜스포머 ASR 모델의 정확도 향상에 기여하는가?
- RQ2CTC 출력을 통해 직접적인 타겟 측 문맥을 제공함으로써 NAR와 AR ASR 모델 간의 성능 격차를 줄일 수 있는가?
- RQ3CTC로 향상된 NAR 디코더는 대규모 데이터셋에서 빠른 추론 속도를 유지하면서도 경쟁력 있는 정확도를 달성할 수 있는가?
- RQ4기존의 NAR 기반 방법들인 ST-NAR와 MP-CTC에 비해 제안된 방법은 속도와 정확도 측면에서 어떻게 비교되는가?
주요 결과
- 제안된 NAR 트랜스포머는 Aishell-1 개발 세트에서 5.6%의 CER을 기록했으며, 이는 이전의 모든 NAR 모델을 초월한다.
- Aishell-2에서는 iOS에서 7.1%, 마이크에서 8.0%, 안드로이드에서 8.1%의 CER을 기록하여 이 대규모 코퍼스에서 이전의 모든 NAR 방법을 능가한다.
- 강력한 자동회귀 기반 모델 대비 50배 빠른 디코딩 속도를 확보했으며, 절대 CER 저하가 0.0–0.3%에 불과하다.
- CTC로 향상된 디코더 입력은 의미 있는 타겟 측 문맥을 제공함으로써 NAR 작업의 난이도를 낮추고, 일반화 능력과 정렬 정확도를 향상시킨다.
- Aishell-1과 Aishell-2 양쪽에서 NAR 모델 중 최고 성능을 기록하며 산업 규모의 LVCSR 작업에서의 효과성을 입증한다.
- 실시간 응용 분야에 매우 적합한 바, 정확도는 유사한 수준을 유지하면서도 추론 속도에서 강력한 자동회귀 기반 모델을 뛰어넘는다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.