[논문 리뷰] Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict
Mask CTC는 CTC 정렬과 토큰 간 조건부 의존성을 활용하여 저신뢰도 토큰을 반복적으로 보정함으로써 CTC 출력을 향상시키는 비자기적 엔드 투 엔드 ASR 프레임워크이다. 이는 비자기적 모델 중 최고 성능을 기록하며, WSJ에서 WER을 17.9%에서 12.1%로 감소시키고 CPU에서 0.07 RTF의 빠른 추론 속도를 달성하여 자기적 모델에 근접한다.
We present Mask CTC, a novel non-autoregressive end-to-end automatic speech recognition (ASR) framework, which generates a sequence by refining outputs of the connectionist temporal classification (CTC). Neural sequence-to-sequence models are usually extit{autoregressive}: each output token is generated by conditioning on previously generated tokens, at the cost of requiring as many iterations as the output length. On the other hand, non-autoregressive models can simultaneously generate tokens within a constant number of iterations, which results in significant inference time reduction and better suits end-to-end ASR model for real-world scenarios. In this work, Mask CTC model is trained using a Transformer encoder-decoder with joint training of mask prediction and CTC. During inference, the target sequence is initialized with the greedy CTC outputs and low-confidence tokens are masked based on the CTC probabilities. Based on the conditional dependence between output tokens, these masked low-confidence tokens are then predicted conditioning on the high-confidence tokens. Experimental results on different speech recognition tasks show that Mask CTC outperforms the standard CTC model (e.g., 17.9% -> 12.1% WER on WSJ) and approaches the autoregressive model, requiring much less inference time using CPUs (0.07 RTF in Python implementation). All of our codes will be publicly available.
연구 동기 및 목표
- 출력 토큰 간 강한 조건부 독립성 가정으로 인해 성능이 열등해지는 표준 CTC의 한계를 해결한다.
- 비자기적 모델에서 시퀀스 길이 예측 문제를 해결하기 위해 시퀀스 길이를 예측하는 대신 탐욕적 CTC 출력으로 초기화한다.
- 저비용의 계산 오버헤드로도 빠른 병렬 디코딩을 가능하게 하면서도, 저신뢰도 토큰만을 보정함으로써 높은 정확도를 유지한다.
- 복잡한 반복 보정 또는 길이 예측을 요구하지 않고도 비자기적과 자기적 ASR 모델 간의 성능 격차를 줄인다.
- 다양한 언어에 대해 강건하며 실시간 구현에 적합한 낮은 추론 지연을 제공하는 프레임워크를 개발한다.
제안 방법
- 학습 중에 CTC와 마스크 예측 목표를 함께 최적화하는 Transformer 인코더-디코더 모델을 훈련한다.
- 추론 중에 이미 대부분의 토큰에서 높은 정확도를 보이는 탐욕적 CTC 출력을 사용하여 타겟 시퀀스를 초기화한다.
- CTC 확률에 기반한 신뢰도 임계값을 사용하여 CTC 출력 내 저신뢰도 토큰을 식별한다.
- 과거와 미래의 미마스크 토큰, 그리고 입력 음성 특징에 조건을 두고 저신뢰도 토큰을 반복적으로 마스크 예측한다.
- 소수의 마스크 예측 단계 수(예: K=5)로 반복 보정을 적용하며, 각 단계에서 하나 또는 몇 개의 마스크 토큰을 예측한다.
- 토큰 간 조건부 의존성을 활용하여 교체 오류를 수정하면서도 CTC에서 유도된 고정된 시퀀스 길이를 유지한다.
실험 결과
연구 질문
- RQ1출력 길이 예측이 필요 없이 비자기적 ASR 모델이 자기적 모델에 근접한 성능을 달성할 수 있는가?
- RQ2저신뢰도 CTC 토큰의 반복 보정이 빠른 추론 속도를 유지하면서도 인식 정확도를 향상시킬 수 있는가?
- RQ3추론 중에 CTC 확률 기반 마스크 예측이 무작위 마스크보다 얼마나 효과적인가?
- RQ4작은 단위의 토큰(예: 라틴 문자)을 사용하는 언어 및 토큰화 방식에 대해 이 프레임워크가 일반화되는가?
- RQ5고정된 CTC 길이로 인해 삽입/삭제 오류에 민감하지 않으면서도 교체 오류를 효과적으로 복구할 수 있는가?
주요 결과
- Mask CTC는 WSJ 데이터셋에서 WER을 17.9%에서 12.1%로 감소시켜 표준 CTC를 크게 능가하고 자기적 모델에 근접했다.
- 일본어 데이터셋인 CSJ에서 Mask CTC는 동일한 평가 세트에서 자기적 CTC-attention 모델(5.40%)보다 유사하거나 더 낮은 CER(4.97%)를 달성했다.
- Python 구현을 통해 CPU에서 0.07 RTF의 추론 속도를 확보하여 자기적 모델 대비 116배 빠르게 작동했다.
- 모든 평가 세트에서 문장 오류율(SER)이 향상되어, 맥락적 의존성 모델링을 통해 오류를 효과적으로 수정함을 보여주었다.
- 작은 토큰 단위(예: 라틴 문자)를 사용하는 언어에서 성능 향상이 가장 두드러졌으며, 이는 교체 오류가 흔하고 맥락을 통해 수정 가능한 영역이었기 때문이다.
- 모델은 다양한 데이터 크기와 언어 유형에 대해 강건했으며, Voxforge(표준 CTC보다 낮은 WER)와 CSJ에서 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.