Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Mask-CTC for Non-Autoregressive End-to-End ASR

Yosuke Higuchi, Hirofumi Inaguma|arXiv (Cornell University)|2020. 10. 26.
Speech Recognition and Synthesis참고 문헌 45인용 수 6
한 줄 요약

이 논문은 Conformer 인코더를 통합하고 보조 학습 및 디코딩을 통한 동적 길이 예측을 도입하여 비자율적(end-to-end) 음성 인식을 위한 Mask-CTC를 향상시킨다. 이를 통해 CTC 출력에서 발생하는 삽입 및 삭제 오류를 보정한다. 개선된 모델은 WSJ eval92에서 9.1% WER를 기록하여 표준 CTC를 초월하고 자율적 모델과 동등한 성능을 달성했으며, CPU에서 0.1 RTF 미만의 추론 속도를 유지한다.

ABSTRACT

For real-world deployment of automatic speech recognition (ASR), the system is desired to be capable of fast inference while relieving the requirement of computational resources. The recently proposed end-to-end ASR system based on mask-predict with connectionist temporal classification (CTC), Mask-CTC, fulfills this demand by generating tokens in a non-autoregressive fashion. While Mask-CTC achieves remarkably fast inference speed, its recognition performance falls behind that of conventional autoregressive (AR) systems. To boost the performance of Mask-CTC, we first propose to enhance the encoder network architecture by employing a recently proposed architecture called Conformer. Next, we propose new training and decoding methods by introducing auxiliary objective to predict the length of a partial target sequence, which allows the model to delete or insert tokens during inference. Experimental results on different ASR tasks show that the proposed approaches improve Mask-CTC significantly, outperforming a standard CTC model (15.5% $ ightarrow$ 9.1% WER on WSJ). Moreover, Mask-CTC now achieves competitive results to AR models with no degradation of inference speed ($

연구 동기 및 목표

  • 제한된 계산 자원을 가진 실세계 환경에서 비자율적(NAR)과 자율적(AR) 엔드 투 엔드 음성 인식 모델 간의 성능 격차를 해소한다.
  • CTC 출력의 품질과 고정된 길이로 인해 제약을 받는 Mask-CTC의 한계를 극복하여 토큰 생성 시 지속적인 오류를 방지한다.
  • 비자율 모델의 빠른 병렬 추론 속도를 희생시키지 않고도 추론 중에 삽입 및 삭제 오류를 동적으로 보정할 수 있도록 한다.
  • 향상된 Mask-CTC 프레임워크가 엔드 투 엔드 음성 번역(E2E-ST) 작업으로까지 응용 가능한지 탐색한다. 이는 ASR를 넘어서는 활용 가능성을 넓힌다.

제안 방법

  • Mask-CTC의 표준 Transformer 인코더를 음성 표현 학습을 향상시키기 위해 Conformer 아키텍처로 교체한다.
  • 디코딩 중에 부분적인 타겟 시퀀스의 길이를 예측하는 새로운 보조 학습 목표를 도입하여, 모델이 동적으로 토큰을 삽입하거나 삭제할 수 있도록 한다.
  • 예측된 길이를 기반으로 마스크 예측 개선을 유도하는 디코딩 전략을 설계하여, CTC가 생성한 시퀀스에서 오류를 반복적으로 수정할 수 있도록 한다.
  • CTC 출력에 신뢰도 필터링과 제한된 마스크 예측(MP) 디코딩을 적용하여 타겟 시퀀스를 초기화함으로써 음성 번역에서의 안정성과 성능을 향상시킨다.
  • NAR 모델의 E2E-ST 작업에서 순서 수준의 지식 정복을 사용하여 추론 복잡도를 증가시키지 않고도 생성 품질을 향상시킨다.
  • 각 반복에서 마스크된 토큰의 수를 제한하는 제약 조건이 부여된 마스크 예측 메커니즘을 구현하여 CTC 출력의 정보를 반복 간에 유지한다.

실험 결과

연구 질문

  • RQ1빠른 추론 속도를 저하시키지 않고 Mask-CTC의 성능을 크게 향상시킬 수 있는가?
  • RQ2Conformer 인코더가 CTC 출력 품질을 얼마나 향상시켜 전체 Mask-CTC 성능에 기여하는가?
  • RQ3추론 중 동적 길이 예측이 CTC가 생성한 시퀀스의 삽입 및 삭제 오류를 효과적으로 보정할 수 있는가?
  • RQ4향상된 Mask-CTC 프레임워크는 엔드 투 엔드 음성 번역과 같은 다른 순서-순서 시퀀스 작업으로 일반화되는가?
  • RQ5동적 길이 예측을 Mask-CTC에 적용할 경우 추론 속도와 정확도 사이의 상호 보완적 관계는 어떠한가?

주요 결과

  • Conformer와 동적 길이 예측(DLP)을 통합한 개선된 Mask-CTC는 WSJ eval92에서 9.1% WER를 기록하여 표준 CTC(15.5%)를 초월하고 최신 자율적 모델과 동등한 성능을 달성했다.
  • 모델은 CPU에서 0.1 RTF 이하의 추론 속도를 유지하여 비자율 모델의 핵심 이점인 매우 빠른 추론 속도가 손상되지 않았음을 확인했다.
  • Voxforge와 TEDLIUM2에서 개선된 Mask-CTC는 자율적 모델과 경쟁 가능한 성능을 기록하여 다양한 ASR 데이터셋에 대한 일반화 능력을 입증했다.
  • DLP 방법은 WSJ에서 CTC 출력 오류를 효과적으로 보정했지만, TEDLIUM2에서는 성능 향상이 제한적이었는데, 이는 Conformer 기반 CTC 모델이 이미 높은 정확도를 보였기 때문일 것이다.
  • Fisher-CallHome 스페인어 음성 번역에서의 엔드 투 엔드 번역 작업에서 개선된 Mask-CTC는 자율적 기준 모델을 초월하여 개발 세트에서 49.94 BLEU, 테스트 세트에서 48.66 BLEU를 기록하여 다국어 번역 작업으로의 강력한 일반화 능력을 입증했다.
  • CTC에서 유래한 정보를 반복 간에 유지하는 제한된 마스크 예측 디코딩 전략이 음성 번역에서 가장 큰 성능 향상을 이끌어내었으며, 이는 비단조화적 정렬 작업에서의 중요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.