Skip to main content
QUICK REVIEW

[논문 리뷰] Citrinet: Closing the Gap between Non-Autoregressive and Autoregressive End-to-End Models for Automatic Speech Recognition

Somshubra Majumdar, Jagadeesh Balam|arXiv (Cornell University)|2021. 04. 05.
Speech Recognition and Synthesis참고 문헌 29인용 수 43
한 줄 요약

Citrinet은 외부 언어 모델 없이 비자율적 CTC 모델과 자율회귀 Seq2Seq/RNN-T 모델 간의 성능 격차를 좁히는 squeeze-and-excitation이 적용된 심층 1D 시간-채널 분리 합성 컨볼루션 CTC ASR 모델입니다.

ABSTRACT

We propose Citrinet - a new end-to-end convolutional Connectionist Temporal Classification (CTC) based automatic speech recognition (ASR) model. Citrinet is deep residual neural model which uses 1D time-channel separable convolutions combined with sub-word encoding and squeeze-and-excitation. The resulting architecture significantly reduces the gap between non-autoregressive and sequence-to-sequence and transducer models. We evaluate Citrinet on LibriSpeech, TED-LIUM2, AISHELL-1 and Multilingual LibriSpeech (MLS) English speech datasets. Citrinet accuracy on these datasets is close to the best autoregressive Transducer models.

연구 동기 및 목표

  • 비자율적 CTC 모델과 자율회귀 Seq2Seq/RNN-T 모델 간의 엔드-투-엔드 ASR에서 성능 격차를 줄이는 동기 부여.
  • Citrinet을 1D 시간-채널 분리 합성 컨볼루션과 squeeze-and-excitation 모듈로 보강한 심층 컨볼루션 CTC 모델로 제안.
  • 다양한 표준 ASR 데이터셋에서 Citrinet을 평가하고, 주요 자율회귀 모델 및 상온 기반 기준선과 비교.

제안 방법

  • 프롤로그/에필로그 블록과 세 개의 메가 블록으로 구성된 잔류 QuartzNet 스타일 블록을 갖춘 심층 잔류 CTC 모델로 Citrinet 도입.
  • 커널 레이아웃(K4)과 squeeze-and-excitation 컨텍스트 모듈을 이용한 1D 시간-채널 분리 합성 컨볼루션으로 전역 정보를 포착.
  • 토크나이제이션 전략으로 서브워드 단위(word-piece)를 사용하고 평가 시 선택적 외부 언어 모델 재스코어링.
  • SpecAugment, NovoGrad 옵티마이저, 코사인 LR 스케줄, 표준 음향 프런트 엔드(80-dim log-Mel 특징)로 학습.
  • 너비(C), 깊이(R), 커널 레이아웃, 토크나이제이션 크기를 변화시키며 WER/CER에 미치는 영향을 연구하여 변형을 평가.

실험 결과

연구 질문

  • RQ1비외부 LM 없이 표준 ASR 벤치마크에서 비자율적 CTC 모델이 자율회귀 Seq2Seq/RNN-T 모델에 얼마나 근접할 수 있는가?
  • RQ2Citrinet에서 어떤 아키텍처 선택(커널 레이아웃, SE 컨텍스트, 너비, 깊이, 토크나이제이션)이 ASR 정확도에 가장 큰 영향을 미치는가?
  • RQ3Citrinet이 LibriSpeech, MLS, TED-LIUM 2, AISHELL-1에서 상태-와 같은 성능을 달성할 수 있는가?
  • RQ4SE 모듈의 컨텍스트 윈도우 크기가 인식 정확도에 어떤 영향을 미치는가?
  • RQ5영어 MLS에서의 사전 학습이 다른 데이터셋(TED-LIUM 2, AISHELL-1)으로 전이되고 미세 조정 결과에 어떤 영향을 미치는가?

주요 결과

  • Citrinet-1024는 LibriSpeech test-other에서 외부 LM 없이 WER 6.22%를 달성하고 LM 재스코어링이 있는 최신 자율회귀 모델과의 격차를 좁힙니다.
  • Citrinet 변형들(예: Citrinet-1024)은 LM 없이 MLS 영어 및 TED-LIUM 2 결과를 포함한 여러 데이터셋에서 Transducer 모델의 성능에 근접합니다.
  • SE 컨텍스트는 정확도를 크게 개선하며, 더 큰 SE 컨텍스트 윈도우가 실험 설정 전반에서 더 낮은 WER/CER과 상관 있습니다.
  • 커널 너비의 절단 연구는 최적 범위를 보이며, 너무 좁거나 너무 넓은 커널은 성능을 저하시켜, 0.75–1.0 스케일링이 최상의 결과를 낳았습니다.
  • 모델 너비(C)와 깊이(R)를 늘리면 일반적으로 성능이 향상되지만 파라미터 수가 증가하고 특정 구성 이후 수익이 감소합니다.
  • 토크나이저 어휘 크기는 정확도에 영향을 주며, 너무 큰 어휘는 성능을 해치고 매우 작은 어휘는 CT 손실 제약으로 학습 가능성을 저하시킬 수 있습니다.
  • 모델은 교차 데이터셋 사전 학습(MLS 영어) 및 도메인 특화 데이터(TED-LIUM 2, AISHELL-1)에서의 미세 조정을 통해 경쟁력 있는 CER/WER를 달성합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.