Skip to main content
QUICK REVIEW

[논문 리뷰] Spike-Triggered Non-Autoregressive Transformer for End-to-End Speech Recognition

Zhengkun Tian, Jiangyan Yi|arXiv (Cornell University)|2020. 05. 16.
Natural Language Processing Techniques참고 문헌 21인용 수 10
한 줄 요약

이 논문은 AISHELL-1에서 실시간 인식 속도 0.0056을 달성하면서도 경쟁력 있는 정확도(단어 오류율 7.67%)를 유지하는 엔드 투 엔드 음성 인식을 위한 스파이크 트리거드 비자율 트랜스포머(ST-NAT)를 제안한다. 이 모델은 CTC 모듈을 통해 목표 시퀀스 길이를 예측하고 스파이크 유사 사후 확률을 통해 디코더 입력을 트리거한다.

ABSTRACT

Non-autoregressive transformer models have achieved extremely fast inference speed and comparable performance with autoregressive sequence-to-sequence models in neural machine translation. Most of the non-autoregressive transformers decode the target sequence from a predefined-length mask sequence. If the predefined length is too long, it will cause a lot of redundant calculations. If the predefined length is shorter than the length of the target sequence, it will hurt the performance of the model. To address this problem and improve the inference speed, we propose a spike-triggered non-autoregressive transformer model for end-to-end speech recognition, which introduces a CTC module to predict the length of the target sequence and accelerate the convergence. All the experiments are conducted on a public Chinese mandarin dataset AISHELL-1. The results show that the proposed model can accurately predict the length of the target sequence and achieve a competitive performance with the advanced transformers. What's more, the model even achieves a real-time factor of 0.0056, which exceeds all mainstream speech recognition models.

연구 동기 및 목표

  • 비자율 음성 인식 모델에서 목표 시퀀스 길이 추정이 정확하지 않거나 최적화되지 않은 문제를 해결한다.
  • 스파이크 트리거드 어텐션을 통해 동적으로 목표 길이를 결정하여 불필요한 계산을 줄이고 추론 속도를 향상시킨다.
  • CTC 모듈 출력을 길이 예측기와 어텐션 유도 입력으로 활용하여 모델 수렴과 성능을 향상시킨다.
  • 특히 저지연 응용 분야에서 정확도를 희생시키지 않고 고속 추론을 달성한다.
  • 신경 언어 모델을 통합하여 인식 품질을 추가로 향상시키면서도 빠른 추론 속도를 유지한다.

제안 방법

  • 목표 토큰이 입력 시퀀스의 어느 위치에 있는지 나타내는 스파이크 유사 사후 확률을 생성하기 위해 CTC 모듈을 도입한다.
  • 스파이크 위치의 인코더 상태를 디코더의 주요 입력으로 사용하여 고정 길이 마스크 시퀀스를 대체한다.
  • 추론 중 스파이크 수를 세어 정확한 목표 시퀀스 길이를 결정함으로써 불필요한 계산을 제거한다.
  • 수렴 속도를 향상시키고 입력-출력 간 정렬을 개선하기 위해 CTC 손실을 보조 학습 목표로 활용한다.
  • ST-NAT 모델 출력과 신경 언어 모델을 조합하여 예측을 정밀화하고 단어 오류율을 낮춘다.
  • 음성 특징 추출을 위해 2차원 컨볼루션 프론트엔드를 사용하고, 인코더와 디코더 양쪽 모두에 멀티헤드 자기어텐션과 피드포워드 레이어를 적용한다.

실험 결과

연구 질문

  • RQ1비자율 음성 인식 모델에서 CTC 모듈을 효과적으로 목표 시퀀스 길이를 예측하는 데 사용할 수 있는가?
  • RQ2고정 길이 마스크 시퀀스 대비 스파이크 트리거드 인코더 상태를 디코더 입력으로 사용할 경우 모델 성능이 향상되는가?
  • RQ3CTC 손실을 보조 목표로 통합하면 학습 속도가 가속되고 수렴이 향상되는가?
  • RQ4제안된 ST-NAT 모델은 정확도를 유지하면서 추론 지연을 어느 정도 줄일 수 있는가?
  • RQ5최신 엔드 투 엔드 음성 인식 모델과 비교할 때 ST-NAT 모델은 속도와 정확도에서 어떤가?

주요 결과

  • ST-NAT 모델은 실시간 인식 속도(RTF) 0.0056을 달성하여 모든 주류 음성 인식 모델을 뛰어넘는다.
  • 모델은 AISHELL-1 테스트 세트에서 단어 오류율을 7.67%로 낮추었으며, Speech-Transformer나 LAS와 같은 고도로 발전한 모델과 비교해도 경쟁력 있는 성능을 보인다.
  • CTC 모듈은 높은 정확도로 목표 시퀀스 길이를 예측하여 2% 미만의 단어 또는 문자 누락 오류를 초래한다.
  • 언어 모델을 통합한 ST-NAT는 테스트 세트에서 단어 오류율 7.02%를 기록하여 외부 언어 모델링을 통해 성능 향상을 입증한다.
  • 유사한 파라미터 수를 가진 기준 모델인 NAT-MASKED(고정 길이 마스크를 사용하는 비자율 모델)보다 정확도와 추론 속도에서 모두 뛰어나다.
  • 시각화 결과 스파이크 위치가 어휘 발음 경계와 밀접하게 일치함을 확인하여, 모델이 의미 있는 시간 구조를 잘 포착하고 있음을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.