Skip to main content
QUICK REVIEW

[논문 리뷰] One In A Hundred: Select The Best Predicted Sequence from Numerous Candidates for Streaming Speech Recognition

Zhengkun Tian, Jiangyan Yi|arXiv (Cornell University)|2020. 10. 28.
Speech Recognition and Synthesis참고 문헌 22인용 수 5
한 줄 요약

이 논문은 CTC 디코더를 통해 수백 개의 후보 번역문을 생성하고, 트랜스포머 기반 조건부 언어 모델을 사용해 가장 우수한 것을 선택함으로써 CTC 모델을 향상시키는 이단계 스트리밍 음성 인식 모델을 제안한다. AISHELL-1 간체자모형 언어 데이터셋에서 최대 20%의 문자 오류율(CER) 감소를 달성하면서도 저지연 스트리밍 추론을 유지한다.

ABSTRACT

The RNN-Transducers and improved attention-based encoder-decoder models are widely applied to streaming speech recognition. Compared with these two end-to-end models, the CTC model is more efficient in training and inference. However, it cannot capture the linguistic dependencies between the output tokens. Inspired by the success of two-pass end-to-end models, we introduce a transformer decoder and the two-stage inference method into the streaming CTC model. During inference, the CTC decoder first generates many candidates in a streaming fashion. Then the transformer decoder selects the best candidate based on the corresponding acoustic encoded states. The second-stage transformer decoder can be regarded as a conditional language model. We assume that a large enough number and enough diversity of candidates generated in the first stage can compensate the CTC model for the lack of language modeling ability. All the experiments are conducted on a Chinese Mandarin dataset AISHELL-1. The results show that our proposed model can implement streaming decoding in a fast and straightforward way. Our model can achieve up to a 20% reduction in the character error rate than the baseline CTC model. In addition, our model can also perform non-streaming inference with only a little performance degradation.

연구 동기 및 목표

  • 스트리밍 CTC 모델에서 언어적 맥락 모델링의 부족이 스트리밍 음성 인식 성능을 제한하는 문제를 해결하기 위해.
  • CTC의 빠른 속도와 트랜스포머 디코더의 언어 모델링 능력을 조합하여 스트리밍 추론의 효율성과 정확도를 향상시키기 위해.
  • 대규모이고 다양한 CTC 생성 후보들이 CTC의 본질적인 순서 수준 언어 모델링 부족을 보완할 수 있는지 검증하기 위해.
  • 최소한의 성능 저하로 스트리밍 및 비스트리밍 추론을 모두 지원하기 위해.

제안 방법

  • 지연 시간을 제어하는 스트리밍 트랜스포머 인코더(LC-STE)가 실시간으로 입력 특징을 처리하며, 국소 자기주의와 제한된 미래 컨텍스트 레이어를 사용해 저지연을 유지한다.
  • CTC 디코더가 사전 선택 단계에서 스트리밍 방식으로 최대 100개의 후보 번역문을 생성한다.
  • 트랜스포머 디코더가 해당 음성 인코더 상태와 함께 모든 후보에 대해 한 스텝 스코어링을 수행하며, 조건부 언어 모델 기능을 수행한다.
  • 최종 가설은 모든 후보 중 평균 점수가 가장 높은 후보로 선택된다.
  • 인코더, CTC 디코더, 트랜스포머 디코더의 공동 훈련을 통해 정렬과 성능 최적화를 보장한다.
  • 실시간 제약 조건을 비활성화함으로써 모델은 지연 제어가 가능한 스트리밍 추론과 비스트리밍 추론을 모두 지원한다.

실험 결과

연구 질문

  • RQ1대규모이고 다양한 CTC 생성 후보들이 CTC 모델의 언어 모델링 능력 부족을 보완할 수 있는가?
  • RQ2트랜스포머 기반 스코어러를 사용하는 이중단계 추론 파이프라인은 표준 CTC보다 스트리밍 음성 인식 성능을 향상시키는가?
  • RQ3제안된 방법은 낮은 지연을 유지하면서 비스트리밍 또는 더 복잡한 엔드 투 엔드 모델과 비교해 유사한 성능을 달성할 수 있는가?
  • RQ4CTC 디코딩 단계에서의 빔 폭이 이중단계 시스템의 최종 성능에 어떤 영향을 미치는가?
  • RQ5OAH 방법을 사용할 때 스트리밍 효율성과 인식 정확도 사이의 상충 관계는 어떠한가?

주요 결과

  • 제안된 OAH 모델은 AISHELL-1 데이터셋에서 기준 CTC 모델 대비 최대 20%의 상대적 문자 오류율(CER) 감소를 달성한다.
  • 빔 폭 50일 경우, 테스트 세트에서 CER 7.41%를 기록하여 기준 CTC 및 Sync-Transformer, SA-Transducer와 같은 다른 스트리밍 모델보다 뛰어난 성능을 보였다.
  • 실시간 요인(RTF) 0.0380을 유지하여, SA-Transducer(RTF 0.1536) 및 Speech-Transformer(RTF 0.0564)와 비교해 유의미하게 뛰어난 성능을 보였다.
  • 비스트리밍 추론은 CER 7.05%를 기록하여 스트리밍 버전과 비교해 거의 변화가 없었으며, 성능 저하가 미미했다.
  • 빔 폭이 50를 초과할 경우 성능 저하가 발생했으며, 이는 고성능이지만 저품질의 후보들이 증가해 노이즈가 증가했기 때문으로 보인다.
  • OAH를 적용한 모델는 외부 언어 모델(RNNLM 또는 TransLM 리스크로링 등)을 사용한 CTC 모델보다도 성능이 뛰어나, 내부 이중단계 메커니즘이 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.