Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Modal ASR Post-Processing System for Error Correction and Utterance Rejection

Jing Du, Shiliang Pu|arXiv (Cornell University)|2022. 01. 10.
Speech Recognition and Synthesis인용 수 7
한 줄 요약

이 논문은 음성 및 텍스트 특징을 융합하여 오류 보정과 발화 거부를 통합하는 크로스모달 다중작업 학습 기반의 ASR 후처리 시스템을 제안한다. 이 시스템은 신뢰도 추정기와 오류 보정기를 함께 학습함으로써 단일 모odal 및 단일 작업 모델보다 정확도와 효율성에서 뛰어난 성능을 달성한다. 토큰당 1.7ms의 지연 시간으로 단일 및 다중 화자 음성에서 각각 10% 이상의 상대적 CER 감소를 달성한다.

ABSTRACT

Although modern automatic speech recognition (ASR) systems can achieve high performance, they may produce errors that weaken readers' experience and do harm to downstream tasks. To improve the accuracy and reliability of ASR hypotheses, we propose a cross-modal post-processing system for speech recognizers, which 1) fuses acoustic features and textual features from different modalities, 2) joints a confidence estimator and an error corrector in multi-task learning fashion and 3) unifies error correction and utterance rejection modules. Compared with single-modal or single-task models, our proposed system is proved to be more effective and efficient. Experiment result shows that our post-processing system leads to more than 10% relative reduction of character error rate (CER) for both single-speaker and multi-speaker speech on our industrial ASR system, with about 1.7ms latency for each token, which ensures that extra latency introduced by post-processing is acceptable in streaming speech recognition.

연구 동기 및 목표

  • ASR 시스템에서 오류 전파 문제를 해결하기 위해 정확도와 신뢰성을 향상시키는 통합 후처리 프레임워크를 개발하는 것.
  • 음성 및 텍스트 모odal의 크로스모달 특징을 활용하여 오류 보정 및 발화 거부를 향상시키는 것.
  • 신뢰도 추정 및 오류 보정을 공동으로 최적화하는 다중작업 학습을 통해 효율성과 성능을 향상시키는 것.
  • 고정밀도를 유지하면서 계산 오버헤드를 최소화하여 스트리밍 ASR의 지연 시간을 줄이는 것.
  • 공유된 학습 프레임워크 내에서 신뢰도 추정과 오류 보정 간 상호 이점을 탐색하는 것.

제안 방법

  • ASR 모델의 히든 상태에서 유도된 음성 임베딩과 BERT 기반 표현에서 유도된 텍스트 특징을 융합한다.
  • 공유된 인코더 표현을 사용하여 신뢰도 추정기와 오류 보정기를 함께 학습하는 다중작업 학습 아키텍처를 적용한다.
  • 수정 과정에서 시퀀스 길이를 조정하기 위해 길이 예측기(Length predictor)를 도입하여 삽입 오류를 줄인다.
  • 신뢰도 점수를 사용하여 저신뢰도 토큰을 필터링하고 보정을 안내하며, 명시적 필터링은 주로 부가 실험에서만 적용된다.
  • 신뢰도 점수 기반 정규화 손실과 BERT에서의 지식 정복을 통해 학습 안정성과 성능을 향상시킨다.
  • 신뢰도 점수, 겹침 확률, 그리고 보정기의 소프트맥스 출력을 기반으로 발화 거부를 수행한다.

실험 결과

연구 질문

  • RQ1음성 및 텍스트 특징의 크로스모달 융합이 ASR 후처리에서 오류 보정과 신뢰도 추정 모두에 영향을 미치는가?
  • RQ2오류 보정과 신뢰도 추정을 함께 학습하는 다중작업 학습이 단일작업 또는 별도의 모델보다 성능을 향상시키는가?
  • RQ3신뢰도 점수를 필터링 메커니즘으로 통합할 경우 보정 정확도와 시스템 효율성에 어떤 영향을 미치는가?
  • RQ4길이 예측기가 오류 보정에서 삽입 오류를 얼마나 줄이는가?
  • RQ5사전 훈련된 언어 모델에서의 지식 정복이 후처리 시스템의 성능을 추가로 향상시킬 수 있는가?

주요 결과

  • 크로스모달 모델은 IDCT 데이터셋에서 CER 10.6%를 달성했으며, 텍스트 전용 BERT 기반 모델보다 신뢰도 추정에서 더 우수한 성능(AUC 0.906 vs. 0.887)을 보였고, 속도는 8.2배 빠르다.
  • 통합 다중작업 모델은 단지 46.8MB의 파라미터로 CER를 10.6%까지 낮췄으며, 별도의 모델보다 우수했고, 단일 보정기 + 신뢰도 필터링 모델보다 CER 0.25점 향상되었다.
  • 길이 예측기는 CER를 0.25점 감소시켜 주로 삽입 오류를 줄였으며, 정규화 손실은 NCE에서 0.15, CER에서 0.35 향상에 기여했다.
  • BERT-base-chinese에서의 지식 정복은 CER를 10.0%로 낮추고 AUC를 0.912로 높여 외부 언어 지식의 유용성을 입증했다.
  • 단일 및 다중 화자 음성에서 모두 10% 이상의 상대적 CER 감소를 달성했고, 토큰당 지연 시간은 1.7ms에 불과하여 스트리밍 응용에 적합하다.
  • 통합 모델에서의 신뢰도 필터링은 추가적인 성능 향상이 미미했으며(0.05 CER 감소), 이는 보정기가 이미 다중작업 학습을 통해 신뢰도 신호를 암묵적으로 활용하고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.