Skip to main content
QUICK REVIEW

[논문 리뷰] Universal ASR: Unify and Improve Streaming ASR with Full-context Modeling.

Jiahui Yu, Wei Han|arXiv (Cornell University)|2020. 10. 12.
Speech Recognition and Synthesis인용 수 13
한 줄 요약

이 논문은 스트리밍 및 풀컨텍스트 자동 음성 인식 간 모델 가중치를 공유하기 위해 공동 훈련과 인-플레이스 지식 정제를 통해 유니버설 ASR를 제안한다. 이 방법은 스트리밍 ASR의 지연 시간과 정확도를 크게 향상시켜 LibriSpeech 및 내부 다중도메인 데이터셋에서 새로운 최고 성능 기록을 달성한다.

ABSTRACT

Streaming automatic speech recognition (ASR) aims to emit each hypothesized word as quickly and accurately as possible, while full-context ASR waits for the completion of a full speech utterance before emitting completed hypotheses. In this work, we propose a unified framework, Universal ASR, to train a single end-to-end ASR model with shared weights for both streaming and full-context speech recognition. We show that the latency and accuracy of streaming ASR significantly benefit from weight sharing and joint training of full-context ASR, especially with inplace knowledge distillation. The Universal ASR framework can be applied to recent state-of-the-art convolution-based and transformer-based ASR networks. We present extensive experiments with two state-of-the-art ASR networks, ContextNet and Conformer, on two datasets, a widely used public dataset LibriSpeech and an internal large-scale dataset MultiDomain. Experiments and ablation studies demonstrate that Universal ASR not only simplifies the workflow of training and deploying streaming and full-context ASR models, but also significantly improves both emission latency and recognition accuracy of streaming ASR. With Universal ASR, we achieve new state-of-the-art streaming ASR results on both LibriSpeech and MultiDomain in terms of accuracy and latency.

연구 동기 및 목표

  • 스트리밍 및 풀컨텍스트 ASR 모델의 훈련 및 구현 파이프라인을 단순화하기 위해.
  • 풀컨텍스트 모델링과의 공동 훈련을 통해 스트리밍 ASR 성능을 지연 시간과 정확도 측면에서 향상시키기 위해.
  • 모델 용량이나 추론 효율성에 손상이 가지 않도록 스트리밍 및 풀컨텍스트 ASR 간 가중치 공유를 가능하게 하기 위해.
  • 풀컨텍스트 감독을 통해 스트리밍 ASR 성능을 향상시키는 인-플레이스 지식 정제의 효과를 입증하기 위해.
  • LibriSpeech 및 대규모 내부 다중도메인 데이터셋에서 스트리밍 ASR 최고 성능을 달성하기 위해.

제안 방법

  • 스트리밍 및 풀컨텍스트 추론 모드 모두에 대해 공유 가중치를 사용하는 단일 엔드 투 엔드 ASR 모델을 훈련한다.
  • 훈련 중에 풀컨텍스트 감독을 활용하여 인-플레이스 지식 정제를 통해 스트리밍 추론 성능을 향상시킨다.
  • 추론 아키텍처를 변경하지 않고 훈련 과정에 풀컨텍스트 모델링을 통합하여 공동 최적화를 가능하게 한다.
  • 이 프레임워크는 컨volution 기반(예: ContextNet) 및 트랜스포머 기반(예: Conformer) ASR 아키텍처 모두와 호환된다.
  • 지식 정제는 인-플레이스로 적용되며, 풀컨텍스트 모델의 예측 결과가 훈련 중 스트리밍 모델을 지시한다.
  • 이 방법은 저지연 시간 스트리밍 출력과 고정확도 전문 추론을 동시에 최적화하는 엔드 투 엔드 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1공유 가중치를 통해 단일 ASR 모델이 스트리밍 및 풀컨텍스트 환경에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2풀컨텍스트 감독과의 공동 훈련이 스트리밍 ASR의 지연 시간과 정확도에 어떤 영향을 미치는가?
  • RQ3풀컨텍스트 데이터로 훈련할 때 인-플레이스 지식 정제가 스트리밍 ASR 성능을 얼마나 향상시키는가?
  • RQ4유니버설 ASR 프레임워크는 ContextNet 및 Conformer와 같은 다양한 ASR 아키텍처에 일반화되는가?
  • RQ5유니버설 ASR는 공개 및 대규모 내부 데이터셋 모두에서 최고 성능을 달성할 수 있는가?

주요 결과

  • 유니버설 ASR는 워드 오류율과 발화 지연 시간 측면에서 LibriSpeech에서 새로운 최고 성능을 달성한다.
  • 풀컨텍스트 모델링과 인-플레이스 지식 정제를 통한 공동 훈련 덕분에 스트리밍 ASR 정확도가 크게 향상된다.
  • 풀컨텍스트 감독을 훈련 중에 활용함으로써 모델 추론 성능이 향상되어 스트리밍 ASR 지연 시간이 감소한다.
  • 개별적으로 스트리밍 및 풀컨텍스트 모델을 훈련하고 유지할 필요가 없어져 모델 배포를 단순화한다.
  • ContextNet 및 Conformer 모두에 대한 실험에서 다양한 아키텍처와 데이터셋에서 일관된 향상이 관찰된다.
  • 대규모 내부 다중도메인 데이터셋에서 강력한 일반화 성능을 보여주며, 이는 프레임워크의 확장성과 견고성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.