Skip to main content
QUICK REVIEW

[논문 리뷰] Turning Whisper into Real-Time Transcription System

Dominik Macháček, Raj Dabre|arXiv (Cornell University)|2023. 07. 27.
Speech Recognition and Synthesis인용 수 7
한 줄 요약

이 논문은 로컬 합의 스트리밍 정책과 자가 적응 지연을 사용하여 오프라인 Whisper ASR 모델을 기반으로 한 실시간 음성 번역 및 번역 시스템인 Whisper-Streaming을 제시한다. 영어 장문 음성에서 평균 3.3초의 지연을 달성하며 높은 품질을 유지하여 실시간 多국어 회의 환경에서의 강건성과 실용성을 입증한다.

ABSTRACT

Whisper is one of the recent state-of-the-art multilingual speech recognition and translation models, however, it is not designed for real time transcription. In this paper, we build on top of Whisper and create Whisper-Streaming, an implementation of real-time speech transcription and translation of Whisper-like models. Whisper-Streaming uses local agreement policy with self-adaptive latency to enable streaming transcription. We show that Whisper-Streaming achieves high quality and 3.3 seconds latency on unsegmented long-form speech transcription test set, and we demonstrate its robustness and practical usability as a component in live transcription service at a multilingual conference.

연구 동기 및 목표

  • 오프라인 Whisper ASR 모델을 활용해 실시간, 저지연 음성 번역 및 번역을 가능하게 하기 위해.
  • 실제 지연 제약 조건 하에서도 높은 번역 품질을 유지하는 스트리밍 추론 파이프라인을 구현하고 평가하기 위해.
  • 실세계의 다국어 회의 환경에서의 시스템의 강건성과 사용성 입증하기 위해.
  • 산업 및 학술 용도로 사용 가능한 공개된, 프로덕션 수준의 구현 제공하기 위해.
  • 미래의 실시간 다국어 음성 처리 분야 연구를 위한 강력한 기준 설정하기 위해.

제안 방법

  • 로컬 합의 알고리즘을 사용해 스트리밍 추론 파이프라인을 확장함으로써 동시에 번역이 가능한 Whisper 모델을 확장한다.
  • 번역 출력의 신뢰도에 기반해 동적으로 조정되는 자가 적응 지연 메커니즘을 적용한다.
  • GPU에서 효율적이고 저지연 추론을 위해 CTranslate2를 사용하는 faster-whisper 추론 엔진을 사용한다.
  • 분산형, 다중 소스, 다중 타겟 실시간 번역 및 번역을 위한 ELITR 프레임워크에 서버 컴ponent를 통합한다.
  • 스트리밍 정렬 및 신뢰도 추정을 지원하기 위해 기본 Whisper 모델의 단어 수준 타임스탬프 및 문장 부호를 활용한다.
  • 오디오를 청크 단위로 처리하는 버퍼 기반 처리 모델을 구현하며, 확인된 출력 세그먼트는 锁정되고 확인되지 않은 세그먼트는 시간이 지남에 따라 개선된다.
Figure 1: Illustration of processing three consecutive updates. The yellow highlighted text is a “prompt”, the previous context to follow. The black-bordered rectangle is an audio buffer, and the text inside is Whisper’s transcript generated from that sound segment. The blue vertical line is a times
Figure 1: Illustration of processing three consecutive updates. The yellow highlighted text is a “prompt”, the previous context to follow. The black-bordered rectangle is an audio buffer, and the text inside is Whisper’s transcript generated from that sound segment. The blue vertical line is a times

실험 결과

연구 질문

  • RQ1오프라인 Whisper ASR 모델이 품질을 희생시키지 않고 실시간, 저지연 음성 번역에 효과적으로 적응할 수 있는가?
  • RQ2로컬 합의 스트리밍 정책이 대규모, 다국어 음성 인식 작업에 적용되었을 때 성능은 어떠한가?
  • RQ3장문의 분할되지 않은 음성에서 스트리밍 기반 Whisper 시스템의 도달 가능한 지연과 단어 오류율(WER)은 무엇인가?
  • RQ4실세계의 다국어 실시간 음성 번역 시나리오에서 시스템의 강건성은 어떠한가?
  • RQ5시스템은 프로덕션 수준의 분산 음성 처리 파이프라인에 신뢰성 있게 통합될 수 있는가?

주요 결과

  • NVIDIA A40 GPU를 사용해 영어 ESIC 테스트 세트에서 Whisper-Streaming은 계산 인지 지연을 고려한 평균 3.3초의 지연을 달성한다.
  • 시스템은 높은 번역 품질을 보이며, 영어 트랙에서 WER가 2.35%로 오프라인 Whisper 성능과 유사하다.
  • 독일어와 체코어의 경우 각각 0.5초 지연에서 WER가 10.2%와 12.3%를 기록하여 강력한 다국어 일반화 능력을 보였다.
  • 실시간 다국어 회의에서 성공적으로 배포되어 영어, 체코어, 우크라이나어 음성에서 모두 수용 가능한 지연과 높은 품질을 유지하며 강건성과 신뢰성을 입증했다.
  • ELITR 프레임워크와의 통합을 통해 다중 언어 스트림의 실시간 분산 처리가 가능해졌으며, ASR 및 음성 번역 모두를 지원했다.
  • Whisper-Streaming의 오픈소스 배포는 실시간 다국어 음성 처리를 위한 프로덕션 수준의 기준을 제공한다.
Figure 2: Impact of VAD filter on latency and quality. The striking difference in VAD activated or deactivated for English vs German is due to German being the speech of an interpreter.
Figure 2: Impact of VAD filter on latency and quality. The striking difference in VAD activated or deactivated for English vs German is due to German being the speech of an interpreter.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.