[논문 리뷰] Turning Whisper into Real-Time Transcription System
이 논문은 로컬 합의 스트리밍 정책과 자가 적응 지연을 사용하여 오프라인 Whisper ASR 모델을 기반으로 한 실시간 음성 번역 및 번역 시스템인 Whisper-Streaming을 제시한다. 영어 장문 음성에서 평균 3.3초의 지연을 달성하며 높은 품질을 유지하여 실시간 多국어 회의 환경에서의 강건성과 실용성을 입증한다.
Whisper is one of the recent state-of-the-art multilingual speech recognition and translation models, however, it is not designed for real time transcription. In this paper, we build on top of Whisper and create Whisper-Streaming, an implementation of real-time speech transcription and translation of Whisper-like models. Whisper-Streaming uses local agreement policy with self-adaptive latency to enable streaming transcription. We show that Whisper-Streaming achieves high quality and 3.3 seconds latency on unsegmented long-form speech transcription test set, and we demonstrate its robustness and practical usability as a component in live transcription service at a multilingual conference.
연구 동기 및 목표
- 오프라인 Whisper ASR 모델을 활용해 실시간, 저지연 음성 번역 및 번역을 가능하게 하기 위해.
- 실제 지연 제약 조건 하에서도 높은 번역 품질을 유지하는 스트리밍 추론 파이프라인을 구현하고 평가하기 위해.
- 실세계의 다국어 회의 환경에서의 시스템의 강건성과 사용성 입증하기 위해.
- 산업 및 학술 용도로 사용 가능한 공개된, 프로덕션 수준의 구현 제공하기 위해.
- 미래의 실시간 다국어 음성 처리 분야 연구를 위한 강력한 기준 설정하기 위해.
제안 방법
- 로컬 합의 알고리즘을 사용해 스트리밍 추론 파이프라인을 확장함으로써 동시에 번역이 가능한 Whisper 모델을 확장한다.
- 번역 출력의 신뢰도에 기반해 동적으로 조정되는 자가 적응 지연 메커니즘을 적용한다.
- GPU에서 효율적이고 저지연 추론을 위해 CTranslate2를 사용하는 faster-whisper 추론 엔진을 사용한다.
- 분산형, 다중 소스, 다중 타겟 실시간 번역 및 번역을 위한 ELITR 프레임워크에 서버 컴ponent를 통합한다.
- 스트리밍 정렬 및 신뢰도 추정을 지원하기 위해 기본 Whisper 모델의 단어 수준 타임스탬프 및 문장 부호를 활용한다.
- 오디오를 청크 단위로 처리하는 버퍼 기반 처리 모델을 구현하며, 확인된 출력 세그먼트는 锁정되고 확인되지 않은 세그먼트는 시간이 지남에 따라 개선된다.

실험 결과
연구 질문
- RQ1오프라인 Whisper ASR 모델이 품질을 희생시키지 않고 실시간, 저지연 음성 번역에 효과적으로 적응할 수 있는가?
- RQ2로컬 합의 스트리밍 정책이 대규모, 다국어 음성 인식 작업에 적용되었을 때 성능은 어떠한가?
- RQ3장문의 분할되지 않은 음성에서 스트리밍 기반 Whisper 시스템의 도달 가능한 지연과 단어 오류율(WER)은 무엇인가?
- RQ4실세계의 다국어 실시간 음성 번역 시나리오에서 시스템의 강건성은 어떠한가?
- RQ5시스템은 프로덕션 수준의 분산 음성 처리 파이프라인에 신뢰성 있게 통합될 수 있는가?
주요 결과
- NVIDIA A40 GPU를 사용해 영어 ESIC 테스트 세트에서 Whisper-Streaming은 계산 인지 지연을 고려한 평균 3.3초의 지연을 달성한다.
- 시스템은 높은 번역 품질을 보이며, 영어 트랙에서 WER가 2.35%로 오프라인 Whisper 성능과 유사하다.
- 독일어와 체코어의 경우 각각 0.5초 지연에서 WER가 10.2%와 12.3%를 기록하여 강력한 다국어 일반화 능력을 보였다.
- 실시간 다국어 회의에서 성공적으로 배포되어 영어, 체코어, 우크라이나어 음성에서 모두 수용 가능한 지연과 높은 품질을 유지하며 강건성과 신뢰성을 입증했다.
- ELITR 프레임워크와의 통합을 통해 다중 언어 스트림의 실시간 분산 처리가 가능해졌으며, ASR 및 음성 번역 모두를 지원했다.
- Whisper-Streaming의 오픈소스 배포는 실시간 다국어 음성 처리를 위한 프로덕션 수준의 기준을 제공한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.