[논문 리뷰] Low Latency ASR for Simultaneous Speech Translation
이 논문은 안정적인 부분 가설 추적과 동적 출력 수정을 활용한 연속적 디코딩을 사용하여 동시 번역을 위한 저지연 자동 음성 인식(ASR) 시스템을 제안한다. 약속 지연(latency)이 아닌 단어 수준의 지연을 측정함으로써, 단어 오류율(WER)을 훼손하지 않은 채 평균 단어 지연을 18.1초에서 1.1초로 감소시켜 라이브 강의와의 실시간 동기화를 크게 향상시킨다.
User studies have shown that reducing the latency of our simultaneous lecture translation system should be the most important goal. We therefore have worked on several techniques for reducing the latency for both components, the automatic speech recognition and the speech translation module. Since the commonly used commitment latency is not appropriate in our case of continuous stream decoding, we focused on word latency. We used it to analyze the performance of our current system and to identify opportunities for improvements. In order to minimize the latency we combined run-on decoding with a technique for identifying stable partial hypotheses when stream decoding and a protocol for dynamic output update that allows to revise the most recent parts of the transcription. This combination reduces the latency at word level, where the words are final and will never be updated again in the future, from 18.1s to 1.1s without sacrificing performance in terms of word error rate.
연구 동기 및 목표
- 실시간 동시 강의 번역 시스템에서 저지연 음성 인식의 필수적인 필요성을 해결하기 위해.
- 지속적인 스트림 디코딩 환경에서 약속 지연보다 더 정확한 지연 측정 지표를 제공하기 위해 단어 수준의 지연을 도입하기 위해.
- 특히 실시간, 분할되지 않은 음성 입력 환경에서 정확도를 저하시키지 않은 채 지연을 감소시키기 위해.
- 강사의 제스처와 슬라이드와 동기화되는 실시간으로 타이밍이 맞는 번역 및 전사 출력을 가능하게 하기 위해.
제안 방법
- 최대한 이르게 안정적인 부분 가설을 출력하기 위해 점진적 가설 추적 기반의 연속적 디코딩을 적용한다.
- 더 높은 확률의 시퀀스가 나타날 경우 이전에 출력된 단어를 수정할 수 있도록 동적 출력 업데이트 프로토콜을 도입한다.
- 음성 입력에서 최종적으로 변경 불가능한 출력으로 이르는 시간으로 정의된 단어 수준의 지연을 측정하여 사용자가 느끼는 지연을 더 정확히 반영한다.
- 저지연 조건 하에서도 강력한 인식 성능을 확보하기 위해 4-그램 언어 모델(150만 개 이상의 단어)과 1,600 뉴런 레이어를 갖춘 DNN 음향 모델을 사용한다.
- 피크 지연을 제어하면서도 특히 문제적 음성 문장에서 높은 정확도를 유지하기 위해 길이 제한 기법을 적용한다.
- IWSLT 2015의 8개 TED 강연에서 시스템을 평가하여 모든 시스템의 WER, RTF, 약속 지연, 단어 지연를 측정한다.
실험 결과
연구 질문
- RQ1지속적 실시간 음성 인식 환경에서 약속 지연보다 단어 수준의 지연이 사용자 인식 지연을 더 정확히 반영하는 이유는 무엇인가?
- RQ2정확도를 저하시키지 않은 채 동시 번역에서 단어 수준의 지연을 줄일 수 있는 기법은 무엇인가?
- RQ3시스템이 이후에 이전 출력을 수정할 수 있을 때, 동적 출력 수정이 지연에 어떻게 기여하는가?
- RQ4길이 제한 전략이 어려운 음성 세그먼트에서 피크 지연과 인식 성능에 미치는 영향은 무엇인가?
주요 결과
- 제안된 시스템은 단어 오류율(WER)에 영향을 주지 않은 채 평균 단어 지연을 18.1초에서 1.1초로 감소시켜 94% 향상시켰다.
- 최고 성능을 보인 구성(Update)에서는 최대 단어 지연가 9.0초에 그치며, 베이스라인 시스템(Update-NA)의 23.5초보다 훨씬 낮았다.
- WER와 RTF가 유사한 베이스라인-1 및 베이스라인-2와 비교해도 Portion 및 Update 시스템이 단어 지연에서 뚜렷한 우월성을 보였으며, 이는 약속 지연과 RTF만으로는 지연을 충분히 반영하지 못함을 보여준다.
- 가설 안정화에 3초의 길이 제한을 적용함으로써 높은 정확도를 유지하면서 피크 지연을 감소시켰으며, 이는 피크 지연을 최소한의 성능 손실로 효과적으로 제어할 수 있음을 시사한다.
- 동적 출력 업데이트 메커니즘은 이후 수정이 가능할 수 있는 초기에 안정적인 출력을 제공함으로써, 초기 출력이 그대로 유지될 경우 지연을 줄이는 데 기여한다.
- 결과적으로 단어 수준의 지연는 지속적이고 분할되지 않은 입력 환경에서 실시간 음성 인식 시스템 평가에 있어 약속 지연이나 RTF보다 더 의미 있는 지표임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.