[논문 리뷰] Textual Echo Cancellation
이 논문은 원본 텍스트를 경량 사이드 인풋으로 사용하여 겹치는 말소리에서 에코를 제거하는 순서-순서 모델인 텍스트 에코 취소(Textual Echo Cancellation, TEC)를 제안한다. 이는 기존의 AEC 방법에 비해 지연과 통신 오버헤드를 크게 줄인다. TEC는 복수의 간섭 음성 상황에서 테스트-클린 데이터셋에서 14.8% WER와 6.46 MCD를 기록하며 최신 기술 수준(SOTA) 성능을 달성했으며, 최소한의 사이드 정보를 사용함에도 불구하고 베이스라인 방법을 능가한다.
In this paper, we propose Textual Echo Cancellation (TEC) - a framework for cancelling the text-to-speech (TTS) playback echo from overlapping speech recordings. Such a system can largely improve speech recognition performance and user experience for intelligent devices such as smart speakers, as the user can talk to the device while the device is still playing the TTS signal responding to the previous query. We implement this system by using a novel sequence-to-sequence model with multi-source attention that takes both the microphone mixture signal and source text of the TTS playback as inputs, and predicts the enhanced audio. Experiments show that the textual information of the TTS playback is critical to enhancement performance. Besides, the text sequence is much smaller in size compared with the raw acoustic signal of the TTS playback, and can be immediately transmitted to the device or ASR server even before the playback is synthesized. Therefore, our proposed approach effectively reduces Internet communication and latency compared with alternative approaches such as acoustic echo cancellation (AEC).
연구 동기 및 목표
- 사용자가 TTS 재생 응답 중에 말할 때 지능형 기기에서 발생하는 에코 간섭 문제를 해결하기 위해.
- 에코 취소 시스템의 지연과 인터넷 통신 오버헤드를 줄이기 위해, 음성 에코 신호 대신 원본 텍스트를 사이드 인풋으로 사용하기 위해.
- 사용자가 TTS 응답을 방해하는 실시간 다자간 대화 상황에서 음성 인식의 강인성을 향상시키기 위해.
- 합성된 TTS 재생과 실제 음성 에코 간의 불일치 문제를 피할 수 있는 프레임워크를 개발하기 위해.
- 실제로 에코 신호에 접근하지 않더라도 텍스트 정보만으로도 에코 취소 성능을 크게 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 다중 소스 어텐션을 갖춘 순서-순서 모델을 사용하며, 마이크 믹스처 신호와 TTS 재생의 원본 텍스트를 입력으로 받는다.
- 어텐션 메커니즘을 활용해 원본 텍스트를 해당 TTS 음성과 암묵적으로 정렬함으로써, 명시적인 음성-텍스트 정렬 알고리즘의 필요성을 제거한다.
- 디코더는 마이크 믹스처와 원본 텍스트에 모두 주의를 기울여 향상된 음성 신호를 생성하며, 텍스트적 맥락을 통해 에코 경로를 모델링한다.
- 프레임워크는 VCTK와 LibriTTS 데이터셋에서 생성한 합성된 겹치는 말소리 데이터를 기반으로 엔드 투 엔드로 훈련된다. 이는 실시간 사용자-기기 상호작용을 시뮬레이션한다.
- 사이드 인풋은 원본 텍스트에 국한되며, 이는 원시 음성보다 훨씬 작아서 서버에서 기기로의 저지연 전송이 가능하다.

실험 결과
연구 질문
- RQ1TTS 재생의 원본 텍스트를 실제 TTS 음성 신호가 없이도 겹치는 말소리에서 에코를 제거하는 데 효과적으로 사이드 인풋으로 사용할 수 있는가?
- RQ2TEC 시스템의 성능이 TTS 재생 신호를 입력으로 사용하는 기존 AEC 방법과 비교해 지연과 통신 비용 측면에서 어떻게 다른가?
- RQ3음성 신호 대신 텍스트 정보를 사용함으로써 훈련과 실제 운영 환경 간의 불일치 문제를 줄일 수 있는가?
- RQ4사이드 정보가 전혀 없는 시스템과 비교해 텍스트 사이드 인풋이 에코 취소 성능을 얼마나 향상시키는가?
- RQ5TEC 프레임워크는 다양한 억양과 노이즈 조건에서도 일반화 가능한가? 복수의 간섭 음성이 존재할 경우 성능은 어떻게 되는가?
주요 결과
- 복수의 간섭 음성이 존재하는 상황에서 TEC는 테스트-클린 서브셋에서 14.8% WER, 6.46 MCD, 2.39 MOS를 기록하며, 사이드 인풋이 없는 베이스라인 시스템보다 뚜렷이 뛰어난 성능을 보였다.
- 단일 간섭 음성이 존재하는 테스트-클린 서브셋에서는 TEC가 10.2% WER, 5.98 MCD, 2.05 MOS를 기록하며, 강력한 에코 취소 성능을 입증했다.
- TEC와 AEC-Seq2seq 간의 성능 격차는 직접적인 음성 신호 입력 부족 탓이지만, TEC는 사이드 인풋 크기와 GFLOPS가 훨씬 낮아 지연과 대역폭을 줄였다.
- TEC는 Vanilla-Seq2seq를 능가함으로써, 텍스트 정보가 효과적인 에코 취소에 핵심적임을 확인했다.
- TEC는 단일 간섭 음성보다 복수 간섭 음성 상황에서 더 우수한 성능을 보였는데, 이는 VCTK 데이터셋에서의 짧은 발화 지속시간으로 인해 간섭 지속시간이 줄었기 때문으로 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.