Skip to main content
QUICK REVIEW

[论文解读] Textual Echo Cancellation

Shaojin Ding, Jia Ye|arXiv (Cornell University)|Aug 13, 2020
Speech and Audio Processing参考文献 50被引用 7
一句话总结

本文提出文本回声消除(TEC),一种带有多源注意力机制的序列到序列模型,利用TTS播放的源文本作为轻量级辅助输入,在重叠语音中实现回声消除,相比传统回声对消除(AEC)方法显著降低延迟和通信开销。TEC在存在多个干扰语音的情况下,于test-clean数据集上实现14.8% WER和6.46 MCD的最先进性能,优于基线方法,同时仅使用极少的辅助信息。

ABSTRACT

In this paper, we propose Textual Echo Cancellation (TEC) - a framework for cancelling the text-to-speech (TTS) playback echo from overlapping speech recordings. Such a system can largely improve speech recognition performance and user experience for intelligent devices such as smart speakers, as the user can talk to the device while the device is still playing the TTS signal responding to the previous query. We implement this system by using a novel sequence-to-sequence model with multi-source attention that takes both the microphone mixture signal and source text of the TTS playback as inputs, and predicts the enhanced audio. Experiments show that the textual information of the TTS playback is critical to enhancement performance. Besides, the text sequence is much smaller in size compared with the raw acoustic signal of the TTS playback, and can be immediately transmitted to the device or ASR server even before the playback is synthesized. Therefore, our proposed approach effectively reduces Internet communication and latency compared with alternative approaches such as acoustic echo cancellation (AEC).

研究动机与目标

  • 为解决智能设备在用户说话时TTS播放响应过程中出现的回声干扰问题。
  • 通过用源文本替代实际的TTS音频信号作为辅助输入,降低回声消除系统中的延迟和互联网通信开销。
  • 提升在实时多人语音场景中用户中断TTS响应时的语音识别鲁棒性。
  • 开发一种框架,避免在实际部署中合成TTS播放与实际声学回声之间的不匹配问题。
  • 证明仅使用文本信息即可显著提升回声消除性能,即使无法直接访问回声信号。

提出的方法

  • 采用带有多源注意力机制的序列到序列模型,将麦克风混合信号和TTS播放的源文本作为输入。
  • 模型利用注意力机制隐式对齐源文本与对应的TTS音频,无需显式的语音-文本对齐算法。
  • 解码器通过同时关注麦克风混合信号和源文本生成增强音频信号,通过文本上下文建模回声路径。
  • 该框架在LibriTTS和VCTK数据集的合成重叠语音数据上进行端到端训练,模拟实时用户-设备交互场景。
  • 辅助输入仅限于源文本,其大小远小于原始音频,从而实现在服务器与设备之间低延迟传输。
Fig. 1 : Acoustic echoes caused by TTS playback overlapping with user query.
Fig. 1 : Acoustic echoes caused by TTS playback overlapping with user query.

实验结果

研究问题

  • RQ1TTS播放的源文本能否有效用作辅助输入,在无需实际TTS音频信号的情况下实现重叠语音中的回声消除?
  • RQ2与使用TTS播放作为输入的传统AEC方法相比,TEC系统在延迟和通信成本方面的性能如何?
  • RQ3使用文本信息而非声学信号是否能减少训练与实际部署之间的不匹配问题?
  • RQ4与完全无辅助信息的系统相比,文本辅助输入在多大程度上提升了回声消除性能?
  • RQ5TEC框架能否在不同口音和噪声条件下泛化?在多个干扰语音条件下表现如何?

主要发现

  • 在存在多个干扰语音的test-clean子集上,TEC实现14.8% WER、6.46 MCD和2.39 MOS,显著优于无辅助输入的基线系统。
  • 在单个干扰语音条件下的test-clean子集上,TEC实现10.2% WER、5.98 MCD和2.05 MOS,展现出强大的回声消除性能。
  • TEC与AEC-Seq2seq之间性能差距归因于缺乏直接的声学信号输入,但TEC的辅助输入大小和GFLOPS远低于后者,显著降低延迟和带宽需求。
  • TEC优于Vanilla-Seq2seq,证实文本信息对有效回声消除至关重要。
  • 模型在多个干扰语音条件下的表现优于单个干扰语音条件,可能由于VCTK数据集中话语时长较短,从而减少了干扰持续时间。
Fig. 2 : Diagram of the textual echo cancellation framework.
Fig. 2 : Diagram of the textual echo cancellation framework.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。