Skip to main content
QUICK REVIEW

[论文解读] T-GSA: Transformer with Gaussian-weighted self-attention for speech enhancement

Jaeyoung Kim, Mostafa El‐Khamy|arXiv (Cornell University)|Oct 13, 2019
Speech and Audio Processing参考文献 18被引用 12
一句话总结

该论文提出T-GSA,一种基于Transformer的语音增强模型,采用高斯加权自注意力机制,根据帧间的时间距离衰减注意力权重,从而提升语音去噪性能。该方法显著优于标准Transformer和基于LSTM的模型,在多个数据集上的SDR和PESQ指标上达到最先进水平。

ABSTRACT

Transformer neural networks (TNN) demonstrated state-of-art performance on many natural language processing (NLP) tasks, replacing recurrent neural networks (RNNs), such as LSTMs or GRUs. However, TNNs did not perform well in speech enhancement, whose contextual nature is different than NLP tasks, like machine translation. Self-attention is a core building block of the Transformer, which not only enables parallelization of sequence computation, but also provides the constant path length between symbols that is essential to learning long-range dependencies. In this paper, we propose a Transformer with Gaussian-weighted self-attention (T-GSA), whose attention weights are attenuated according to the distance between target and context symbols. The experimental results show that the proposed T-GSA has significantly improved speech-enhancement performance, compared to the Transformer and RNNs.

研究动机与目标

  • 为解决标准Transformer在语音增强任务中表现不佳的问题,因语音信号的长程依赖性和物理特性与自然语言处理任务不同。
  • 通过结合信号相关性特性,引入基于距离的衰减机制,改进Transformer在声学信号上的注意力机制。
  • 开发一种自注意力机制,在保留相关性符号的同时降低远距离帧的影响,以模拟自然声学信号的行为。
  • 与现有循环神经网络及Transformer-based模型相比,实现更优的语音增强性能。

提出的方法

  • 提出高斯加权自注意力(GSA),其中注意力权重通过目标帧与上下文帧之间距离的可学习高斯函数进行缩放。
  • 将高斯权重矩阵 $ G_l $ 与原始得分矩阵 $ C_l^u $ 进行逐元素相乘,其中 $ g^l_{i,j} = e^{-|i-j|^2 / heta_l^2} $,$ heta_l $ 为可学习的方差参数。
  • 采用标准Transformer编码器架构,包含多头注意力、层归一化和前馈网络,但通过基于距离的高斯加权方式修改注意力机制。
  • 使用实值Transformer进行语音增强,对噪声STFT幅度谱应用输出掩码,通过ISTFT重建干净语音。
  • 采用联合损失函数联合优化SDR和PESQ,以同时提升客观质量与主观感知质量。
  • 在两个数据集上端到端训练模型:QUT-NOISE-TIMIT 和 VoiceBank-DEMAND,评估了实值与复值变体。

实验结果

研究问题

  • RQ1是否可通过引入基于距离衰减的改进自注意力机制,提升Transformer在语音增强任务中的性能?
  • RQ2与标准自注意力和注意力偏置相比,高斯加权注意力在SDR和PESQ指标上的表现如何?
  • RQ3所提出的T-GSA模型是否优于最先进的循环模型(如CNN-LSTM)在语音增强任务中的表现?
  • RQ4在注意力加权中使用可学习高斯方差对声学信号处理有何影响?
  • RQ5T-GSA模型是否能在多种噪声条件下实现泛化,并在客观与主观指标上保持一致的性能提升?

主要发现

  • 在QUT-NOISE-TIMIT数据集上,T-GSA在所有信噪比(SNR)范围内显著优于原始Transformer(O-T),SDR提升最高达1.5 dB,PESQ提升0.25–0.35分。
  • T-GSA超越了先前的SOTA模型CNN-LSTM,在QUT-NOISE-TIMIT数据集上达到19.57 dB SDR和3.06 PESQ,优于CNN-LSTM的19.14 dB和3.01。
  • 复值Transformer(C-T-GSA)相比实值T-GSA在SDR上高出0.1–0.2 dB,但PESQ性能下降,表明相位估计存在挑战。
  • 在VoiceBank-DEMAND数据集上,T-GSA取得4.18 CSIG、3.59 CBAK、3.62 COVL、3.06 PESQ、10.78 SSNR和19.57 SDR,优于所有对比的生成模型(包括SEGAN、WaveNet和TF-GAN)。
  • 注意力偏置与高斯加权之间的性能差距显著,表明通过高斯衰减建模负相关性比简单的位置偏置更有效。
  • 结果证实,通过可学习高斯权重建模距离相关的信号相关性,对Transformer架构在语音增强中的有效性至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。