Skip to main content
QUICK REVIEW

[论文解读] An efficient encoder-decoder architecture with top-down attention for speech separation

Kai Li, Runxuan Yang|arXiv (Cornell University)|Sep 30, 2022
Speech and Audio Processing被引用 15
一句话总结

该论文提出TDANet,一种受生物启发的编码器-解码器架构,用于语音分离,通过利用自上而下的注意力机制,在显著降低计算成本的同时实现最先进的性能。通过集成全局注意力模块和级联的局部注意力层,TDANet将乘加操作数(MACs)减少至原始Sepformer的5%,CPU推理时间减少至10%,同时在三个基准数据集上保持了具有竞争力的分离质量。

ABSTRACT

Deep neural networks have shown excellent prospects in speech separation tasks. However, obtaining good results while keeping a low model complexity remains challenging in real-world applications. In this paper, we provide a bio-inspired efficient encoder-decoder architecture by mimicking the brain's top-down attention, called TDANet, with decreased model complexity without sacrificing performance. The top-down attention in TDANet is extracted by the global attention (GA) module and the cascaded local attention (LA) layers. The GA module takes multi-scale acoustic features as input to extract global attention signal, which then modulates features of different scales by direct top-down connections. The LA layers use features of adjacent layers as input to extract the local attention signal, which is used to modulate the lateral input in a top-down manner. On three benchmark datasets, TDANet consistently achieved competitive separation performance to previous state-of-the-art (SOTA) methods with higher efficiency. Specifically, TDANet's multiply-accumulate operations (MACs) are only 5\% of Sepformer, one of the previous SOTA models, and CPU inference time is only 10\% of Sepformer. In addition, a large-size version of TDANet obtained SOTA results on three datasets, with MACs still only 10\% of Sepformer and the CPU inference time only 24\% of Sepformer.

研究动机与目标

  • 为解决基于深度学习的语音分离方法中模型复杂度过高的挑战,特别是针对边缘设备的部署问题。
  • 探究受人类大脑处理机制启发的自上而下注意力机制是否能在不牺牲性能的前提下提升效率。
  • 设计一种轻量化但强大的语音分离模型,在大幅降低计算成本的同时保持高精度。
  • 证明自上而下的注意力机制可作为日益复杂的基于Transformer架构的更高效替代方案。

提出的方法

  • TDANet采用编码器-解码器架构,包含自下而上、自上而下以及横向连接,模仿大脑的分层感官处理机制。
  • 全局注意力(GA)模块从多尺度声学特征中提取自上而下的注意力信号,并调制不同尺度的特征。
  • 级联的局部注意力(LA)层利用相邻层的特征生成局部注意力信号,以自上而下的方式调制横向输入。
  • 编码器使用卷积核大小为5、步长为2的深度可分离卷积,随后接门控线性单元(GLN),以实现特征下采样。
  • 解码器使用最近邻上采样和LA层来恢复高分辨率特征,并通过可学习参数实现自适应调制。
  • 模型采用端到端训练,损失函数针对分离质量进行优化,效率通过MACs、GPU/CPU推理时间以及参数量进行衡量。

实验结果

研究问题

  • RQ1来自神经科学的自上而下注意力机制能否提升基于深度学习的语音分离模型的效率?
  • RQ2是否可能在显著降低模型复杂度和推理成本的前提下实现最先进的分离性能?
  • RQ3与标准的基于Transformer的架构相比,受生物启发的注意力机制在性能和效率方面表现如何?
  • RQ4具备自上而下注意力机制的轻量化模型能否在准确率和计算效率两方面均超越现有SOTA模型?

主要发现

  • TDANet在LRS2-2Mix、Libri2Mix和WHAM!数据集上实现了具有竞争力的分离性能,SI-SNRi分别达到13.2、16.9和14.8,与或超过此前的SOTA模型。
  • TDANet将MACs降低至仅Sepformer的5%,CPU推理时间降低至10%,同时保持了高性能。
  • TDANet大模型版本(TDANet Large)在所有三个数据集上均达到SOTA结果,MACs为Sepformer的10%,CPU推理时间为Sepformer的24%。
  • TDANet在推理速度上优于A-FRCNN和SuDORM-RF,GPU推理时间分别为其19%和18%,CPU推理时间分别为其15%和46%。
  • 训练时间也得到缩短:与DPTNet和Sepformer相比,TDANet的反向传播时间分别仅需13%和47%。
  • 该模型在低延迟(因果)设置下表现出色,优于轻量化模型如SuDORM-RF和A-FRCNN。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。