Skip to main content
QUICK REVIEW

[论文解读] Cascaded Cross-Module Residual Learning towards Lightweight End-to-End Speech Coding

Kai Zhen, Jongmo Sung|arXiv (Cornell University)|Jun 18, 2019
Speech and Audio Processing参考文献 31被引用 13
一句话总结

本文提出级联交叉模块残差学习(CMRL),一种轻量级端到端语音编解码器,通过使用两个小型专用深度神经网络(DNN)模块的级联结构来重建语音残差,在低比特率下实现了最先进的主观质量,且仅需0.9百万参数——相比先前基于DNN的编解码器显著降低了模型复杂度。

ABSTRACT

Speech codecs learn compact representations of speech signals to facilitate data transmission. Many recent deep neural network (DNN) based end-to-end speech codecs achieve low bitrates and high perceptual quality at the cost of model complexity. We propose a cross-module residual learning (CMRL) pipeline as a module carrier with each module reconstructing the residual from its preceding modules. CMRL differs from other DNN-based speech codecs, in that rather than modeling speech compression problem in a single large neural network, it optimizes a series of less-complicated modules in a two-phase training scheme. The proposed method shows better objective performance than AMR-WB and the state-of-the-art DNN-based speech codec with a similar network architecture. As an end-to-end model, it takes raw PCM signals as an input, but is also compatible with linear predictive coding (LPC), showing better subjective quality at high bitrates than AMR-WB and OPUS. The gain is achieved by using only 0.9 million trainable parameters, a significantly less complex architecture than the other DNN-based codecs in the literature.

研究动机与目标

  • 在保持高主观质量的前提下,降低基于深度神经网络(DNN)的端到端语音编解码器的模型复杂度。
  • 解决现有DNN编解码器(如参数高达2000万的WaveNet模型)带来的高计算成本问题。
  • 开发一种模块化、级联式架构,通过在连续模块间学习残差来提升重建性能。
  • 确保与线性预测编码(LPC)的兼容性,以在高比特率下提升性能。
  • 仅使用极少的参数量,实现与AMR-WB和OPUS等标准编解码器相当的性能。

提出的方法

  • CMRL采用两阶段训练方案:先独立训练各模块,再对完整级联结构进行微调。
  • 级联中的每个模块学习重建前一模块留下的残差信号,实现渐进式优化。
  • 组件模块采用瓶颈残差块,膨胀率分别为1和2,降低参数量的同时保持表示能力。
  • 架构使用核大小为9的1D卷积和Leaky ReLU激活函数,采用子像素卷积进行上采样。
  • 模型可直接处理原始PCM信号或LPC残差,LPC系数以2.4 kbps的速率传输以保证兼容性。
  • 对量化后的残差信号应用熵编码,以实现8.85、15.85、19.85和23.85 kbps的目标比特率。

实验结果

研究问题

  • RQ1级联式模块化DNN架构是否能在更低的模型复杂度下,实现比单一大型网络端到端编解码器更好的主观质量?
  • RQ2在高比特率下,CMRL在主观听音测试中与AMR-WB和OPUS相比表现如何?
  • RQ3CMRL在客观指标(如PESQ和SNR)上,与Kankanahalli-Net等SOTA DNN编解码器相比,能提升多少?
  • RQ4将LPC作为预处理模块是否能提升性能,尤其是在高比特率下?
  • RQ5仅含0.9百万参数的轻量级模型是否能在多个比特率范围内实现具有竞争力的性能?

主要发现

  • 在原始PCM输入下,CMRL在23.85 kbps时PESQ得分为4.42,优于AMR-WB在23.85 kbps时的PESQ得分(4.13)和Kankanahalli-Net的PESQ得分(4.30)。
  • 在8.85 kbps时,CMRL的SNR(13.45 dB)超过AMR-WB在23.85 kbps时的SNR(9.82 dB),表明其具有更优的压缩效率。
  • 在LPC残差输入下,CMRL在MUSHRA主观测试中优于AMR-WB在19.85 kbps和23.85 kbps时的表现,且在23.85 kbps时略超OPUS。
  • 模型复杂度仅为0.9百万参数,不足WaveNet-based VAE编解码器(2000万参数)的5%,且比Kankanahalli-Net少40%。
  • 引入第二级模块并进行微调,使SNR和PESQ均有显著提升,验证了级联残差设计的有效性。
  • 双模块CMRL系统在15.85 kbps时的PESQ得分高于AMR-WB在23.85 kbps时的得分,表明其在低比特率下具有强大性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。