[论文解读] ConcealNet: An End-to-end Neural Network for Packet Loss Concealment in Deep Speech Emotion Recognition
ConcealNet 是一种端到端神经网络,通过在掩码感知机制下包裹循环生成单元,将分组丢失隐藏(PLC)集成到深度语音情感识别(SER)中。它在音频重建和情感预测方面实现了显著改进,尤其在频繁短时丢失情况下表现优异,双向和压力训练变体优于 0-替换和插值等基线方法。
Packet loss is a common problem in data transmission, including speech data transmission. This may affect a wide range of applications that stream audio data, like streaming applications or speech emotion recognition (SER). Packet Loss Concealment (PLC) is any technique of facing packet loss. Simple PLC baselines are 0-substitution or linear interpolation. In this paper, we present a concealment wrapper, which can be used with stacked recurrent neural cells. The concealment cell can provide a recurrent neural network (ConcealNet), that performs real-time step-wise end-to-end PLC at inference time. Additionally, extending this with an end-to-end emotion prediction neural network provides a network that performs SER from audio with lost frames, end-to-end. The proposed model is compared against the fore-mentioned baselines. Additionally, a bidirectional variant with better performance is utilised. For evaluation, we chose the public RECOLA dataset given its long audio tracks with continuous emotion labels. ConcealNet is evaluated on the reconstruction of the audio and the quality of corresponding emotions predicted after that. The proposed ConcealNet model has shown considerable improvement, for both audio reconstruction and the corresponding emotion prediction, in environments that do not have losses with long duration, even when the losses occur frequently.
研究动机与目标
- 为解决语音情感识别(SER)中缺乏端到端 PLC 解决方案的问题,其中分组丢失会降低模型性能。
- 开发一种神经网络,能够在循环架构内直接实现实时、逐帧的 PLC,实现与 SER 流水线的无缝集成。
- 通过一种新颖的压力训练方案,提升对长时丢失的鲁棒性。
- 使用带有连续情感标注的 RECOLA 数据集,评估 PLC 对 SER 性能的影响。
提出的方法
- 一个循环生成单元 $ R $,以堆叠的 LSTM 实现,被一个隐藏函数 $ F_R $ 包裹,该函数使用二值掩码 $ M_t $ 识别丢失帧。
- 当 $ M_t = 0 $ 时,隐藏单元 $ F_R $ 利用先前状态和掩码输入的上下文,预测一个隐藏帧 $ \hat{\mathbf{x}}_t $。
- 模型通过音频帧的重建损失和情感标签的交叉熵损失进行端到端训练。
- ConcealNet 的双向变体通过平均前向和后向隐藏状态,提升对丢失隐藏的上下文感知能力。
- 引入一种压力训练方案,模型在高丢包场景(如 $ p_L = 0.9 $)下进行训练,以提升对长丢包序列的泛化能力。
- 完整系统将 ConcealNet 与端到端 SER 头结合,实现从丢包输入中联合进行音频重建和情感预测。
实验结果
研究问题
- RQ1端到端神经 PLC 模块是否能在帧丢失条件下提升语音情感识别性能?
- RQ2与经典 PLC 基线方法(如 0-替换、线性插值)相比,ConcealNet 在音频重建和情感预测方面的表现如何?
- RQ3双向处理是否能提升 PLC 性能,尤其是在长时丢失场景下?
- RQ4压力训练是否能显著提升 ConcealNet 对长时分组丢失的鲁棒性?
- RQ5ConcealNet 与 SER 的端到端联合训练在多大程度上提升了整体系统性能?
主要发现
- 在中等丢包率(10.16%)下,ConcealNet 将情感预测 CCC 的下降幅度从原始模型的 76.93%(唤醒度)降至 75.99%,以及从 43.18% 降至 39.81%(愉悦度),表现出极小的性能下降。
- ConcealNet 的双向变体优于仅前向版本,在 10.16% 丢包率下,唤醒度 CCC 达到 76.86%,愉悦度为 43.18%。
- 在高丢包率(如 50.06% 和 90.15%)下,压力训练的 ConcealNet 模型性能显著优于非压力训练模型,尤其在愉悦度预测方面。
- 在最极端情况($ p_L = 0.9 $)下,0-替换基线在音频隐藏方面优于 ConcealNet,但压力训练有效缓解了这一问题,使情感预测准确率最高提升达 10 个百分点。
- 压力训练方案显著提升了对长时丢包序列的鲁棒性,即使 ConcealNet 需要恢复多达 9 个连续丢失帧,性能下降也得到有效抑制。
- 结合 ConcealNet 与 SER 头的完整端到端系统在 RECOLA 数据集上实现了最先进性能,证明了集成 PLC 与情感识别的可行性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。