Skip to main content
QUICK REVIEW

[论文解读] Robust Emotion Recognition from Low Quality and Low Bit Rate Video: A Deep Learning Approach

Bowen Cheng, Zhangyang Wang|arXiv (Cornell University)|Sep 10, 2017
Advanced Image Processing Techniques参考文献 34被引用 6
一句话总结

本文提出了一种深度学习框架,通过一种新颖的'max-mix'训练策略,联合执行从低比特率、低质量视频中的超分辨率(SR)和情感识别,构建一个对广泛下采样因子具有鲁棒性的单一'一劳永逸'模型。该方法显著优于独立的SR和识别流水线,在AVEC 2016基准测试中实现了更高的识别准确率和率失真效率。

ABSTRACT

Emotion recognition from facial expressions is tremendously useful, especially when coupled with smart devices and wireless multimedia applications. However, the inadequate network bandwidth often limits the spatial resolution of the transmitted video, which will heavily degrade the recognition reliability. We develop a novel framework to achieve robust emotion recognition from low bit rate video. While video frames are downsampled at the encoder side, the decoder is embedded with a deep network model for joint super-resolution (SR) and recognition. Notably, we propose a novel max-mix training strategy, leading to a single "One-for-All" model that is remarkably robust to a vast range of downsampling factors. That makes our framework well adapted for the varied bandwidths in real transmission scenarios, without hampering scalability or efficiency. The proposed framework is evaluated on the AVEC 2016 benchmark, and demonstrates significantly improved stand-alone recognition performance, as well as rate-distortion (R-D) performance, than either directly recognizing from LR frames, or separating SR and recognition.

研究动机与目标

  • 解决带宽受限视频传输中因空间分辨率降低而导致情感识别性能下降的挑战。
  • 开发一种统一的深度学习模型,同时执行超分辨率和情感识别,提升在不同视频质量水平下的鲁棒性。
  • 克服独立SR和识别流水线的局限性,这些流水线在低质量条件下往往无法优化识别准确率。
  • 提升在无线多媒体应用中网络带宽动态变化场景下的可扩展性和效率。
  • 在真实压缩条件下评估模型性能,包括量化和可变比特率。

提出的方法

  • 该框架采用端到端训练的深度卷积神经网络(SR-FCN),对超分辨率和情感识别进行联合优化。
  • 提出一种新颖的'max-mix'训练策略,模型在最大可能下采样因子(s=16)的下采样帧混合数据上进行训练,从而在所有较低下采样因子下均具备鲁棒性。
  • 通过混合不同下采样因子进行微调,以提升泛化能力并学习尺度不变特征。
  • 使用AVEC 2016数据集对框架进行评估,情感回归作为主要识别任务。
  • 在不同视频编码条件(不同量化参数)下测试联合模型,以评估率失真性能。
  • 该方法避免使用独立的SR和识别流水线,而是将两项任务整合到单一、优化的推理路径中。

实验结果

研究问题

  • RQ1单一深度学习模型是否能在无需重新训练的情况下,对广泛范围的视频下采样因子实现鲁棒的情感识别?
  • RQ2与两阶段流水线相比,联合优化超分辨率和识别在识别准确率和率失真效率方面表现如何?
  • RQ3所提出的'max-mix'训练策略是否能提升模型在不同视频质量和分辨率下的泛化能力与鲁棒性?
  • RQ4在视频压缩引起的失真下,联合SR-识别框架在多大程度上保持了识别性能?
  • RQ5该模型是否能通过主动下采样和高效编码,在最小化带宽使用的同时实现高识别准确率?

主要发现

  • 所提出的'一劳永逸'模型在相关系数(CC)和组内相关系数(CCC)方面显著优于直接从低分辨率帧进行识别或使用独立SR与识别流水线的结果。
  • 对于下采样因子s≤8的情况,联合模型表现出显著的性能提升,所有测试因子下均观察到CC和CCC的改善。
  • 即使在高量化条件下(如QP=32),该模型仍保持强大的识别性能,在0.24 bpp(s=3)和0.4 bpp(s=4)的比特率下性能损失可忽略不计。
  • max-mix训练策略使模型能够泛化到广泛的下采样因子,而无需为每个因子重新训练。
  • 率失真分析表明,该框架在带宽效率与识别准确率之间实现了有利的权衡,尤其在低比特率下表现优异。
  • 联合SR与识别框架在识别准确率和对压缩伪影的鲁棒性方面,均优于独立识别和两阶段流水线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。