Skip to main content
QUICK REVIEW

[论文解读] Faster and Accurate Classification for JPEG2000 Compressed Images in Networked Applications

Lahiru D. Chamain, Zhi Ding|arXiv (Cornell University)|Sep 4, 2019
Advanced Data Compression Techniques参考文献 13被引用 6
一句话总结

本文提出直接使用CDF 9/7小波变换(DWT)系数对JPEG2000压缩图像进行分类,无需重建RGB图像,从而实现更快、更准确的深度学习推理。通过在DWT系数上训练浅层卷积神经网络(CNN),并引入新型领域特定数据增强方法,该方法在CIFAR-10上实现最高1.5%的top-1准确率提升,在Tiny ImageNet上实现最高2.5%的提升,同时通过迁移学习将训练速度提升75%,并消除了昂贵的重建开销。

ABSTRACT

JPEG2000 (j2k) is a highly popular format for image and video compression.With the rapidly growing applications of cloud based image classification, most existing j2k-compatible schemes would stream compressed color images from the source before reconstruction at the processing center as inputs to deep CNNs. We propose to remove the computationally costly reconstruction step by training a deep CNN image classifier using the CDF 9/7 Discrete Wavelet Transformed (DWT) coefficients directly extracted from j2k-compressed images. We demonstrate additional computation savings by utilizing shallower CNN to achieve classification of good accuracy in the DWT domain. Furthermore, we show that traditional augmentation transforms such as flipping/shifting are ineffective in the DWT domain and present different augmentation transformations to achieve more accurate classification without any additional cost. This way, faster and more accurate classification is possible for j2k encoded images without image reconstruction. Through experiments on CIFAR-10 and Tiny ImageNet data sets, we show that the performance of the proposed solution is consistent for image transmission over limited channel bandwidth.

研究动机与目标

  • 消除云环境下的深度学习流水线中对JPEG2000压缩图像进行重建的计算开销。
  • 通过直接在从j2k流中提取的DWT系数上训练CNN,提升分类准确率和推理速度。
  • 开发针对DWT领域设计的有效数据增强技术,其性能优于传统空间变换。
  • 证明预训练的未压缩图像模型可被高效微调以适应带宽受限的压缩场景。
  • 在带宽受限的网络环境中验证DWT域分类的鲁棒性与效率。

提出的方法

  • 通过在去量化后访问解码器,直接从标准JPEG2000比特流中提取CDF 9/7 DWT系数。
  • 使用这些DWT系数作为输入,而非重建的RGB图像,训练深度CNN,实现在小波域中的端到端学习。
  • 设计新型增强技术(如DWT系数层面的翻转和位移),以保持信号结构,并在压缩下提升鲁棒性。
  • 在DWT域中使用更浅的CNN架构,以降低计算成本,同时与RGB域中的深层模型相比保持或提升准确率。
  • 通过微调在未压缩图像上预训练的模型,应用于低带宽场景,实现75%的训练时间减少。
  • 使用测试准确率、训练/推理速度以及在不同压缩比下的鲁棒性等指标,在CIFAR-10和Tiny ImageNet上评估性能。

实验结果

研究问题

  • RQ1深度CNN是否能在不进行RGB重建的情况下,直接在JPEG2000压缩图像上实现高分类准确率?
  • RQ2在DWT系数上使用更浅的网络架构进行训练,是否能实现更快的推理和训练速度,同时保持或提升准确率?
  • RQ3传统空间数据增强技术(如翻转和位移)在DWT域中是否有效,或是否具有破坏性?
  • RQ4能否将未压缩域中的预训练模型有效微调以适应压缩、带宽受限的场景,从而减少训练时间?
  • RQ5在使用DWT域模型与RGB域模型时,随着信道带宽减少,分类性能如何变化?

主要发现

  • 所提方法在CIFAR-10上使用DWT系数与新型增强技术,实现91.92%的top-1准确率,优于基于RGB模型的91.70%。
  • 在Tiny ImageNet上,DWT域模型实现67.56%的top-1准确率,较基线RGB模型的65.78%提升1.78%。
  • 当从预训练模型微调时,DWT域模型将训练时间减少75%,与RGB域中的发现一致。
  • 在CIFAR-10上,DWT模型的推理速度提升约4%(4283张/秒),高于RGB模型的4108张/秒,且无重建开销。
  • 该方法在带宽受限条件下保持或提升准确率,且随着压缩比增加,DWT模型的准确率增益持续扩大。
  • 使用DWT特定增强方法,与DWT域中标准增强相比,CIFAR-10的top-1准确率提升2.5%,Tiny ImageNet提升超过1%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。