[论文解读] Optimizing JPEG Quantization for Classification Networks
本文提出针对深度学习分类网络而非人眼视觉感知或最小失真优化JPEG量化表(Q-tables)。通过使用高分辨率ImageNet数据集,并采用排序随机搜索与超参数优化方法调优Q-tables,作者在相同压缩率下实现最高2%的top-1准确率提升,或在固定准确率下实现10%至200%的压缩率提升,优于标准JPEG及更复杂的优化方法。
Deep learning for computer vision depends on lossy image compression: it reduces the storage required for training and test data and lowers transfer costs in deployment. Mainstream datasets and imaging pipelines all rely on standard JPEG compression. In JPEG, the degree of quantization of frequency coefficients controls the lossiness: an 8 by 8 quantization table (Q-table) decides both the quality of the encoded image and the compression ratio. While a long history of work has sought better Q-tables, existing work either seeks to minimize image distortion or to optimize for models of the human visual system. This work asks whether JPEG Q-tables exist that are "better" for specific vision networks and can offer better quality--size trade-offs than ones designed for human perception or minimal distortion. We reconstruct an ImageNet test set with higher resolution to explore the effect of JPEG compression under novel Q-tables. We attempt several approaches to tune a Q-table for a vision task. We find that a simple sorted random sampling method can exceed the performance of the standard JPEG Q-table. We also use hyper-parameter tuning techniques including bounded random search, Bayesian optimization, and composite heuristic optimization methods. The new Q-tables we obtained can improve the compression rate by 10% to 200% when the accuracy is fixed, or improve accuracy up to $2\%$ at the same compression rate.
研究动机与目标
- 探究JPEG量化表是否可专门针对深度神经网络(DNN)分类性能进行优化,而非针对人眼视觉感知或最小失真。
- 探索特定任务的Q-table是否能改善ImageNet等视觉数据集中的准确率-压缩率权衡。
- 评估多种优化策略(包括随机搜索、有界随机搜索、贝叶斯优化及组合启发式方法)在调优Q-tables中的表现。
- 确定先进优化技术是否优于简单基线方法,以找到有效的特定任务Q-tables。
- 提供一种实用且高效的Q-table生成方法,以在使用压缩图像数据时提升DNN性能。
提出的方法
- 作者重建了ImageNet验证集的高分辨率版本,以模拟使用新型Q-tables的JPEG压缩,避免依赖已压缩的数据集。
- 他们采用排序随机搜索基线生成候选Q-tables,其中系数从排序分布中采样,以优先考虑有意义的频率分量。
- 他们应用有界随机搜索、带局部网格搜索的贝叶斯优化,以及组合启发式优化方法,探索Q-table超参数空间。
- 对于每个候选Q-table,他们在经过压缩数据微调的ResNet50模型上测量top-1准确率和压缩率。
- 他们通过100次随机采样(每类700个类别,每类4张图像)进行交叉验证,以确保性能比较的统计稳健性。
- 他们通过测量每次试验的决策时间及找到10个“优质”Q-tables(定义为适应度值 > -0.001)所需的试验次数,评估效率。
实验结果
研究问题
- RQ1JPEG量化表能否被优化以在保持或提升压缩效率的同时提高深度学习模型的准确率?
- RQ2在寻找有效的特定任务Q-tables方面,简单随机搜索方法是否优于更复杂的超参数优化技术?
- RQ3针对人眼视觉感知优化的Q-table与针对DNN分类优化的Q-table之间是否存在显著性能差距?
- RQ4同一张Q-table是否在不同DNN架构中均有效,还是其性能特定于某一模型?
- RQ5在视觉模型的Q-table调优中,优化复杂度与性能增益之间的权衡如何?
主要发现
- 排序随机搜索生成的Q-table在MatchedFrequency和ImageNet验证集上,分别使ResNet50的top-1准确率在与标准JPEG质量50相同压缩率下提升了0.91%至1.16%。
- 相同方法在保持相同准确率的同时,使压缩率提升了10%至200%,显著优于标准JPEG。
- 所有优化方法(包括贝叶斯优化和组合启发式调优)均在统计上显著优于标准JPEG,所有比较的p值均小于10−5。
- 尽管计算成本更高,贝叶斯优化并未优于计算更简单的排序随机搜索,后者在找到优质Q-table方面更快且更高效。
- 组合启发式优化器仅需150次试验即可找到10个优质Q-tables,但其性能增益不足以证明其复杂性的合理性。
- 统计显著性检验确认,相较于标准JPEG的改进极为显著,最佳方法的p值小于10−11。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。