[论文解读] End-to-end optimized image compression for multiple machine tasks
本文提出 'Connectors'——一种轻量级、与任务无关的神经模块,插入在速率优化的图像解码器与下游机器视觉模型之间,使单一、端到端优化的编码解码器(用于目标检测)在无需重新训练编码解码器或次要模型的前提下,通过微调即可在多个次要任务(如图像分类和语义分割)上实现更优性能。通过转换检测优化编码解码器的特征,Connectors 在 ImageNet-1K 上实现高达 8.75% 的 top-5 准确率提升,在 COCO 上实现 4.6% 的 mAP 提升。
An increasing share of captured images and videos are transmitted for storage and remote analysis by computer vision algorithms, rather than to be viewed by humans. Contrary to traditional standard codecs with engineered tools, neural network based codecs can be trained end-to-end to optimally compress images with respect to a target rate and any given differentiable performance metric. Although it is possible to train such compression tools to achieve better rate-accuracy performance for a particular computer vision task, it could be practical and relevant to re-use the compressed bit-stream for multiple machine tasks. For this purpose, we introduce 'Connectors' that are inserted between the decoder and the task algorithms to enable a direct transformation of the compressed content, which was previously optimized for a specific task, to multiple other machine tasks. We demonstrate the effectiveness of the proposed method by achieving significant rate-accuracy performance improvement for both image classification and object segmentation, using the same bit-stream, originally optimized for object detection.
研究动机与目标
- 为解决使用率-失真优化编码解码器进行多种机器视觉任务时的低效问题。
- 实现单一、端到端优化的编码解码器(例如,为物体检测训练)在多个下游任务(如分类、分割)中的复用。
- 开发一种轻量级、与任务无关的自适应机制,将主任务优化解码器的特征转换为适用于次要任务的表示,而无需重新训练编码解码器。
- 证明在复杂数据集(如 COCO)上进行端到端优化的编码解码器所保留的特征丰富性,当与简单可训练的连接器结合时,能有效泛化到多种视觉任务。
提出的方法
- 使用一种平衡率与检测准确率(mAP)而非 PSNR 的损失函数,端到端训练神经图像编码解码器用于目标检测。
- 使用预训练的、针对速率-检测性能优化的编码解码器(基于尺度超先验)对图像进行压缩,生成对检测优化但视觉失真的特征。
- 引入 'Connectors'——插入在解码器与次要任务模型之间的小型可训练神经模块(例如 1x1 卷积、深度可分离卷积、平均池化),用于转换特征表示。
- 以一次性的、与任务无关的方式训练 Connectors,将检测优化编码解码器的特征映射为更适用于分类和分割等次要任务的表示。
- 在检测优化编码解码器的特征上,对现成的分类和分割模型进行微调,利用 Connectors 提升特征兼容性。
- 在 ImageNet-1K(分类)、COCO-2017(目标检测)和 Cityscapes(语义分割)上评估性能,与基线率-失真编码解码器及率-准确率-失真编码解码器进行比较。
实验结果
研究问题
- RQ1一个为单一机器视觉任务(如目标检测)优化的图像编码解码器,是否可以无需重新编码或重新训练编码解码器,有效复用于多个其他下游任务(如分类、分割)?
- RQ2轻量级、与任务无关的 Connectors 在将检测优化编码解码器的特征转换为提升无关视觉任务性能方面,效果如何?
- RQ3在检测任务上进行端到端优化的编码解码器,是否能保留或增强对其他视觉任务有用的特征,即使视觉保真度被牺牲?
- RQ4与标准率-失真优化编码解码器相比,对检测优化特征进行微调策略在多大程度上能提升次要任务的准确率?
- RQ5Connectors 在多个数据集和任务上的性能,与直接在原始检测优化特征上进行推理相比如何?
主要发现
- 与基线率-失真编码解码器相比,使用检测优化编码解码器时,Connectors 在 COCO-2017 目标检测任务上实现了 mAP 的 4.6% 相对提升。
- 在 ImageNet-1K 上,Connectors 在 0.2203 BPP 的比特率下,将 top-5 分类准确率从 66.43% 提升至 75.18%,即提升了 8.75%,表现出强大的泛化能力。
- 即使不进行微调,带有 Connectors 的检测优化编码解码器在次要任务准确率上仍优于率-失真优化编码解码器,表明其特征实用性得以保留。
- 平均池化和 2D 深度可分离卷积 Connectors 显著提升了特征兼容性,其中后者实现的准确率增益高于简单的平均池化。
- 在低比特率下(例如 0.1119 BPP),Connectors 将 PSNR 从 J-FT 的 17.36 dB 提升至 J-FT + Conv 的 21.14 dB,表明特征转换能有效提升次要任务的重建质量。
- 在检测优化特征上微调 ResNet-50 分类器,其 top-1 和 top-5 准确率均高于在标准率-失真优化图像上微调的结果,证实了该特征空间的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。