[论文解读] L3C-Stereo: Lossless Compression for Stereo Images
L3C-Stereo 提出了一种基于学习的无损压缩框架,用于立体图像,通过视差估计利用左视图特征的变形模块,以及用于像素级逻辑斯蒂混合分布的概率估计模块。该方法在 KITTI 2012/2015 和 Scene Flow 数据集上均实现了最先进的压缩性能,尤其在更高最大视差下压缩效果更优,并生成了可用于下游任务的可用质量视差图。
A large number of autonomous driving tasks need high-definition stereo images, which requires a large amount of storage space. Efficiently executing lossless compression has become a practical problem. Commonly, it is hard to make accurate probability estimates for each pixel. To tackle this, we propose L3C-Stereo, a multi-scale lossless compression model consisting of two main modules: the warping module and the probability estimation module. The warping module takes advantage of two view feature maps from the same domain to generate a disparity map, which is used to reconstruct the right view so as to improve the confidence of the probability estimate of the right view. The probability estimation module provides pixel-wise logistic mixture distributions for adaptive arithmetic coding. In the experiments, our method outperforms the hand-crafted compression methods and the learning-based method on all three datasets used. Then, we show that a better maximum disparity can lead to a better compression effect. Furthermore, thanks to a compression property of our model, it naturally generates a disparity map of an acceptable quality for the subsequent stereo tasks.
研究动机与目标
- 为自动驾驶系统中高清立体图像日益增长的存储需求提供解决方案。
- 通过视差估计利用视图间冗余,提升立体图像的无损压缩性能。
- 开发一种基于深度学习的压缩模型,联合优化压缩效率与视差图质量。
- 评估最大视差超参数与监督策略对压缩性能的影响。
- 生成高质量视差图作为副产品,用于后续立体视觉任务。
提出的方法
- 模型使用多尺度编码器从左右立体图像中提取特征图。
- 变形模块利用左视图特征与预测的视差图,重建右视图,从而提高预测置信度。
- 视差图通过受 PSMNet 启发的分层多尺度结构进行估计,实现精确的像素级对齐。
- 概率估计模块为自适应算术编码生成像素级的逻辑斯蒂混合分布。
- 模型采用分层熵编码方案,从最小尺度开始使用均匀先验,逐步从低分辨率到高分辨率重建特征与图像。
- 该架构采用端到端训练,重点是最小化比特流大小,同时保持无损重建。
实验结果
研究问题
- RQ1视差感知的特征变形能否提升无损立体图像压缩中概率估计的准确性?
- RQ2增大最大视差超参数对压缩性能与运行时有何影响?
- RQ3尽管准确度较低,自监督视差估计是否仍能带来比有监督学习更好的压缩效果?
- RQ4重建的右视图在压缩效率上相比仅使用左视图的性能提升程度如何?
- RQ5作为副产品生成的视差图在多大程度上可达到下游立体任务的可接受质量?
主要发现
- L3C-Stereo 在 KITTI 2012、KITTI 2015 和 Scene Flow 三个数据集上,均优于手工设计的方法(PNG、WebP、FLIF)和基于学习的基线方法(L3C)。
- 增加最大视差可提升压缩性能,但过高的值会导致模型性能下降,原因可能是过拟合或噪声影响。
- 自监督视差估计生成的右视图重建质量优于有监督学习,可能是因为在遮挡区域减少了对真实标签的过拟合。
- 与仅使用左视图相比,重建的右视图在压缩效率上显著提升,证明了视图间重建的价值。
- 该模型作为副产品生成了质量可接受的视差图,可直接用于后续立体视觉任务。
- 计算复杂度与 L3C 接近,仅在 FLOPs 和运行时间上略有增加,尤其在高视差设置下增幅更小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。