[论文解读] DiffuVolume: Diffusion Model for Volume based Stereo Matching
DiffuVolume 提出了一种基于扩散模型的成本体积过滤器,用于立体匹配,以任务特定的、类似注意力的扩散过滤器取代传统噪声注入,迭代去除冗余的几何信息。与以往基于扩散模型的方法相比,其端到端误差(EPE)降低22%,推理速度提升240倍,同时仅增加2%的参数量,便在所有基准测试中显著提升性能。
Stereo matching is a significant part in many computer vision tasks and driving-based applications. Recently cost volume-based methods have achieved great success benefiting from the rich geometry information in paired images. However, the redundancy of cost volume also interferes with the model training and limits the performance. To construct a more precise cost volume, we pioneeringly apply the diffusion model to stereo matching. Our method, termed DiffuVolume, considers the diffusion model as a cost volume filter, which will recurrently remove the redundant information from the cost volume. Two main designs make our method not trivial. Firstly, to make the diffusion model more adaptive to stereo matching, we eschew the traditional manner of directly adding noise into the image but embed the diffusion model into a task-specific module. In this way, we outperform the traditional diffusion stereo matching method by 22% EPE improvement and 240 times inference acceleration. Secondly, DiffuVolume can be easily embedded into any volume-based stereo matching network with boost performance but slight parameters rise (only 2%). By adding the DiffuVolume into well-performed methods, we outperform all the published methods on Scene Flow, KITTI2012, KITTI2015 benchmarks and zero-shot generalization setting. It is worth mentioning that the proposed model ranks 1st on KITTI 2012 leader board, 2nd on KITTI 2015 leader board since 15, July 2023.
研究动机与目标
- 解决成本体积中冗余几何信息导致的立体匹配性能下降与训练效率降低的问题。
- 克服传统扩散模型在密集预测任务(如立体匹配)中的局限性,其中像素级去噪既不准确又计算成本高昂。
- 设计一种轻量化、即插即用的模块,将基于扩散的过滤直接集成到立体匹配网络中,而无需改变其架构。
- 通过迭代信息过滤提升成本体积质量,从而增强从合成数据到真实世界数据的零样本泛化能力。
- 在多个基准测试中实现最先进性能,包括在 KITTI2012 和 KITTI2015 排行榜上位列榜首。
提出的方法
- 引入一种任务特定的扩散过程,将去噪目标从图像重建重新定义为视差图优化,将成本体积视为待过滤的输入。
- 用从视差图导出的可学习、类似注意力的过滤器替代扩散模型中的标准噪声预测,通过将视差图离散化为概率向量以实现更优的信息表示。
- 使用轻量级立体匹配网络直接预测视差图,避免使用复杂的 U-Net 来预测噪声,从而相比以往基于扩散模型的方法将推理速度提升240倍。
- 将扩散过滤器作为即插即用模块嵌入现有的基于成本体积的立体匹配网络中,仅增加2%的参数量即可实现性能提升。
- 采用 DDIM 采样策略以加速推理,同时保持高质量输出,并引入边缘图和粗视差图作为条件以稳定训练。
- 理论分析表明,修改后的优化目标(从噪声预测到视差图预测)在数学上等价于原始扩散目标,确保了训练的一致性与稳定性。
实验结果
研究问题
- RQ1扩散模型能否被有效重用于成本体积过滤,以减少立体匹配中的冗余信息,而无需依赖像素级去噪?
- RQ2基于视差图离散化的任务特定扩散过滤器,在准确率与推理速度方面相较于标准扩散模型表现如何?
- RQ3当在合成数据上预训练时,轻量化、即插即用的扩散过滤器在真实世界数据集上的泛化性能可提升至何种程度?
- RQ4扩散过滤器中的迭代优化过程是否能有效提升在边缘区域与无纹理表面等挑战性区域的性能?
- RQ5所提方法能否在包括 Scene Flow、KITTI、Middlebury 和 ETH3D 在内的多样化基准测试中均实现最先进性能?
主要发现
- 与基线基于扩散模型的立体匹配方法(Shao et al., 2022)相比,DiffuVolume 在端到端误差(EPE)上实现了22%的改进,证明了其显著的性能提升。
- 由于去除了对 U-Net 进行噪声预测的需求,转而使用轻量级视差预测器,该方法相比基线推理速度提升了240倍。
- 当集成到 RAFT-Stereo 中时,DiffuVolume 显著提升了零样本泛化能力,在 KITTI2015(完整)上实现5.56%的误差,在 ETH3D 上为2.50%,在 Middlebury 上为15.21%,优于 IGEV-Stereo 及其他 SOTA 方法。
- 在 KITTI2012 上,自2023年7月15日起,DiffuVolume 在官方排行榜上位列第一;在 KITTI2015 上位列第二,证实了其强大的泛化能力与鲁棒性。
- 可视化结果表明,DiffuVolume 有效减少了在无纹理区域与边缘区域的伪影,而传统扩散方法因像素生成不准确,常导致视差值偏移。
- 理论分析证实,将优化目标从噪声预测改为视差图预测在数学上等价于原始扩散目标,确保了训练的稳定性和有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。