[论文解读] AdaStereo: A Simple and Efficient Approach for Adaptive Stereo Matching
AdaStereo 提出了一种简单、高效且完整的立体匹配域自适应流程,通过在三个层面实现合成数据与真实世界数据之间的特征对齐:输入图像(通过非对抗性渐进式色彩迁移)、内部特征(通过无参成本归一化)以及输出视差(通过自监督的遮挡感知重建)。该方法在 KITTI、Middlebury、ETH3D 和 DrivingStereo 上实现了无需在目标域真实标签上微调的最先进跨域性能。
Recently, records on stereo matching benchmarks are constantly broken by end-to-end disparity networks. However, the domain adaptation ability of these deep models is quite poor. Addressing such problem, we present a novel domain-adaptive pipeline called AdaStereo that aims to align multi-level representations for deep stereo matching networks. Compared to previous methods for adaptive stereo matching, our AdaStereo realizes a more standard, complete and effective domain adaptation pipeline. Firstly, we propose a non-adversarial progressive color transfer algorithm for input image-level alignment. Secondly, we design an efficient parameter-free cost normalization layer for internal feature-level alignment. Lastly, a highly related auxiliary task, self-supervised occlusion-aware reconstruction is presented to narrow down the gaps in output space. Our AdaStereo models achieve state-of-the-art cross-domain performance on multiple stereo benchmarks, including KITTI, Middlebury, ETH3D, and DrivingStereo, even outperforming disparity networks finetuned with target-domain ground-truths.
研究动机与目标
- 解决在合成数据上训练的端到端立体匹配网络在域泛化能力差的问题。
- 识别并弥合合成数据(如 SceneFlow)与真实世界数据(如 KITTI、Middlebury)立体数据集之间在三个层次上的域差距:输入、内部特征和输出视差。
- 开发一种完整、非对抗性且高效的立体匹配域自适应流程,避免生成对抗网络(GAN)引起的失真,并减少对目标域标注的依赖。
- 仅使用合成数据进行预训练,无需在目标域真实标签上微调,即可在真实世界基准上实现最先进性能。
提出的方法
- 一种非对抗性渐进式色彩迁移算法在训练过程中对齐源域(合成)与目标域(真实)之间的输入色彩分布,避免 GAN 引入的几何伪影。
- 引入一种无参成本归一化层,通过通道和像素级归一化对齐内部匹配代价体积,提升跨域的特征一致性。
- 采用自监督的遮挡感知重建任务,通过重建目标域图像并预测遮挡掩码来对齐输出视差图,增强几何一致性。
- 提出一种域协同学习策略,通过在源域和目标域上联合训练以提升遮挡掩码预测能力,解决遮挡区域重建任务的病态性问题。
- 将整个流程集成到标准立体匹配网络(如 PSMNet)中,实现端到端训练,且仅需极少的架构修改。
- 在多个基准上评估该方法,无需目标域微调,完全依赖 SceneFlow 上的预训练。
实验结果
研究问题
- RQ1非对抗性渐进式色彩迁移方法是否能有效对齐立体匹配中的输入级域差距,且不引入几何失真?
- RQ2如何在不引入可学习参数的前提下,对齐合成与真实域之间的内部特征分布(代价体积)?
- RQ3自监督的遮挡感知重建任务是否能改善输出空间对齐并提升跨域视差预测精度?
- RQ4结合输入、特征和输出层级对齐是否能显著优于现有域泛化或域自适应方法,在真实世界立体匹配基准上实现更优泛化性能?
- RQ5在合成数据上预训练的域自适应立体模型是否能超越在真实世界真实标签上微调的模型?
主要发现
- AdaStereo 在 ETH3D 基准上达到最先进性能,在 2 像素误差指标上排名第一,且未进行任何目标域微调。
- 在 Middlebury 基准上,基于 SceneFlow 预训练的 Ada-PSMNet 实现 13.7% 的 2 像素误差率,优于所有微调的端到端立体匹配网络,包括 PSMNet、iResNet 和 EdgeStereo。
- 在 KITTI 2015 基准上,Ada-PSMNet 实现 3.08% 的 D1 误差,超越所有无监督和弱监督方法,并与 KITTI 微调的 GC-Net 性能相当。
- 消融实验表明,色彩迁移、成本归一化和遮挡感知重建三个模块均对最终性能有显著贡献,其中重建模块带来的增益最大。
- 该方法不仅优于域泛化基线模型,还在所有评估基准上超越了在目标域真实标签上微调的模型,展现出强大的零样本域自适应能力。
- 自监督的遮挡感知重建模块通过在训练中引入真实世界数据的场景几何信息,有效提升了视差预测性能,即使没有显式标注也表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。