[论文解读] GraftNet: Towards Domain Generalized Stereo Matching with a Broad-Spectrum and Task-Oriented Feature
本文提出 GraftNet,一种领域泛化的立体匹配框架,通过基于余弦相似度的代价体积,将 ImageNet 预训练模型中的广谱特征嫁接到立体匹配网络中,从而提升泛化能力。通过将特征提取与代价聚合解耦,并利用轻量级适配器对嫁接的特征进行优化,GraftNet 在 KITTI 2015、KITTI 2012、Middlebury 和 ETH3D 数据集上实现了最先进性能,且无需在目标领域进行微调。
Although supervised deep stereo matching networks have made impressive achievements, the poor generalization ability caused by the domain gap prevents them from being applied to real-life scenarios. In this paper, we propose to leverage the feature of a model trained on large-scale datasets to deal with the domain shift since it has seen various styles of images. With the cosine similarity based cost volume as a bridge, the feature will be grafted to an ordinary cost aggregation module. Despite the broad-spectrum representation, such a low-level feature contains much general information which is not aimed at stereo matching. To recover more task-specific information, the grafted feature is further input into a shallow network to be transformed before calculating the cost. Extensive experiments show that the model generalization ability can be improved significantly with this broad-spectrum and task-oriented feature. Specifically, based on two well-known architectures PSMNet and GANet, our methods are superior to other robust algorithms when transferring from SceneFlow to KITTI 2015, KITTI 2012, and Middlebury. Code is available at https://github.com/SpadeLiu/Graft-PSMNet.
研究动机与目标
- 为解决立体匹配中的领域偏移问题,即在合成数据上训练的模型在真实图像上表现不佳。
- 探究大规模预训练模型中的广谱特征是否能提升立体匹配中的跨域泛化能力。
- 将特征提取与代价聚合解耦,以实现模块化、无需微调的特征嫁接。
- 利用轻量级适配器网络从通用特征中恢复任务特定信息。
- 在训练过程中无需目标领域标注,实现领域泛化。
提出的方法
- 将来自 ImageNet 预训练模型(如 VGG、ResNet)的广谱特征嫁接到立体匹配网络的代价聚合模块中。
- 利用特征之间的余弦相似度构建广义代价体积,确保度量不变性并消除语义干扰。
- 使用浅层、任务特定的适配器网络在代价计算前优化嫁接的特征,增强任务相关性。
- 仅在源域(如 SceneFlow)上训练适配器,利用广谱特征的鲁棒性以减少过拟合。
- 将嫁接并优化后的特征集成到 PSMNet 和 GANet 架构中,形成 Graft-PSMNet 和 Graft-GANet。
- 使用余弦相似度将任意通道数的特征投影为标量代价体积,实现与多样化特征的兼容性。

实验结果
研究问题
- RQ1来自大规模预训练模型的广谱特征是否能提升立体匹配中的领域泛化能力?
- RQ2使用余弦相似度构建代价体积是否能实现在无需微调情况下的预训练特征有效嫁接?
- RQ3轻量级适配器网络能否从通用特征中恢复任务特定信息,从而提升立体匹配性能?
- RQ4GraftNet 在多种真实世界数据集上与现有鲁棒及领域泛化立体匹配方法相比表现如何?
- RQ5嫁接特征在处理领域偏移时存在哪些局限性,特别是在 ETH3D 等具有非典型图像风格的数据集上?
主要发现
- Graft-PSMNet 和 Graft-GANet 在 KITTI 2015、KITTI 2012 和 Middlebury 上达到最先进性能,3像素误差率分别为 5.3% 和 5.4%,优于其他鲁棒方法。
- 在 ETH3D 上,模型的 3像素误差率分别为 10.7% 和 6.2%,性能较低,原因在于 ImageNet 中灰度图像表示有限。
- 基于余弦相似度的代价体积使来自不同模型(如 ResNet18、ResNet50 和 OFE)的特征能够有效嫁接,且性能提升一致。
- 无需微调的嫁接显著优于直接替换特征,验证了广义代价空间的有效性。
- 当结合数据增强(如颜色抖动)时,Graft-PSMNet 和 Graft-GANet 在 KITTI 2015 上的性能进一步提升,3像素误差率分别降至 4.8% 和 4.9%。
- 该方法表明,广谱特征可在无需目标领域标注的情况下被有效用于立体匹配,实现真正的领域泛化。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。