[论文解读] Learning to Adapt Multi-View Stereo by Self-Supervision
本文提出了一种用于自监督多视角立体(MVS)重建的元学习方法,可在无需真实深度监督的情况下快速适应新领域。通过在多样化数据集上使用模型无关元学习(MAML)训练网络,并结合自监督微调,该方法提升了对领域分布偏移的鲁棒性——在自监督学习设置下,DTU数据集上的性能达到当前最先进水平,甚至在关键指标上超越了部分有监督基线方法。
3D scene reconstruction from multiple views is an important classical problem in computer vision. Deep learning based approaches have recently demonstrated impressive reconstruction results. When training such models, self-supervised methods are favourable since they do not rely on ground truth data which would be needed for supervised training and is often difficult to obtain. Moreover, learned multi-view stereo reconstruction is prone to environment changes and should robustly generalise to different domains. We propose an adaptive learning approach for multi-view stereo which trains a deep neural network for improved adaptability to new target domains. We use model-agnostic meta-learning (MAML) to train base parameters which, in turn, are adapted for multi-view stereo on new domains through self-supervised training. Our evaluations demonstrate that the proposed adaptation method is effective in learning self-supervised multi-view stereo reconstruction in new domains.
研究动机与目标
- 解决多视角立体重建中的领域偏移问题,即在某一环境(如户外场景)上训练的模型在另一环境(如室内物体扫描)上表现不佳的问题。
- 通过利用自监督学习,减少对昂贵且难以获取的真实深度标注的依赖。
- 通过元学习提升模型在新领域的泛化与适应能力,实现在少量标注数据下快速微调。
- 通过引入可学习的置信度掩码,降低遮挡等异常像素对自监督训练的影响,从而增强训练鲁棒性。
- 证明元学习模型在泛化能力上优于直接微调的模型,即使在使用监督预训练的情况下也表现更优。
提出的方法
- 采用模型无关元学习(MAML)训练基础网络权重,使其可通过少量步骤的自监督微调快速适应新领域。
- 在包含多样化室内与户外场景及真实深度的BlendedMVS数据集上预训练模型,以学习可迁移的特征。
- 在目标领域(如DTU数据集)上使用自监督学习对元学习模型进行微调,损失函数为可微分的重投影损失。
- 将MVSNet扩展为引入可学习的置信度掩码,为自监督损失中的每个像素分配权重,从而降低遮挡等异常像素的影响。
- 在代价体上使用3D卷积细化头预测深度,置信度掩码在训练过程中调制损失。
- 端到端训练置信度掩码,采用可微分损失函数,惩罚高置信度像素上的高误差,从而提升对噪声预测的鲁棒性。
实验结果
研究问题
- RQ1与标准微调相比,元学习是否能提升在未见领域中的自监督多视角立体重建性能?
- RQ2引入可学习的置信度掩码是否能通过降低遮挡和异常值的影响来增强自监督训练?
- RQ3元学习的自监督微调与监督预训练后接自监督微调相比,性能如何?
- RQ4所提方法能否在DTU等基准数据集上实现与有监督方法相当的性能?
- RQ5该方法是否能在从户外建筑场景到室内物体扫描等多样化领域间实现良好泛化?
主要发现
- 所提元学习方法在DTU数据集上2 mm阈值下的F-score达到68.67%,优于自监督基线MVSNet(51.98%)和有监督的SurfaceNet(67.49%)在相同指标下的表现。
- 引入置信度掩码后,F-score达到68.67%(无掩码时为65.31%),证明了异常值处理的有效性。
- 在自监督微调设置下,元学习模型的总体F-score(68.67%)优于有监督预训练基线(Sup PT bMVS, Self FT DTU)的67.49%。
- 定性结果表明,重建结果在完整性和细节保留方面表现更优,其质量接近有监督的MVSNet,且优于SurfaceNet。
- 消融实验表明,即使预训练采用监督方式,元学习仍能显著提升模型在新领域的适应性能,优于标准微调。
- 在DTU基准上,该方法在自监督MVS方法中达到最先进性能,尤其在1 mm和2 mm阈值下的总体F-score表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。