[论文解读] THE Benchmark: Transferable Representation Learning for Monocular Height Estimation
本文提出了 THE Benchmark,一个大规模跨数据集的单目高度估计(MHE)基准,包含一个合成数据集(GTAH)和一个真实世界数据集(AHN),支持迁移学习研究。该研究在 Swin Transformer 框架中提出了一种尺度可变形卷积模块,展示了在少样本跨数据集迁移设置下的优越性能,尤其当在 GTAH 上预训练时,表现优于 ImageNet 或遥感自监督模型。
Generating 3D city models rapidly is crucial for many applications. Monocular height estimation is one of the most efficient and timely ways to obtain large-scale geometric information. However, existing works focus primarily on training and testing models using unbiased datasets, which does not align well with real-world applications. Therefore, we propose a new benchmark dataset to study the transferability of height estimation models in a cross-dataset setting. To this end, we first design and construct a large-scale benchmark dataset for cross-dataset transfer learning on the height estimation task. This benchmark dataset includes a newly proposed large-scale synthetic dataset, a newly collected real-world dataset, and four existing datasets from different cities. Next, a new experimental protocol, few-shot cross-dataset transfer, is designed. Furthermore, in this paper, we propose a scale-deformable convolution module to enhance the window-based Transformer for handling the scale-variation problem in the height estimation task. Experimental results have demonstrated the effectiveness of the proposed methods in the traditional and cross-dataset transfer settings. The datasets and codes are publicly available at https://mediatum.ub.tum.de/1662763 and https://thebenchmarkh.github.io/.
研究动机与目标
- 解决真实世界应用中单目高度估计(MHE)缺乏大规模、多样化且可迁移数据集的问题。
- 研究模型在不同城市和成像条件下的迁移能力,超越偏向性的域内训练与测试。
- 构建一个支持 MHE 少样本跨数据集迁移学习的基准数据集。
- 提升模型在遥感图像中严重尺度变化和域偏移情况下的泛化能力。
- 评估在合成数据(GTAH)上预训练与自然图像(ImageNet)或遥感自监督数据上预训练的有效性。
提出的方法
- 作者构建了 GTAH,一个基于《侠盗猎车手》游戏的大规模合成数据集,包含在不同相机位姿、分辨率和视角下获取的高分辨率 RGB 图像与真实高度图像。
- 他们收集并发布了 AHN,一个来自荷兰的真实世界数据集,覆盖多个城市,其高度标签由 LiDDR 方法精确生成。
- 设计了一种新的实验协议——少样本跨数据集迁移,通过仅使用目标数据集 1% 的训练数据来评估模型泛化能力。
- 提出一种尺度可变形卷积(SDC)模块,以增强基于窗口的 Swin Transformer,从而更好地处理高度估计中的尺度变化。
- 模型在 GTAH 上进行预训练,并在真实世界数据集上以少样本方式微调,通过消融实验比较在 ImageNet、GTAH 和遥感自监督模型上预训练的效果。
- 使用权重和损失分布可视化分析特征学习动态与域偏移缓解效果。
实验结果
研究问题
- RQ1像 GTAH 这样的合成数据集能否有效提升在多样化真实城市中单目高度估计的迁移性能?
- RQ2在 MHE 的少样本跨数据集迁移中,GTAH 预训练相较于 ImageNet 或遥感自监督预训练效果如何?
- RQ3所提出的尺度可变形卷积模块在多大程度上缓解了高度估计中的尺度变化?
- RQ4在 ImageNet、GTAH 和真实世界数据上预训练的模型,其权重和损失分布有何差异?这对域泛化意味着什么?
- RQ5少样本跨数据集迁移协议能否有效评估 MHE 模型在真实世界部署场景下的泛化能力?
主要发现
- 在 GTAH 上预训练的模型收敛速度显著快于在 ImageNet 上预训练的模型,尤其在 JAX 和 ATL 等具有挑战性的数据集上,后者难以收敛。
- 采用 GTAH 预训练的 SwinUper+SDC 模型在全部五个真实世界数据集(AHN、JAX、OMA、ATL、ARG)上均优于所有基线模型,展现出在少样本设置下的强大泛化能力。
- 权重分布的可视化显示,GTAH 预训练模型的分布与真实世界训练模型更为接近,尤其在浅层网络中表现更优。
- 微调过程中的损失趋势表明,GTAH 预训练显著加速了所有数据集的收敛,尤其在 JAX 和 ATL 上具有压倒性优势。
- 与在 Sentinel-2 数据上进行自监督预训练(SSLTransformerRS)相比,GTAH 预训练取得了更优性能,证实了合成数据在 MHE 中的有效性。
- 尺度可变形卷积模块显著提升了在尺度变化显著的高度估计任务中的性能,尤其在建筑尺度多变的复杂城市场景中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。