[论文解读] InSpaceType: Reconsider Space Type in Indoor Monocular Depth Estimation
本文提出了InSpaceType,一个用于室内单目深度估计的高分辨率RGBD数据集,并揭示了现有方法在不同空间类型间存在的严重性能不平衡问题。研究发现,基于NYUv2预训练的模型在图书馆或大型房间等罕见或大空间类型上的表现显著下降,暴露出由于训练数据和评估协议中隐藏偏差导致的实际部署中关键的鲁棒性与安全性问题。
Indoor monocular depth estimation has attracted increasing research interest. Most previous works have been focusing on methodology, primarily experimenting with NYU-Depth-V2 (NYUv2) Dataset, and only concentrated on the overall performance over the test set. However, little is known regarding robustness and generalization when it comes to applying monocular depth estimation methods to real-world scenarios where highly varying and diverse functional extit{space types} are present such as library or kitchen. A study for performance breakdown into space types is essential to realize a pretrained model's performance variance. To facilitate our investigation for robustness and address limitations of previous works, we collect InSpaceType, a high-quality and high-resolution RGBD dataset for general indoor environments. We benchmark 12 recent methods on InSpaceType and find they severely suffer from performance imbalance concerning space types, which reveals their underlying bias. We extend our analysis to 4 other datasets, 3 mitigation approaches, and the ability to generalize to unseen space types. Our work marks the first in-depth investigation of performance imbalance across space types for indoor monocular depth estimation, drawing attention to potential safety concerns for model deployment without considering space types, and further shedding light on potential ways to improve robustness. See \url{https://depthcomputation.github.io/DepthPublic} for data and the supplementary document. The benchmark list on the GitHub project page keeps updates for the lastest monocular depth estimation methods.
研究动机与目标
- 调查单目深度估计模型在多样化室内空间类型中的鲁棒性,这些类型在以往的基准测试中常被忽视。
- 解决现有数据集(如NYUv2)存在的局限性,例如分辨率低、噪声高,且缺乏空间类型细分。
- 提出一种分层空间类型分类体系,并收集InSpaceType,一个覆盖12种常见室内环境的高质量、高分辨率RGBD数据集。
- 在InSpaceType上评估12种最先进深度估计方法,并分析其在不同空间类型上的性能差异。
- 研究模型对未见空间类型的泛化能力,并评估缓解性能不平衡的策略。
提出的方法
- 提出一种包含12个类别的分层空间类型分类体系(如私人房间、厨房、图书馆、大型房间),以支持对模型性能的细粒度分析。
- 使用现代立体相机系统(1242×2208分辨率)采集InSpaceType,生成高质量、对齐的RGB与深度图像,显著降低噪声。
- 在InSpaceType上对12种近期的单目深度估计模型(监督与自监督方法)进行零样本性能评估,覆盖各类空间类型。
- 使用δ₁、AbsRel、RMSE和SqRel等指标分析性能差异,并按空间类型进行细分,同时开展分组级别评估。
- 评估三种缓解策略——类别重加权、类别平衡采样和元学习,以减少性能不平衡。
- 通过将空间类型划分为三类功能组(G1:家庭类,G2:办公类,G3:大型/宽敞类),开展跨组泛化研究,并测量零样本迁移性能。

实验结果
研究问题
- RQ1单目深度估计模型在不同室内空间类型中的性能如何变化,尤其是在超越平均指标的评估下?
- RQ2现有数据集(如NYUv2)和合成数据集(如Matterport3D、Replica)在多大程度上对特定空间类型产生偏差?
- RQ3标准缓解技术(如重加权、采样或元学习)是否能有效减少不同空间类型间的性能不平衡?
- RQ4模型在未见空间类型上的泛化能力如何,特别是在功能差异显著的组别之间迁移知识时?
- RQ5哪些关键因素(如物体多样性、场景杂乱程度或尺度不匹配)阻碍了在不同空间类型间的泛化?
主要发现
- 在NYUv2上预训练的模型表现出严重的性能不平衡:δ₁在私人房间(头部类型)达到92.05,但在大型房间(尾部类型)下降至54.93,表明对常见空间存在强烈偏差。
- 对未见空间类型的泛化极具挑战性,当从G1(家庭类)向G3(大型/宽敞类)空间迁移时,δ₁从98.12(组内)下降至59.02(组间)。
- 在大型或宽敞空间(G3)上进行训练,其泛化到小型空间的效果略好于反向,表明复杂场景向简单场景存在一定的可迁移性。
- 合成数据集(如SimSIN和Hypersim)未能捕捉到厨房等空间中的真实世界杂乱程度与小物体复杂性,导致在这些类型上表现不佳。
- 表现最佳的缓解策略——元学习——仍存在显著性能差距,最坏的组间情况(G2 → Far)中δ₁降至66.01,表明泛化挑战依然持续存在。
- InSpaceType表明,当前评估协议忽略了空间类型间的关键性能差异,对深度模型在真实世界部署中的安全性构成严重担忧。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。