[论文解读] Habitat Synthetic Scenes Dataset (HSSD-200): An Analysis of 3D Scene Scale and Realism Tradeoffs for ObjectGoal Navigation
本文介绍了Habitat合成场景数据集(HSSD-200),这是一个高保真度、由人工创建的3D场景数据集,包含211个真实世界室内场景,以及18,656个独特的高质量3D物体模型。尽管其规模远小于先前的合成数据集(如ProcTHOR-10K),但基于HSSD-122训练的智能体在零样本泛化到真实世界扫描环境时,性能优于在ProcTHOR的10,000个场景上训练的智能体,表明在ObjectGoal导航任务中,场景的真实感与质量比数据集规模更为关键。
We contribute the Habitat Synthetic Scene Dataset, a dataset of 211 high-quality 3D scenes, and use it to test navigation agent generalization to realistic 3D environments. Our dataset represents real interiors and contains a diverse set of 18,656 models of real-world objects. We investigate the impact of synthetic 3D scene dataset scale and realism on the task of training embodied agents to find and navigate to objects (ObjectGoal navigation). By comparing to synthetic 3D scene datasets from prior work, we find that scale helps in generalization, but the benefits quickly saturate, making visual fidelity and correlation to real-world scenes more important. Our experiments show that agents trained on our smaller-scale dataset can match or outperform agents trained on much larger datasets. Surprisingly, we observe that agents trained on just 122 scenes from our dataset outperform agents trained on 10,000 scenes from the ProcTHOR-10K dataset in terms of zero-shot generalization in real-world scanned environments.
研究动机与目标
- 探究在训练具身AI智能体进行ObjectGoal导航时,合成3D场景数据集的规模与真实感之间的权衡。
- 解决现有合成与重建3D数据集的局限性,包括噪声、伪影以及缺乏组合灵活性。
- 评估大规模程序化数据集(如ProcTHOR-10K)是否能在零样本泛化到真实世界环境方面带来实质性提升。
- 证明高质量、人工创建的场景可超越大规模、程序化生成的数据集,在泛化性能上表现更优。
提出的方法
- 作者创建了HSSD-200数据集,包含211个高保真度、由人工设计的3D场景,其建模基于真实室内环境,并使用18,656个独特、高质量的3D物体模型。
- 通过视觉保真度、场景尺寸和物体统计等指标,将HSSD-200与先前的合成数据集(特别是ProcTHOR)进行比较,以验证其真实感及与真实世界场景的相关性。
- 在HSSD和ProcTHOR的不同子集上训练端到端强化学习智能体,包括规模匹配的设置(如60和122个场景),以分离规模与真实感的影响。
- 使用真实世界扫描数据集(HM3DSem和MP3D)作为零样本基准,评估智能体的泛化能力。
- 开展微调实验,评估智能体在不同数据集上的性能收敛性和鲁棒性。
- 通过消融研究,对比在HSSD-122与ProcTHOR-10K上训练的智能体,控制变量后在成功率和SPL(Success-Power)指标上的表现。
实验结果
研究问题
- RQ1增加合成3D场景数据集的规模是否能提升ObjectGoal导航智能体在真实世界环境中的零样本泛化能力?
- RQ2在智能体泛化性能方面,合成场景的视觉保真度与真实感与程序化生成相比如何?
- RQ3数据集规模在多大程度上会趋于饱和,使得场景质量成为性能的主要瓶颈?
- RQ4一个规模更小但质量更高的合成数据集(如HSSD-200)是否能在泛化到真实世界场景方面超越规模大得多的程序化数据集(如ProcTHOR-10K)?
主要发现
- 在HM3DSem验证集上,仅在HSSD-200的122个场景上训练的智能体取得了19.15%的成功率,优于在ProcTHOR-10K的10,000个场景上训练的智能体所达到的12.5%成功率。
- 在MP3D验证集上,HSSD-122智能体取得了14.44%的成功率和5.17的SPL,而ProcTHOR-122智能体仅达到5.47%的成功率和1.83的SPL,尽管规模相近,但性能差距显著。
- 微调后,HSSD与ProcTHOR智能体之间的性能差距依然显著:HSSD-122智能体达到48.23%的成功率和23.1的SPL,而ProcTHOR-10K智能体为48.32%的成功率和21.8的SPL。
- 即使在规模匹配的情况下(如60和122个场景),HSSD训练的智能体在真实世界基准测试中的成功率和SPL均持续优于ProcTHOR训练的智能体。
- 当数据集规模超过某一临界点(如从122个场景增至10,000个场景)后,性能提升迅速饱和,零样本泛化能力无明显改善。
- 场景真实感与质量(如准确的物体布局、高视觉保真度和逼真的场景统计)成为泛化性能的主要瓶颈,其重要性超过单纯的数据集规模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。