Skip to main content
QUICK REVIEW

[论文解读] ScanEnts3D: Exploiting Phrase-to-3D-Object Correspondences for Improved Visio-Linguistic Models in 3D Scenes

Ahmed Abdelreheem, Kyle Olszewski|arXiv (Cornell University)|Dec 12, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

本论文提出了ScanEnts3D,一个大规模数据集,将参照性3D句子中的每个名词短语与所有对应的3D对象——目标对象和锚定对象——进行关联,覆盖84,000条句子和705个场景。通过利用这些短语到对象的对应关系,采用新型损失函数和网络架构改进进行训练,该方法实现了最先进性能:在Nr3D和ScanRefer上的神经听觉任务分别提升4.3%和5.0%,在Nr3D上的神经语言生成任务提升13.2个CIDEr分数,且推理阶段无需额外标注。

ABSTRACT

The two popular datasets ScanRefer [16] and ReferIt3D [3] connect natural language to real-world 3D data. In this paper, we curate a large-scale and complementary dataset extending both the aforementioned ones by associating all objects mentioned in a referential sentence to their underlying instances inside a 3D scene. Specifically, our Scan Entities in 3D (ScanEnts3D) dataset provides explicit correspondences between 369k objects across 84k natural referential sentences, covering 705 real-world scenes. Crucially, we show that by incorporating intuitive losses that enable learning from this novel dataset, we can significantly improve the performance of several recently introduced neural listening architectures, including improving the SoTA in both the Nr3D and ScanRefer benchmarks by 4.3% and 5.0%, respectively. Moreover, we experiment with competitive baselines and recent methods for the task of language generation and show that, as with neural listeners, 3D neural speakers can also noticeably benefit by training with ScanEnts3D, including improving the SoTA by 13.2 CIDEr points on the Nr3D benchmark. Overall, our carefully conducted experimental studies strongly support the conclusion that, by learning on ScanEnts3D, commonly used visio-linguistic 3D architectures can become more efficient and interpretable in their generalization without needing to provide these newly collected annotations at test time. The project's webpage is https://scanents3d.github.io/ .

研究动机与目标

  • 解决先前3D视觉-语言数据集的局限性,即仅对目标对象进行定位,而未对参照性句子中提到的锚定对象进行定位。
  • 通过语言引导的对象间对应关系,显式建模对象与对象之间的关系,以提升3D场景理解能力。
  • 开发新的训练损失函数和网络架构改进方法,利用训练阶段的短语到3D对象的对应关系,而推理阶段无需额外标注。
  • 证明从多对象定位中学习可提升神经听觉和语言生成任务中的泛化能力和鲁棒性。
  • 通过构建包含84,000条句子中369,000个短语-对象对应关系的数据集,建立3D视觉-语言理解的新基准。

提出的方法

  • 通过在Nr3D和ScanRefer基础上扩展,显式标注参照性句子中提及的所有对象(包括目标对象和锚定对象),构建了ScanEnts3D数据集。
  • 提出一种新型训练损失函数 $\mathcal{L}_{\mathrm{anc}}$,用于监督输入语句中提及的锚定对象的预测。
  • 引入 $\mathcal{L}_{\mathrm{attn}}$,以促使注意力机制在推理过程中聚焦于相关锚定对象。
  • 设计 $\mathcal{L}_{\mathrm{dis}}$,通过训练模型区分同类别干扰物(在语句中常被提及)来提升泛化能力。
  • 对现有的神经听觉和语言生成模型架构(如MVT、SATCap、M2Cap)进行修改,使其在新损失函数下联合预测目标对象和锚定对象。
  • 使用新的ScanEnts3D数据集和损失函数进行模型训练,同时保持推理过程不变——测试阶段无需额外标注或模态输入。

实验结果

研究问题

  • RQ1建模参照性句子中提及的所有对象(而不仅限于目标对象)是否能提升3D视觉-语言理解能力?
  • RQ2对锚定对象定位的显式监督在神经听觉和语言生成任务中的性能影响如何?
  • RQ3所提出的损失函数($\mathcal{L}_{\mathrm{anc}}$、$\mathcal{L}_{\mathrm{attn}}$、$\mathcal{L}_{\mathrm{dis}}$)在多大程度上提升了模型的泛化能力和鲁棒性?
  • RQ4新标注和训练范式能否在不进行架构重构的前提下有效迁移至现有模型架构?
  • RQ5从多对象定位中学习是否能带来更具可解释性和判别性的基于语言的场景理解?

主要发现

  • 所提方法在Nr3D基准上实现4.3%的绝对性能提升,在ScanRefer基准上实现5.0%的提升,确立了神经听觉任务的新最先进结果。
  • 在神经语言生成任务中,M2Cap-ScanEnts模型在Nr3D基准上CIDEr得分提升13.2分,创下新最先进水平。
  • 锚定对象预测损失($\mathcal{L}_{\mathrm{anc}}$)在所有提出的损失函数中带来最大性能增益,尤其在复杂上下文中表现显著。
  • 三种损失函数($\mathcal{L}_{\mathrm{anc}}$、$\mathcal{L}_{\mathrm{attn}}$、$\mathcal{L}_{\mathrm{dis}}$)的组合性能最佳,在Nr3D上比任意两两组合提升0.6%。
  • 模型在复杂场景(如存在多个干扰物)中表现出更强鲁棒性,体现在3D物体定位任务的'Multiple'子集上性能提升。
  • 定性结果表明,使用ScanEnts3D训练的模型能生成更具判别性的描述,明确引用有效的锚定对象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。