[论文解读] SAT: 2D Semantics Assisted Training for 3D Visual Grounding
本文提出2D语义辅助训练(SAT),一种在训练过程中利用丰富2D图像语义(如物体标签、特征和几何线索)以提升3D视觉定位性能的方法,且在推理阶段无需2D输入。通过在2D与3D物体之间引入辅助对齐损失,并使用基于Transformer的注意力掩码防止2D信息泄露,SAT将Nr3D上的准确率从37.7%提升至49.2%,在多个基准上创下新的最先进水平。
3D visual grounding aims at grounding a natural language description about a 3D scene, usually represented in the form of 3D point clouds, to the targeted object region. Point clouds are sparse, noisy, and contain limited semantic information compared with 2D images. These inherent limitations make the 3D visual grounding problem more challenging. In this study, we propose 2D Semantics Assisted Training (SAT) that utilizes 2D image semantics in the training stage to ease point-cloud-language joint representation learning and assist 3D visual grounding. The main idea is to learn auxiliary alignments between rich, clean 2D object representations and the corresponding objects or mentioned entities in 3D scenes. SAT takes 2D object semantics, i.e., object label, image feature, and 2D geometric feature, as the extra input in training but does not require such inputs during inference. By effectively utilizing 2D semantics in training, our approach boosts the accuracy on the Nr3D dataset from 37.7% to 49.2%, which significantly surpasses the non-SAT baseline with the identical network architecture and inference input. Our approach outperforms the state of the art by large margins on multiple 3D visual grounding datasets, i.e., +10.4% absolute accuracy on Nr3D, +9.9% on Sr3D, and +5.6% on ScanRef.
研究动机与目标
- 为解决视觉定位中3D点云稀疏、噪声多的问题,通过在训练中利用更丰富的2D图像语义。
- 在推理阶段不依赖2D输入的前提下,提升联合3D视觉-语言表征学习性能。
- 设计一种训练策略,将干净的2D物体表征蒸馏至3D模型中,同时避免2D输入信息泄露。
- 在与现有方法相同的推理输入和网络架构下,超越现有方法在3D视觉定位基准上的表现。
提出的方法
- 提出一种新颖的训练范式——2D语义辅助训练(SAT),在训练阶段仅使用2D物体标签、图像特征和2D几何特征作为辅助输入。
- 提出一种基于三元组损失的物体对应损失,用于对齐2D物体表征与对应的3D候选区域及语言查询。
- 采用Transformer注意力掩码生成高质量的2D语义特征,防止2D输入影响最终输出模块。
- 使用组合损失训练3D定位Transformer模型:主3D视觉定位损失与辅助2D-3D对齐损失。
- 采用多模态Transformer架构,融合3D点云特征与语言查询,其中2D语义仅在训练阶段注入。
- 确保推理阶段不使用任何2D输入,保持与真实世界部署场景的兼容性。
实验结果
研究问题
- RQ1仅在训练阶段使用2D图像语义,能否提升3D视觉定位性能?
- RQ2如何在不泄露信息至推理阶段的前提下,有效整合2D语义至3D视觉定位训练中?
- RQ32D与3D物体之间的辅助对齐是否能带来更好的3D点云联合表征学习?
- RQ4SAT能否在不依赖推理阶段2D输入的情况下,实现3D视觉定位基准上的SOTA性能?
- RQ5SAT在理解物体类别、空间关系及颜色、形状等属性方面具有哪些定性优势?
主要发现
- SAT在相同网络结构和推理输入下,将Nr3D数据集上的3D视觉定位准确率从37.7%提升至49.2%。
- SAT在Nr3D上实现+10.4%的绝对准确率提升,Sr3D上+9.9%,ScanRef上+5.6%,优于先前SOTA方法。
- SAT性能与同时使用2D输入进行训练和推理的方法相当(如50.3% vs. 49.2%),但推理阶段无需2D输入。
- 定性分析表明,SAT提升了物体识别能力、空间关系理解(如“附着于”、“在……之上”)以及属性理解(如“白色和绿色”)。
- 失败案例显示,SAT在视图依赖性查询(如“面向墙壁”)和模糊术语(如“椅子”与“办公椅”)上仍存在困难。
- 该方法能有效将2D语义蒸馏至3D表征,提升复杂场景下的泛化能力与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。