[论文解读] SmartAnnotator: An Interactive Tool for Annotating RGBD Indoor Images
SmartAnnotator 是一种交互式 RGBD 图像标注工具,利用学习得到的几何和结构先验知识,实现分割、标注以及 3D 场景结构的自动推断。用户通过最少的点击操作即可批准系统建议的标签和结构,从而显著加快标注速度——平均标注时间低于 5 秒,且随着后续会话的进行,由于增量学习机制,性能持续提升。
RGBD images with high quality annotations in the form of geometric (i.e., segmentation) and structural (i.e., how do the segments are mutually related in 3D) information provide valuable priors to a large number of scene and image manipulation applications. While it is now simple to acquire RGBD images, annotating them, automatically or manually, remains challenging especially in cluttered noisy environments. We present SmartAnnotator, an interactive system to facilitate annotating RGBD images. The system performs the tedious tasks of grouping pixels, creating potential abstracted cuboids, inferring object interactions in 3D, and comes up with various hypotheses. The user simply has to flip through a list of suggestions for segment labels, finalize a selection, and the system updates the remaining hypotheses. As objects are finalized, the process speeds up with fewer ambiguities to resolve. Further, as more scenes are annotated, the system makes better suggestions based on structural and geometric priors learns from the previous annotation sessions. We test our system on a large number of database scenes and report significant improvements over naive low-level annotation tools.
研究动机与目标
- 解决在杂乱、噪声较多的 RGBD 室内场景中,高质量几何与结构标注所面临的标注瓶颈问题。
- 通过利用颜色和深度数据,自动化分割、对象标注以及 3D 结构推理,从而减少用户标注的工作量。
- 通过从先前标注中持续学习,实现对标注建议的逐步改进,从而提升建议的准确性和标注速度。
- 在统一的交互式框架中,同时支持图像级分割与场景级结构关系(如“在...之上”、“支撑”等)的标注。
- 通过初始确认后仅需一次点击即可批准所有标签,最大限度减少用户干预。
提出的方法
- 系统采用两阶段流程:第一阶段为学习阶段,从 10 幅初始标注的 RGBD 场景中提取几何与结构先验;第二阶段为标注阶段,用于新场景的标注。
- 系统利用颜色和深度数据,将输入的 RGBD 图像解析为基于近似长方体的 3D 场景表示。
- 系统利用学习到的先验知识预测对象标签和支撑关系(如“在...之上”、“接触”等),并根据用户反馈迭代优化结果。
- 用户交互极少:用户从排序的建议中选择(如“床”与“柜子”),系统动态更新剩余的候选假设。
- 系统采用结构图优化技术,提升推断出的支撑关系的准确性,减少 3D 场景结构中的错误。
- 系统采用增量学习机制,在多个标注会话中持续优化先验知识,使后续建议更加迅速且准确。
实验结果
研究问题
- RQ1通过利用学习到的几何与结构先验知识,交互式系统能否显著缩短 RGBD 室内场景的标注时间?
- RQ2从先前标注会话中进行增量学习后,标签与结构预测的性能如何随时间改善?
- RQ3在复杂且存在遮挡的室内场景中,自动化分割与 3D 结构推理能在多大程度上减少用户的工作量?
- RQ4在存在遮挡的情况下,该系统在推断 3D 空间中物体之间正确支撑关系方面的有效性如何?
- RQ5在地板区域缺失或模糊的场景中,使用长方体抽象与基于地板的推理方法存在哪些关键局限性?
主要发现
- 系统实现了每幅图像平均标注时间低于 5 秒,用户仅需两次点击(一次确认床,一次批准所有标签)即可完成。
- 对象标签预测的 Top-3-Hit 率随时间提升,表明系统建议的准确性在每次新增标注场景后持续提高。
- 结构图优化显著降低了支撑关系的错误率,证明了在推断“在...之上”、“支撑”等 3D 关系方面的准确性得到提升。
- 在最后两次试验中观察到性能下降,表明早期错误标注的误差积累会负面影响后续学习过程。
- 当地板完全不可见时,系统无法正确推断地板区域,导致物体漂浮,且本地优化功能被禁用。
- 长方体抽象方法在处理非凸物体交互(如椅子嵌入书桌内部)时表现不佳,导致尺寸估计不准确并引发结构错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。