[论文解读] Learning Rich Features from RGB-D Images for Object Detection and Segmentation
本文提出一种新颖的地心嵌入(geocentric embedding)用于深度图像——通过编码水平视差、距地面高度以及与重力方向的夹角,以增强RGB-D目标检测与实例分割中的特征学习。通过将该表示集成至基于CNN的R-CNN框架,该方法在平均精度(AP)上相较先前方法实现56%的相对提升(达到37.3%),并在语义分割方面实现24%的相对提升,方法利用目标检测器输出作为超像素特征。
In this paper we study the problem of object detection for RGB-D images using semantically rich image and depth features. We propose a new geocentric embedding for depth images that encodes height above ground and angle with gravity for each pixel in addition to the horizontal disparity. We demonstrate that this geocentric embedding works better than using raw depth images for learning feature representations with convolutional neural networks. Our final object detection system achieves an average precision of 37.3%, which is a 56% relative improvement over existing methods. We then focus on the task of instance segmentation where we label pixels belonging to object instances found by our detector. For this task, we propose a decision forest approach that classifies pixels in the detection window as foreground or background using a family of unary and binary tests that query shape and geocentric pose features. Finally, we use the output from our object detectors in an existing superpixel classification framework for semantic scene segmentation and achieve a 24% relative improvement over current state-of-the-art for the object categories that we study. We believe advances such as those represented in this paper will facilitate the use of perception in fields like robotics.
研究动机与目标
- 通过利用超越原始视差的更丰富深度表征,提升RGB-D图像中目标检测与实例分割的性能。
- 通过引入像素级实例分割,解决边界框检测与语义分割的局限性。
- 通过编码来自深度图像的地心姿态与几何线索,增强卷积神经网络中的特征学习。
- 通过将目标检测器输出作为超像素的附加特征,提升语义场景分割性能。
- 展示丰富RGB-D特征在机器人技术与场景理解应用中的实际效用。
提出的方法
- 为深度图像引入一种三通道的地心嵌入:水平视差、距地面高度以及与重力方向的夹角,以每像素编码三维几何上下文。
- 将预训练的RGB-CNN适配为从地心深度嵌入中学习特征,相较于仅使用原始深度或视差,显著提升表征学习能力。
- 结合RGB-D轮廓,使用多尺度组合分组(MCG)生成2.5D区域提议,提升杂乱场景中的提议质量。
- 采用决策森林进行实例分割,通过形状与地心姿态特征的单变量与双变量测试,将像素分类为前景或背景。
- 通过在超像素特征中引入目标检测器输出(检测到物体的存在、位置与置信度),增强语义分割性能。
- 将目标检测与分割整合至统一流程中,支持实例级与语义级标注。
实验结果
研究问题
- RQ1能否通过编码高度与重力对齐的地心深度嵌入,提升CNN在RGB-D目标检测中的特征学习能力?
- RQ2通过地心表示融合RGB与深度特征,是否能实现优于使用原始深度或视差的检测与分割性能?
- RQ3决策森林能否有效利用从RGB-D数据中提取的形状与地心姿态特征,实现实例分割?
- RQ4当将目标检测输出作为超像素的辅助特征时,其在多大程度上可提升语义分割性能?
- RQ5在多种目标类别下,该方法在平均精度与分割准确率方面相较于最先进方法表现如何?
主要发现
- 地心深度嵌入显著提升了基于CNN的特征学习,使目标检测的平均精度(AP)相较现有方法实现56%的相对提升(达到37.3%)。
- 所提出的基于决策森林的实例分割方法,通过利用形状与地心姿态特征,性能优于基线方法。
- 当将目标检测器输出作为超像素的附加特征时,语义分割性能实现24%的相对提升(平均Jaccard指数从28.4%提升至35.1%)。
- 该系统在所针对的目标类别上实现了语义分割的最先进性能,频率加权平均Jaccard指数(fwavacc)达到60.3%。
- 通过MCG整合RGB-D轮廓与2.5D区域提议,实现了最先进的提议生成性能,从而提升了检测与分割的准确性。
- 该方法在如NYU Depth数据集等非受控、杂乱环境中表现出强大的泛化能力,优于专为受控实验环境设计的先前方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。