Skip to main content
QUICK REVIEW

[论文解读] Geometry-Aware Instance Segmentation with Disparity Maps

Cho-Ying Wu, Xiaoyan Hu|arXiv (Cornell University)|Jun 14, 2020
Advanced Vision and Imaging参考文献 42被引用 4
一句话总结

该论文提出GAIS-Net,一种几何感知实例分割框架,通过融合立体相机的RGB图像与视差图,提升自动驾驶场景中3D感知的物体检测与分割性能。该方法利用伪激光雷达投影和多模态区域提议特征(2D、2.5D、3D),通过几何先验增强掩码预测并抑制误报,在新采集的高质量驾驶立体数据集HQDS上实现最先进性能,其基线基线长度和焦距均为Cityscapes的4倍。

ABSTRACT

Most previous works of outdoor instance segmentation for images only use color information. We explore a novel direction of sensor fusion to exploit stereo cameras. Geometric information from disparities helps separate overlapping objects of the same or different classes. Moreover, geometric information penalizes region proposals with unlikely 3D shapes thus suppressing false positive detections. Mask regression is based on 2D, 2.5D, and 3D ROI using the pseudo-lidar and image-based representations. These mask predictions are fused by a mask scoring process. However, public datasets only adopt stereo systems with shorter baseline and focal legnth, which limit measuring ranges of stereo cameras. We collect and utilize High-Quality Driving Stereo (HQDS) dataset, using much longer baseline and focal length with higher resolution. Our performance attains state of the art. Please refer to our project page. The full paper is available here.

研究动机与目标

  • 通过整合立体视差图中的几何线索,提升户外自动驾驶场景下实例分割的鲁棒性。
  • 解决单目或仅RGB方法对光照、阴影和纹理变化敏感的局限性。
  • 开发一种多模态、端到端可训练的网络,融合2D、2.5D与3D表征以提升掩码预测性能。
  • 收集并发布一个高质量立体数据集(HQDS),其基线长度和焦距更长,以支持更优的远场立体匹配与几何推理。
  • 证明来自视差图的几何先验可减少误报并提升掩码质量,尤其在重叠或远距离物体上表现更优。

提出的方法

  • 该方法使用PSMNet从立体图像对生成密集视差图,并通过伪激光雷达逆投影将视差图映射至3D空间。
  • 利用ResNet50-FPN主干网络与RPN从左图像提取区域提议,形成2D区域提议(ROIs)。
  • 从视差图中裁剪出2.5D ROIs,同时通过将视差值逆投影至3D点云生成3D ROIs。
  • 基于PointNet的网络处理3D ROIs,提取3D特征并预测每个点的掩码概率,随后将结果重投影至2D用于损失计算。
  • 通过掩码评分机制融合2D、2.5D与3D的掩码预测,提升最终掩码的置信度与IoU。
  • 网络采用组合损失进行训练:$π_{box}$, $π_{cls}$, $π_{2Dmask}$, $π_{3Dmask}$,以及一个MaskIoU头以优化掩码质量。

实验结果

研究问题

  • RQ1立体相机的视差图能否通过提供形状与深度的几何先验,提升实例分割性能?
  • RQ2融合2D、2.5D与3D表征在多大程度上提升掩码预测准确率并减少误报?
  • RQ3立体系统中更长的基线与焦距在多大程度上改善远场物体检测与几何一致性?
  • RQ4结合图像、视差与3D点云特征的多模态网络能否超越纯RGB的实例分割模型?
  • RQ5所提出的掩码评分融合机制相比单一模态预测,如何提升最终分割质量?

主要发现

  • GAIS-Net在HQDS数据集上达到最先进性能,掩码AP为40.7%,相较使用相同主干网络的Mask-RCNN的33.9%显著提升。
  • 在HQDS测试集上,该方法将边界框AP提升9.7个百分点(从36.3%增至46.0%),掩码AP提升6.8个百分点(从33.9%增至40.7%)。
  • 在Cityscapes数据集上,GAIS-Net在COCO上预训练后达到37.1%的掩码AP,优于相同设置下的Mask-RCNN(36.4%)。
  • HQDS与Cityscapes之间性能差距主要源于HQDS具有更长的基线(0.5 m)与焦距(3.3K px),从而支持更优的远场立体匹配与几何估计。
  • 掩码评分融合机制通过整合2D、2.5D与3D表征的预测结果,显著提升掩码质量,使掩码更一致、更准确。
  • HQDS数据集包含6K张训练与1.2K张测试的立体图像对,分辨率为1024×3072,其$f \times b$乘积为Cityscapes的4倍,支持对基于立体视觉的实例分割进行更可靠的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。