Skip to main content
QUICK REVIEW

[论文解读] CAT-Det: Contrastively Augmented Transformer for Multi-modal 3D Object Detection

Yanan Zhang, Jiaxin Chen|arXiv (Cornell University)|Apr 1, 2022
Advanced Neural Network Applications被引用 4
一句话总结

CAT-Det 提出了一种对比增强的 Transformer 框架用于多模态 3D 目标检测,采用双流架构,包含 Pointformer 和 Imageformer 分支,并通过跨模态 Transformer(CMT)实现长距离上下文编码。该方法引入了一种单向多模态数据增强(OMDA),仅在点云上进行分层对比学习,使 KITTI 数据集上的 mAP 达到 75.42%,显著提升了行人和自行车等困难样本的检测准确率。

ABSTRACT

In autonomous driving, LiDAR point-clouds and RGB images are two major data modalities with complementary cues for 3D object detection. However, it is quite difficult to sufficiently use them, due to large inter-modal discrepancies. To address this issue, we propose a novel framework, namely Contrastively Augmented Transformer for multi-modal 3D object Detection (CAT-Det). Specifically, CAT-Det adopts a two-stream structure consisting of a Pointformer (PT) branch, an Imageformer (IT) branch along with a Cross-Modal Transformer (CMT) module. PT, IT and CMT jointly encode intra-modal and inter-modal long-range contexts for representing an object, thus fully exploring multi-modal information for detection. Furthermore, we propose an effective One-way Multi-modal Data Augmentation (OMDA) approach via hierarchical contrastive learning at both the point and object levels, significantly improving the accuracy only by augmenting point-clouds, which is free from complex generation of paired samples of the two modalities. Extensive experiments on the KITTI benchmark show that CAT-Det achieves a new state-of-the-art, highlighting its effectiveness.

研究动机与目标

  • 为解决 3D 目标检测中 LiDAR 点云与 RGB 图像之间的模态差异问题。
  • 通过捕捉两种模态中长距离的模态内与模态间依赖关系,提升特征表示能力。
  • 开发一种有效的数据增强策略,避免复杂的成对数据生成,增强模型泛化能力。
  • 在 KITTI 基准上实现多模态 3D 目标检测的 SOTA 性能。

提出的方法

  • CAT-Det 采用双流架构,其中 Pointformer(PT)分支用于点云处理,Imageformer(IT)分支用于图像特征提取。
  • 引入 Cross-Modal Transformer(CMT)模块,执行跨注意力与特征融合,通过细粒度注意力权重实现对模态间关系的全局建模。
  • 通过单向多模态数据增强(OMDA)实现分层对比学习,仅在点云上施加点级与实例级的增强,以提升鲁棒性。
  • 负样本通过实例级的记忆库进行选择,增强特征判别能力,且无需成对图像增强。
  • 模型用 Transformer 替代传统的 PointNet++ 和 2D CNN,以获得更大的感受野和更优的上下文建模能力。
  • CMT 中的特征融合同时保留单模态与跨模态特征,优于简单的拼接或基于注意力的融合方法。

实验结果

研究问题

  • RQ1如何在多模态 3D 目标检测中有效捕捉长距离的模态内与模态间依赖关系?
  • RQ2能否仅对一种模态(LiDAR)应用数据增强,以提升多模态检测性能,同时避免复杂的成对数据生成?
  • RQ3在点级与实例级均应用分层对比学习,对模型泛化能力与准确率的影响如何?
  • RQ4所提出的 Cross-Modal Transformer(CMT)与传统融合方法(如拼接或基于注意力的融合)相比表现如何?
  • RQ5所提框架在 KITTI 基准上相较于现有 SOTA 方法的性能提升程度如何?

主要发现

  • CAT-Det 在 KITTI 3D 目标检测基准上实现了 75.42% 的 mAP,创下新 SOTA 记录,较之前最佳方法提升 3.53% 的 mAP。
  • 消融实验表明,TPI、CMT 和 OMDA 每个组件均贡献显著,其中 OMDA 单独使用即使 mAP 相较基线提升 3.53%。
  • CMT 模块在与 TPI 结合时达到 71.89% 的 mAP,优于拼接与基于注意力的融合方法,归因于其对单模态与跨模态特征的保留与优化能力。
  • 采用记忆库的实例级对比学习(CA-O-MB)带来最高性能增益,相比仅使用点级增强,mAP 提升 2.65%。
  • 模型在行人与自行车等困难类别上表现更优,mAP 分别提升 7.18% 与 5.59%,表明其在小尺寸或部分遮挡实例上具有强大泛化能力。
  • 可视化结果证实,CAT-Det 通过 CMT 模块有效利用双模态的互补线索,增强了稀疏或远距离目标的特征表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。