Skip to main content
QUICK REVIEW

[论文解读] Multimodal Object Detection via Probabilistic Ensembling

Yi-Ting Chen, Jinghao Shi|arXiv (Cornell University)|Apr 7, 2021
Advanced Neural Network Applications被引用 5
一句话总结

该论文提出ProbEn,一种基于贝叶斯规则在条件独立性假设下推导出的非学习型概率集成方法,用于使用RGB和热成像相机进行多模态目标检测。通过融合来自独立单模态检测器的检测结果,并利用概率边缘化处理缺失模态,该方法在对齐(KAIST)和非对齐(FLIR)基准上均实现了超过13%的相对性能提升。

ABSTRACT

Object detection with multimodal inputs can improve many safety-critical systems such as autonomous vehicles (AVs). Motivated by AVs that operate in both day and night, we study multimodal object detection with RGB and thermal cameras, since the latter provides much stronger object signatures under poor illumination. We explore strategies for fusing information from different modalities. Our key contribution is a probabilistic ensembling technique, ProbEn, a simple non-learned method that fuses together detections from multi-modalities. We derive ProbEn from Bayes' rule and first principles that assume conditional independence across modalities. Through probabilistic marginalization, ProbEn elegantly handles missing modalities when detectors do not fire on the same object. Importantly, ProbEn also notably improves multimodal detection even when the conditional independence assumption does not hold, e.g., fusing outputs from other fusion methods (both off-the-shelf and trained in-house). We validate ProbEn on two benchmarks containing both aligned (KAIST) and unaligned (FLIR) multimodal images, showing that ProbEn outperforms prior work by more than 13% in relative performance!

研究动机与目标

  • 解决在光照条件差的情况下融合RGB与热成像相机输出的多模态目标检测挑战。
  • 克服现有融合方法在处理缺失检测或依赖复杂学习架构方面的局限性。
  • 开发一种简单、非学习型的融合策略,利用在大规模数据集上高度调优的单模态检测器。
  • 实现在如FLIR这类空间与时间非对齐的RGB-热成像数据集上的有效融合,其中对齐问题使训练复杂化。
  • 证明概率集成可超越端到端融合模型及先前的最先进方法,在真实世界基准上表现更优。

提出的方法

  • 在给定真实物体标签时,假设模态之间条件独立,从贝叶斯规则推导出ProbEn。
  • 使用概率边缘化处理来自某一模态的缺失检测,使融合在检测器未同时触发时仍具鲁棒性。
  • 通过结合RGB与热成像检测器的检测分数,利用推导出的概率模型提升重叠检测的置信度,实现分数融合。
  • 通过将相同概率框架应用于边界框坐标与IoU估计,将方法扩展至框融合。
  • 将ProbEn应用于现成及自训练检测器的输出,包括来自早期融合与中期融合网络的检测器。
  • 以非极大值抑制(NMS)作为基线融合策略,表明ProbEn通过保留双模态的证据而非丢弃低分检测,优于NMS。

实验结果

研究问题

  • RQ1非学习型、基于概率的融合方法是否能在多模态目标检测中超越学习型融合架构?
  • RQ2当某一模态(如夜间RGB)无法检测到目标时,概率集成方法对缺失检测的处理效果如何?
  • RQ3ProbEn是否能泛化至融合其他融合方法的输出,即使条件独立性假设被违反?
  • RQ4ProbEn是否能在对齐(KAIST)与非对齐(FLIR)多模态检测基准上均达到最先进性能?
  • RQ5ProbEn对检测具有挑战性的目标类别(如自行车)有何影响,这些类别在热成像中可见度低但在RGB中可见?

主要发现

  • 在FLIR基准上,ProbEn对自行车类别的AP达到73.49%,显著优于次佳方法GAFF的72.90% AP。
  • 在FLIR数据集上,ProbEn实现83.76% mAP,相比先前最先进方法(ThermalDet的74.60% mAP)实现13.5%的相对提升。
  • 在KAIST基准上,ProbEn相比先前最先进方法实现13.2%的相对提升,表明其在不同数据集上均具有一致增益。
  • 该方法显著提升了对自行车的检测性能(AP:73.49% vs. ThermalDet的60.04%),证实其能有效利用互补模态。
  • 即使与端到端训练模型(如MidFusion)的输出融合,ProbEn仍能进一步提升性能,表明其作为后处理融合层的泛化能力。
  • NMS虽简单,但作为融合基线表现出人意料的良好性能,但ProbEn通过整合双模态证据而非抑制某一模态,表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。