[论文解读] Multiview Detection with Shadow Transformer (and View-Coherent Data Augmentation)
本文提出MVDeTr,一种多视角目标检测系统,采用新颖的阴影变换器(shadow transformer)自适应地聚合多个摄像头视角的特征,以解决由投影引起的视角特异性失真问题。该方法引入视图一致的数据增强策略,在训练过程中保持多视角一致性,从而在Wildtrack和MultiviewX基准上达到最先进性能。
Multiview detection incorporates multiple camera views to deal with occlusions, and its central problem is multiview aggregation. Given feature map projections from multiple views onto a common ground plane, the state-of-the-art method addresses this problem via convolution, which applies the same calculation regardless of object locations. However, such translation-invariant behaviors might not be the best choice, as object features undergo various projection distortions according to their positions and cameras. In this paper, we propose a novel multiview detector, MVDeTr, that adopts a newly introduced shadow transformer to aggregate multiview information. Unlike convolutions, shadow transformer attends differently at different positions and cameras to deal with various shadow-like distortions. We propose an effective training scheme that includes a new view-coherent data augmentation method, which applies random augmentations while maintaining multiview consistency. On two multiview detection benchmarks, we report new state-of-the-art accuracy with the proposed system. Code is available at https://github.com/hou-yz/MVDeTr.
研究动机与目标
- 为解决基于卷积的多视角特征聚合方法的局限性,该方法对所有位置一视同仁,尽管存在不同程度的投影失真。
- 设计一种可学习的注意力机制,同时感知位置和摄像头视角,以更好地处理投影特征图中的类似阴影的失真。
- 开发一种数据增强策略,在应用随机变换的同时保持多视角一致性,从而实现有效训练。
- 通过统一检测头联合利用多视角监督,提升遮挡场景下的检测精度。
- 验证视图一致增强和每视角监督在提升泛化能力并减少过拟合方面的有效性。
提出的方法
- 核心架构采用阴影变换器,同时对多个摄像头视角和位置进行注意力计算,使用共享的地面平面位置嵌入和可学习的摄像头嵌入。
- 阴影变换器在来自多个视角的投影特征图上运行,实现在不依赖平移不变性的前提下,实现视角和位置感知的特征融合。
- 提出一种新颖的视图一致数据增强策略,在每个视角上应用不同的随机仿射变换,同时通过在投影前反转变换来保持多视角一致性。
- 系统采用每视角监督,并通过调整真实标注来维持增强过程中的标注一致性,从而提升训练稳定性。
- 检测头为全连接层,直接在地面上预测目标位置和边界框,辅以偏移量和边界框回归的损失。
- 训练流程整合了标准检测损失(如RetinaNet中的损失)、视角特定监督以及所提出的增强方案。
实验结果
研究问题
- RQ1一种同时感知空间位置和摄像头视角的自注意力机制,是否能在多视角特征聚合中超越平移不变的卷积网络?
- RQ2视图一致的数据增强是否能在不破坏多视角一致性的前提下提升多视角检测的泛化能力?
- RQ3每视角监督和辅助损失在多视角设置下如何影响检测性能?
- RQ4偏移量和边界框回归损失在多视角系统中对检测精度的提升程度如何?
- RQ5基于Transformer的架构是否能在处理投影失真问题的同时,在多视角检测基准上实现最先进性能?
主要发现
- MVDeTr在Wildtrack和MultiviewX两个基准上均达到新的最先进性能,相较于先前最先进方法MVDet,MODA分别提升1.7%和0.7%。
- 若移除视图一致数据增强,Wildtrack和MultiviewX的MODA分别下降2.0%和0.6%,表明其在性能中起关键作用。
- 若移除每视角监督,Wildtrack和MultiviewX的MODA分别下降1.6%和1.1%,表明其在减少过拟合和提升泛化能力方面具有显著效果。
- 在MultiviewX上,移除偏移量损失会导致0.6%的MODA下降,可能由于行人密集排列及NMS引起的误检。
- 边界框回归损失在两个数据集上均发挥同等作用,移除后MODA下降0.5%,表明其在精确定位中的价值。
- 将多视角可变形注意力替换为标准可变形注意力后,Wildtrack和MultiviewX的性能分别下降1.7%和0.7%,证明了所提注意力机制的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。