Skip to main content
QUICK REVIEW

[论文解读] Analysing domain shift factors between videos and images for object detection

Vicky Kalogeiton, Vittorio Ferrari|arXiv (Cornell University)|Jan 6, 2015
Advanced Neural Network Applications参考文献 30被引用 4
一句话总结

本文系统分析了用于目标检测的静态图像与视频帧之间的域偏移因素,识别出空间定位精度、外观多样性、图像质量和长宽比分布是导致性能差距的关键因素。通过逐步均衡这些因素,作者将基于图像和视频训练的检测器之间的mAP差距缩小至1.5%以下,表明图像质量和长宽比分布对跨域泛化尤为重要。

ABSTRACT

Object detection is one of the most important challenges in computer vision. Object detectors are usually trained on bounding-boxes from still images. Recently, video has been used as an alternative source of data. Yet, for a given test domain (image or video), the performance of the detector depends on the domain it was trained on. In this paper, we examine the reasons behind this performance gap. We define and evaluate different domain shift factors: spatial location accuracy, appearance diversity, image quality and aspect distribution. We examine the impact of these factors by comparing performance before and after factoring them out. The results show that all four factors affect the performance of the detectors and their combined effect explains nearly the whole performance gap.

研究动机与目标

  • 识别并量化导致在图像与视频上训练的目标检测器之间性能差距的域偏移因素。
  • 评估每个因素——空间定位精度、外观多样性、图像质量与长宽比分布——对检测器性能的影响。
  • 确定均衡这些因素是否能显著缩小或消除基于图像与视频训练的检测器之间的性能差距。
  • 通过揭示最阻碍检测器泛化能力的因素,为弱监督视频训练的未来研究提供指导。

提出的方法

  • 作者分析了两组数据集:PASCAL VOC 07(图像)与YouTube-Objects(视频),以及ILSVRC 2015图像与视频赛道。
  • 他们定义并隔离了四个域偏移因素:空间定位精度、外观多样性、图像质量(通过梯度能量与模糊度衡量)以及长宽比分布(通过KL散度衡量)。
  • 针对每个因素,他们应用均衡化处理使训练集具有可比性——例如,将样本数量减少至匹配,应用高斯模糊以匹配视频的模糊水平,以及重新加权长宽比分布。
  • 在原始与均衡化后的训练集上分别训练R-CNN检测器,并在图像与视频测试集上进行测试,以衡量mAP性能。
  • 在每次均衡化步骤前后测量性能差距,以隔离每个因素的贡献。
  • 该分析采用结构化协议,逐个取消因素,观察性能差距的逐步减少。

实验结果

研究问题

  • RQ1哪些具体的域偏移因素导致了在图像与视频上训练的目标检测器之间的性能差距?
  • RQ2外观多样性、图像质量、长宽比分布与空间定位精度每个因素对性能差距的贡献有多大?
  • RQ3均衡这些域偏移因素是否能显著缩小或消除图像与视频训练检测器之间的性能差距?
  • RQ4哪个因素对检测器在不同域之间的泛化能力影响最大?

主要发现

  • 四个域偏移因素的综合效应几乎完全解释了在图像与视频上训练的检测器之间的性能差距。
  • 图像质量具有显著影响:均衡模糊程度可显著缩小差距,尤其当视频帧比图像更模糊时效果更明显。
  • 当训练数据充足时,外观多样性的影响较小;即使移除40%的唯一样本,图像上的性能仍保持强劲。
  • 长宽比分布具有重大影响:均衡长宽比分布可在两个测试域上显著缩小性能差距。
  • 在均衡所有四个因素后,基于图像与视频训练的检测器在两个测试集上的最终mAP差距均低于1.5%。
  • 本研究表明,去模糊算法与视频数据中更广泛的长宽比覆盖比单纯增加训练样本数量更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。