[论文解读] A Possible Reason for why Data-Driven Beats Theory-Driven Computer Vision
本文认为,计算机视觉中数据驱动深度学习的主导地位并非单纯源于算法优越性,而是源于一种经验性偏差:理论驱动的算法在传感器设置(如快门速度、增益)超出其最优工作范围的数据集上进行测试,而数据驱动模型则在这些相同分布的数据上进行训练。因此,性能差距被人为地偏向了深度学习,暴露出实验方法论中的系统性疏漏,从而破坏了公平比较。
Why do some continue to wonder about the success and dominance of deep learning methods in computer vision and AI? Is it not enough that these methods provide practical solutions to many problems? Well no, it is not enough, at least for those who feel there should be a science that underpins all of this and that we should have a clear understanding of how this success was achieved. Here, this paper proposes that the dominance we are witnessing would not have been possible by the methods of deep learning alone: the tacit change has been the evolution of empirical practice in computer vision and AI over the past decades. We demonstrate this by examining the distribution of sensor settings in vision datasets and performance of both classic and deep learning algorithms under various camera settings. This reveals a strong mismatch between optimal performance ranges of classical theory-driven algorithms and sensor setting distributions in the common vision datasets, while data-driven models were trained for those datasets. The head-to-head comparisons between data-driven and theory-driven models were therefore unknowingly biased against the theory-driven models.
研究动机与目标
- 调查为何尽管理论驱动的计算机视觉方法具有坚实的理论基础,数据驱动的深度学习模型仍持续在计算机视觉基准测试中表现更优。
- 检验用于基准测试计算机视觉算法的经验方法是否系统性地不利于理论驱动模型。
- 分析常见视觉数据集中相机传感器设置(如快门速度、增益)的分布及其对算法性能的影响。
- 证明理论驱动算法表现不佳并非源于内在缺陷,而是因为其在非最优工作范围内被测试。
- 倡导在计算机视觉研究中采用更严格、受控且可复现的经验方法,以充分考虑传感器和成像参数。
提出的方法
- 使用CCD和CMOS传感器,在不同光照水平下收集了具有受控相机传感器设置变化(快门速度、电压增益)的数据集。
- 在不同传感器和光照条件下评估多种兴趣点检测与显著性检测算法,以评估其性能敏感性。
- 分析主要公开数据集(如PASCAL VOC、ImageNet)中传感器设置的分布,以确定其是否与理论驱动算法的最优工作范围一致。
- 在相同图像分布上比较数据驱动与理论驱动模型的性能,重点关注传感器参数不匹配对结果的影响。
- 通过一对一比较,隔离数据集分布对算法性能影响,特别强调训练与测试条件之间的不匹配。
- 提出一种改进的实证评估框架,包括明确指定传感器和成像参数范围,以实现公平的算法基准测试。
实验结果
研究问题
- RQ1为何尽管理论驱动模型具有坚实的理论基础,数据驱动模型在计算机视觉基准测试中仍持续表现更优?
- RQ2传感器设置(如快门速度、增益)在多大程度上影响经典理论驱动计算机视觉算法的性能?
- RQ3广泛使用的视觉数据集中传感器参数的分布是否代表了理论驱动算法的最优工作范围?
- RQ4训练数据分布与测试条件之间的不匹配如何在计算机视觉中对算法性能评估造成偏差?
- RQ5需要对经验方法做出哪些改变,以确保数据驱动与理论驱动方法之间实现公平且可复现的比较?
主要发现
- 理论驱动算法仅在其特定且明确定义的相机传感器设置范围(如快门速度、增益)内表现出色,超出该范围则性能显著下降。
- PASCAL VOC和ImageNet等主要视觉数据集中传感器设置的分布严重偏斜,且与理论驱动算法的最优工作范围不一致。
- 数据驱动模型在相同的偏斜数据集分布上进行训练,因此在基准测试中具有固有优势,即使在相同数据上进行测试也是如此。
- 由于训练与测试之间传感器设置的不匹配,数据驱动与理论驱动模型的一对一对比在无意中系统性地偏向后者。
- 当理论驱动算法在其最优工作范围内进行测试时,数据驱动与理论驱动模型之间的性能差距显著减小。
- 实证评估中缺乏对传感器和成像参数的系统性控制,严重损害了计算机视觉基准测试的可复现性与公平性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。