[论文解读] Multiple Instance Reinforcement Learning for Efficient Weakly-Supervised Detection in Images
该论文提出了一种弱监督的多实例强化学习框架,仅使用图像级别标签和眼动数据,实现图像中高效的目标检测,避免了边界框标注的需求。通过将多实例学习中的拓扑约束与强化学习相结合,以实现序列化搜索策略,该方法在检测精度上可与穷举滑动窗口方法相媲美,同时将计算成本降低了高达50%。
State-of-the-art visual recognition and detection systems increasingly rely on large amounts of training data and complex classifiers. Therefore it becomes increasingly expensive both to manually annotate datasets and to keep running times at levels acceptable for practical applications. In this paper, we propose two solutions to address these issues. First, we introduce a weakly supervised, segmentation-based approach to learn accurate detectors and image classifiers from weak supervisory signals that provide only approximate constraints on target localization. We illustrate our system on the problem of action detection in static images (Pascal VOC Actions 2012), using human visual search patterns as our training signal. Second, inspired from the saccade-and-fixate operating principle of the human visual system, we use reinforcement learning techniques to train efficient search models for detection. Our sequential method is weakly supervised and general (it does not require eye movements), finds optimal search strategies for any given detection confidence function and achieves performance similar to exhaustive sliding window search at a fraction of its computational cost.
研究动机与目标
- 通过利用图像标签和人类眼动数据等弱监督信号,解决大规模目标检测中人工标注的高成本问题。
- 开发一种基于分割的多实例学习模型,能够在不依赖真实边界框或分割结果的情况下推断出准确的检测器。
- 设计一种受人类扫视-凝视机制启发的基于强化学习的序列化搜索策略,以在保持检测精度的同时降低计算成本。
- 证明眼动数据可作为弱监督设置下训练检测和分类模型的有力但尚未被充分利用的监督信号。
提出的方法
- 构建一种受约束的多实例学习(CMI)模型,引入拓扑约束以仅使用图像级别标签和眼动数据提升定位精度。
- 采用基于分割的方法,结合CPMC(上下文感知提议挖掘)生成候选区域,再通过弱监督训练的置信度函数对候选区域进行评分。
- 应用强化学习学习最优的序列化搜索策略,使智能体根据置信度分数和预期奖励选择要评估的区域,以模仿人类视觉扫描行为。
- 使用BFGS优化算法优化搜索策略,以最大化预期检测奖励,并通过正则化防止过拟合。
- 仅使用图像级别标签和眼动模式联合训练检测置信度函数与搜索策略,从而完全避免对真实边界框的需求。
- 将学习到的搜索策略与基于CPMC的提议生成流程集成,在推理过程中显著减少需评估的区域数量,同时保持高精度。
实验结果
研究问题
- RQ1眼动数据能否被有效利用作为弱监督信号,在无需边界框标注的情况下训练出准确的目标检测器?
- RQ2多实例学习中的拓扑约束在弱监督目标检测中如何提升定位精度?
- RQ3基于强化学习的序列化搜索策略在多大程度上能匹配穷举滑动窗口搜索的性能,同时降低计算成本?
- RQ4结合检测置信度与搜索策略的联合学习框架是否优于两阶段方法(即分别训练检测与搜索)?
- RQ5当仅提供图像级别标签和眼动数据时,弱监督目标检测的性能与全监督基线相比如何?
主要发现
- 所提出的CMI-EYE-DET方法在无真实边界框的情况下,检测平均精度与全监督基线相当。
- 在多实例学习框架中引入拓扑约束,显著提升了所有评估指标下的定位精度。
- 眼动数据使图像分类性能接近使用边界框标注训练的全监督模型。
- 基于强化学习的搜索策略(CMI-EYE-SEQ)仅评估约50%的候选区域,相比穷举搜索,检测与分类精度几乎完全相同。
- 计算时间显著减少——平均而言,该方法在考虑CPMC分割提取耗时的情况下,相比穷举评估实现了两倍或以上的加速。
- 该方法在所有指标上均优于标准多实例学习和仅使用眼动数据的基线模型,证明了检测置信度与搜索策略联合优化的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。