Skip to main content
QUICK REVIEW

[论文解读] Unknown-Aware Object Detection: Learning What You Don't Know from Videos in the Wild

Xuefeng Du, Xin Wang|arXiv (Cornell University)|Mar 8, 2022
Advanced Neural Network Applications被引用 4
一句话总结

该论文提出STUD,一种新颖的未知感知目标检测框架,通过空间-时间未知蒸馏和基于能量的不确定性正则化,从真实世界视频中蒸馏多样化的分布外(OOD)物体。通过利用未标注的视频数据来正则化决策边界,而无需人工标注的OOD数据,STUD在保持分布内检测准确率的同时,在BDD100K数据集上将FPR95降低超过10%,实现了SOTA级别的OOD检测性能。

ABSTRACT

Building reliable object detectors that can detect out-of-distribution (OOD) objects is critical yet underexplored. One of the key challenges is that models lack supervision signals from unknown data, producing overconfident predictions on OOD objects. We propose a new unknown-aware object detection framework through Spatial-Temporal Unknown Distillation (STUD), which distills unknown objects from videos in the wild and meaningfully regularizes the model's decision boundary. STUD first identifies the unknown candidate object proposals in the spatial dimension, and then aggregates the candidates across multiple video frames to form a diverse set of unknown objects near the decision boundary. Alongside, we employ an energy-based uncertainty regularization loss, which contrastively shapes the uncertainty space between the in-distribution and distilled unknown objects. STUD establishes the state-of-the-art performance on OOD detection tasks for object detection, reducing the FPR95 score by over 10% compared to the previous best method. Code is available at https://github.com/deeplearning-wisc/stud.

研究动机与目标

  • 为解决在真实世界场景中模型对未见物体产生过度自信预测这一关键但研究不足的挑战,即分布外(OOD)目标检测问题。
  • 开发一种方法,使目标检测器能够在无需昂贵的人工标注OOD数据的情况下,学习对未知物体的不确定性。
  • 通过利用自然视频数据进行自监督蒸馏,改进分布内与OOD物体之间的决策边界泛化能力。
  • 通过利用视频中的空间与时间多样性,建立一种新的OOD检测范式。
  • 在显著提升OOD检测性能的同时,保持高精度的分布内检测性能。

提出的方法

  • 空间-时间未知蒸馏(STUD)使用OOD度量在参考帧中识别未知物体候选,然后在特征空间中通过基于差异性的加权方式线性组合,形成多样化的蒸馏未知样本。
  • 该方法在多个视频帧中聚合蒸馏的未知样本,以捕捉时间多样性,并丰富OOD类样本的分布。
  • 引入基于能量的不确定性正则化损失,以对比方式塑造不确定性空间,使分布内物体获得更高得分,而蒸馏的未知样本获得更低得分。
  • 通过共享主干网络与不确定性正则化分支联合优化目标检测与OOD检测,引导决策边界向更保守的方向发展。
  • 该方法避免使用生成对抗网络(GANs)等生成合成OOD样本或负样本提议,这些方法在消融实验中被证明表现欠佳。
  • 该方法在BDD100K和Youtube-VIS等标准视频数据集上端到端训练,仅使用标准的分布内(ID)标注和自然视频内容提取OOD信号。

实验结果

研究问题

  • RQ1能否从未标注的真实世界视频中有效蒸馏出分布外物体,以在无需人工标注OOD数据的情况下提升OOD检测性能?
  • RQ2如何利用视频数据中的空间与时间多样性,构建有意义且具代表性的未知物体代理,用于模型正则化?
  • RQ3基于能量的不确定性正则化能否改善目标检测中分布内与分布外物体之间的决策边界?
  • RQ4与基于合成OOD生成或负样本提议的方法相比,从真实视频中蒸馏未知样本是否能在OOD检测性能上表现更优?
  • RQ5在不降低分布内检测性能的前提下,OOD检测能力最多可提升多少?

主要发现

  • 与先前SOTA方法相比,STUD在BDD100K数据集上将FPR95降低了10.88%,证明了其在OOD检测性能上的优越性。
  • 该方法保持了高精度的分布内检测性能,表明OOD泛化能力的提升并未以牺牲ID性能为代价。
  • 定性结果表明,STUD减少了对OOD物体的误报预测,并降低了这些误报的置信度得分,优于原始检测器。
  • 消融实验确认,空间-时间蒸馏与基于能量的正则化均不可或缺,所提方法优于基于GAN的合成方法与负样本提议基线。
  • 该框架有效利用自然视频数据提取有意义的OOD信号,消除了对昂贵OOD标注的需求。
  • 基于能量的不确定性正则化成功塑造了不确定性表面,使推理阶段分布内与OOD预测之间的分离更加清晰。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。