[论文解读] Informed Democracy: Voting-based Novelty Detection for Action Recognition
该论文提出了一种基于投票的新型动作识别新颖性检测框架,利用贝叶斯神经网络的预测不确定性来识别未见过的动作类别。通过构建一个以高置信度预测为核心的‘知情民主’分类器群体,该方法在UCF-101和HMDB-51数据集上超越了当前最先进方法,实现了UCF-101上97.52%的PR AUC,并显著提升了广义零样本学习的准确率。
Novelty detection is crucial for real-life applications. While it is common in activity recognition to assume a closed-set setting, i.e. test samples are always of training categories, this assumption is impractical in a real-world scenario. Test samples can be of various categories including those never seen before during training. Thus, being able to know what we know and what we do not know is decisive for the model to avoid what can be catastrophic consequences. We present in this work a novel approach for identifying samples of activity classes that are not previously seen by the classifier. Our model employs a voting-based scheme that leverages the estimated uncertainty of the individual classifiers in their predictions to measure the novelty of a new input sample. Furthermore, the voting is privileged to a subset of informed classifiers that can best estimate whether a sample is novel or not when it is classified to a certain known category. In a thorough evaluation on UCF-101 and HMDB-51, we show that our model consistently outperforms state-of-the-art in novelty detection. Additionally, by combining our model with off-the-shelf zero-shot learning (ZSL) approaches, our model leads to a significant improvement in action classification accuracy for the generalized ZSL setting.
研究动机与目标
- 解决现实世界动作识别中封闭集假设带来的关键局限,因为新动作频繁出现。
- 开发一种稳健的方法,以检测测试样本是否属于之前未见过的动作类别。
- 使模型能够识别自身知识的边界,从而减少在分布外输入上的灾难性失败。
- 将新颖性检测与广义零样本学习(GZSL)相结合,提升对已见和未见动作的分类准确率。
- 在标准基准上形式化并评估开放集动作识别,为新颖性检测和GZSL提供新的评估协议。
提出的方法
- 利用MC-Dropout估计深度神经网络中的预测不确定性,近似贝叶斯推理。
- 对于每个测试样本,识别出最自信的分类器(即‘领导者’),并从聚焦于该类别的分类器子集中组建一个投票委员会。
- 委员会根据其不确定性估计对样本是否为新颖样本进行投票,高不确定性表示新颖性。
- 应用投票阈值以决定样本应被分类为已知类别还是被拒绝为新颖样本。
- 将新颖性检测器集成到广义零样本学习(GZSL)流程中,将未知样本路由至ZSL模型,已知样本则交由标准分类器处理。
- 使用ROC曲线下面积和PR曲线下面积作为新颖性检测的评估指标,使用已见/未见准确率的调和平均数作为GZSL的评估指标。
实验结果
研究问题
- RQ1贝叶斯深度学习中的预测不确定性能否有效用于视频识别中新动作类别的检测?
- RQ2基于投票的不确定性感知分类器集成相较于单个模型,如何提升新颖性检测性能?
- RQ3所提出的新型样本检测框架能否与广义零样本学习无缝集成,从而提升整体动作识别性能?
- RQ4在UCF-101和HMDB-51等标准基准上,该方法在新颖性检测AUC方面与现有基线相比表现如何?
- RQ5基于置信度选择分类器的‘知情民主’投票机制,相较于无信息或独裁式投票,是否能带来更好的泛化性和鲁棒性?
主要发现
- 所提出的Informed Democracy模型在UCF-101上实现了92.94%的PR AUC,在HMDB-51上实现了75.33%的ROC AUC,优于所有基线方法。
- 在UCF-101上,该模型达到97.52%的PR AUC,显著高于次优方法(无信息民主为97.15%)。
- 在广义零样本学习(GZSL)设置下,Informed Democracy模型在UCF-101上将准确率提升至23.42%(U+S→U+S),超过标准ConSe模型(21.03%)和传统神经网络置信度方法(20.91%)。
- 在HMDB-51的U→U+S设置下,该模型将零样本准确率提升超过5%(从10.96%提升至13.67%),以传统神经网络置信度为基线。
- Informed Democracy方法始终优于Dictator和Uninformed Democracy变体,证明了基于选择性置信度的分类器筛选具有显著优势。
- 该框架能够有效区分已见动作与新颖动作,实现与现成ZSL模型的无缝集成,并在开放集场景下显著提升其性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。