[论文解读] Out-of-Distribution Detection for Generalized Zero-Shot Action Recognition
本文提出了一种用于广义零样本学习动作识别(GZSL)的新颖分布外(OD)检测器,通过将已见类别与未见类别之间的分类分离,缓解了对已见类别的固有偏差。通过使用余弦损失和循环一致性损失训练条件式Wasserstein GAN来合成未见动作特征,OD检测器利用熵最大化来区分未见特征,并将其路由至专用的未见分类器——在Olympic Sports、HMDB51和UCF101数据集上分别实现了7.0%、3.4%和4.9%的绝对准确率提升,达到当前最优性能。
Generalized zero-shot action recognition is a challenging problem, where the task is to recognize new action categories that are unavailable during the training stage, in addition to the seen action categories. Existing approaches suffer from the inherent bias of the learned classifier towards the seen action categories. As a consequence, unseen category samples are incorrectly classified as belonging to one of the seen action categories. In this paper, we set out to tackle this issue by arguing for a separate treatment of seen and unseen action categories in generalized zero-shot action recognition. We introduce an out-of-distribution detector that determines whether the video features belong to a seen or unseen action category. To train our out-of-distribution detector, video features for unseen action categories are synthesized using generative adversarial networks trained on seen action category features. To the best of our knowledge, we are the first to propose an out-of-distribution detector based GZSL framework for action recognition in videos. Experiments are performed on three action recognition datasets: Olympic Sports, HMDB51 and UCF101. For generalized zero-shot action recognition, our proposed approach outperforms the baseline (f-CLSWGAN) with absolute gains (in classification accuracy) of 7.0%, 3.4%, and 4.9%, respectively, on these datasets.
研究动机与目标
- 解决广义零样本学习(GZSL)模型在分类过程中对已见动作类别存在的固有偏差问题。
- 通过引入专用的分布外(OD)检测器,减少将未见动作样本误分类为已见类别的现象。
- 通过条件式GAN生成未见特征,实现在无真实未见特征的情况下有效训练OD检测器。
- 通过基于OD检测结果动态将特征路由至已见或未见分类器,提升GZSL性能。
- 在具有不同属性可用性与视频特征类型的多个数据集上,验证该框架的有效性。
提出的方法
- OD检测器使用来自已见动作类别的真实特征以及未见类别生成的GAN特征进行训练。
- 采用条件式Wasserstein GAN(CEWGAN)来合成未见动作特征,以类别嵌入(属性)为条件,确保语义一致性。
- CEWGAN通过引入余弦嵌入损失和循环一致性损失进行优化,以提升特征的多样性与质量。
- OD检测器通过最大化未见特征输出的熵,生成非均匀分布(已见类别呈现峰值,未见类别趋于均匀),实现有效区分。
- 推理阶段,通过将OD检测器输出的熵与阈值比较,决定将特征路由至已见分类器或未见分类器。
- 最终预测由对应检测到的分布类型(已见或未见)的分类器做出。
实验结果
研究问题
- RQ1在GZSL视频识别中,OD检测器能否有效区分已见与未见动作类别?
- RQ2当真实未见特征不可用时,如何有效合成未见动作特征以用于OD检测器的训练?
- RQ3将已见与未见类别的分类路径分离,是否能有效降低GZSL中对已见类别的固有偏差?
- RQ4使用额外正则化(余弦损失与循环一致性损失)的合成特征,在多大程度上提升了OD检测性能?
- RQ5所提出的框架是否能在具有与不具有手工标注属性的数据集上均实现良好泛化?
主要发现
- 所提出的CEWGAN-OD框架在Olympic Sports数据集上的GZSL任务中,相对于基线模型实现了7.0%的绝对准确率提升。
- 在HMDB51数据集上,该方法相比基线模型(使用word2vec嵌入)将GZSL准确率提升了3.4%。
- 在UCF101数据集上,该框架相比基线模型实现了4.9%的绝对准确率提升。
- 在HMDB51上,使用迁移学习得到的手工属性(由word2vec学习获得)进行特征合成,性能优于仅使用word2vec的情况。
- 在所有数据集中,I3D外观+光流(I3D af)特征表现最佳,优于C3D和仅I3D的变体。
- OD检测器基于熵的路由机制能有效减少将未见动作误分类为已见动作的现象,尤其在高准确率设置下表现显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。