[论文解读] Towards Universal Representation for Unseen Action Recognition
本文提出一种通用表征(UR),用于跨数据集未见动作识别(CD-UAR),基于深度特征与一种基于非负矩阵分解(NMF)结合焦耳-申农散度(JSD)约束的新型通用表征学习(URL)算法。该方法通过生成式多实例学习(GMIL)发现共享的视觉-语义‘构建模块’,实现在无需微调或重新训练的情况下,对跨数据集的未见动作实现零样本识别,在UCF101与HMDB51基准上超越了最先进方法。
Unseen Action Recognition (UAR) aims to recognise novel action categories without training examples. While previous methods focus on inner-dataset seen/unseen splits, this paper proposes a pipeline using a large-scale training source to achieve a Universal Representation (UR) that can generalise to a more realistic Cross-Dataset UAR (CD-UAR) scenario. We first address UAR as a Generalised Multiple-Instance Learning (GMIL) problem and discover 'building-blocks' from the large-scale ActivityNet dataset using distribution kernels. Essential visual and semantic components are preserved in a shared space to achieve the UR that can efficiently generalise to new datasets. Predicted UR exemplars can be improved by a simple semantic adaptation, and then an unseen action can be directly recognised using UR during the test. Without further training, extensive experiments manifest significant improvements over the UCF101 and HMDB51 benchmarks.
研究动机与目标
- 解决现有零样本动作识别方法依赖于数据集内已见/未见划分的局限性,此类划分在实际部署中不切实际。
- 开发一种通用表征(UR),可在无需在新数据上微调或重新训练的情况下,泛化于多样化数据集。
- 通过利用大规模源数据(如ActivityNet)学习共享的视觉-语义基元,实现有效的跨数据集零样本动作识别。
- 通过新颖的JSD约束NMF框架,保留视觉与语义特征的共享及生成性成分,提升对未见动作的泛化能力。
提出的方法
- 该方法首先使用预训练的卷积神经网络从视频帧中提取深度特征,随后通过生成式多实例学习(GMIL)识别代表动作的关键‘构建模块’。
- 提出一种新颖的通用表征学习(URL)算法,结合非负矩阵分解(NMF)与焦耳-申农散度(JSD)约束,以统一视觉与语义模态。
- JSD约束通过在源域与目标域之间保留生成性基元,确保对新视觉与语义分布的均衡泛化。
- 通过迁移联合匹配(TJM)层实现语义领域自适应,将Word2vec模型推断出的未见原型与源域的视觉UR基元对齐。
- 通过在非负性与JSD约束下对联合视觉-语义特征矩阵进行分解,学习UR,从而实现基于部件、可解释的表征。
- 推理阶段,未见动作通过相同的GMIL组件编码,并与UR通过余弦相似度匹配,实现无需进一步训练的直接识别。
实验结果
研究问题
- RQ1能否从大规模源数据集中学习到一种通用表征,使其在完全新的数据集中的未见动作上实现有效泛化?
- RQ2如何联合分解视觉与语义特征,以在零样本动作识别中保留跨领域偏移下的共享与生成性成分?
- RQ3在NMF中引入JSD约束在跨数据集零样本学习中对未见分布泛化的提升程度如何?
- RQ4所提出的流程是否在归纳与归纳性CD-UAR场景下优于现有方法,且无需在目标数据上微调?
- RQ5URL框架中基空间维度对性能的敏感程度如何?
主要发现
- 所提出的通用表征(UR)在归纳CD-UAR场景下,于UCF101与HMDB51基准上显著优于最先进方法,展现出跨数据集的强大泛化能力。
- 在GMIL特征上使用RBF核的基线方法性能从15.0%提升至19.8%,表明所提流程整体框架的有效性。
- 在URL中移除JSD约束(即使用标准NMF)导致性能严重下降,证明了分布保持约束对泛化能力的必要性。
- 在HMDB51的归纳CD-UAR场景中,使用迁移联合匹配(TJM)进行领域自适应使性能提升约5%,凸显其在对齐视觉与语义空间中的关键作用。
- 该方法对基空间大小相对不敏感,高维与低维设置均取得相近结果,仅观察到微小性能差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。