[论文解读] Hybrid Relation Guided Set Matching for Few-shot Action Recognition
本文提出了一种新型 few-shot 动作识别框架——混合关系引导集合匹配(HyRSM),通过混合关系模块捕捉视频内与视频间的关系,增强任务特定的特征学习,并通过双向均 Hausdorff 距离实现基于集合的视频匹配,提升对时间错位的鲁棒性。HyRSM 在六个基准测试中均达到最先进性能,在 5-way 1-shot 设置下于 SSv2-Full 数据集上实现了 56.0% 的 top-1 准确率。
Current few-shot action recognition methods reach impressive performance by learning discriminative features for each video via episodic training and designing various temporal alignment strategies. Nevertheless, they are limited in that (a) learning individual features without considering the entire task may lose the most relevant information in the current episode, and (b) these alignment strategies may fail in misaligned instances. To overcome the two limitations, we propose a novel Hybrid Relation guided Set Matching (HyRSM) approach that incorporates two key components: hybrid relation module and set matching metric. The purpose of the hybrid relation module is to learn task-specific embeddings by fully exploiting associated relations within and cross videos in an episode. Built upon the task-specific features, we reformulate distance measure between query and support videos as a set matching problem and further design a bidirectional Mean Hausdorff Metric to improve the resilience to misaligned instances. By this means, the proposed HyRSM can be highly informative and flexible to predict query categories under the few-shot settings. We evaluate HyRSM on six challenging benchmarks, and the experimental results show its superiority over the state-of-the-art methods by a convincing margin. Project page: https://hyrsm-cvpr2022.github.io/.
研究动机与目标
- 为解决现有 few-shot 动作识别方法将视频孤立处理、忽略单个 episode 内跨视频关系的局限性。
- 克服严格时间对齐度量在处理错位或顺序可变动作时的脆弱性。
- 开发一种统一的端到端框架,学习任务特定表征并实现灵活、稳健的视频匹配。
- 通过建模跨视频的语义与结构关系,提升 few-shot 视频分类中的泛化性与鲁棒性。
提出的方法
- 混合关系模块首先对每个视频应用内部关系函数,以建模长程时间依赖性,增强结构模式。
- 随后在同 episode 内的视频之间应用跨关系函数,提取跨视频语义线索,丰富与查询预测相关的特征。
- 该方法将查询-支持视频匹配重新表述为集合匹配问题,将每段视频视为帧的集合,以放宽严格的时间顺序要求。
- 提出一种双向均 Hausdorff 距离,用于计算视频集合之间的距离,提升对子动作错位的鲁棒性。
- 框架通过元学习的 episodic 训练方式端到端训练,联合优化特征与匹配分数。
- 该方法在多种主干网络(ResNet-18、-34、-50)上进行评估,展示了其可扩展性与鲁棒性。
实验结果
研究问题
- RQ1在 episode 内同时建模视频内与视频间关系,是否能提升 few-shot 动作识别的特征判别性?
- RQ2采用灵活度量的集合匹配公式是否能在处理错位或顺序可变动作时优于严格时间对齐?
- RQ3与任务无关的特征学习相比,任务特定的关系引导特征学习策略在 few-shot 设置下是否具有更好的泛化能力?
- RQ4所提出的双向均 Hausdorff 距离与现有对齐度量相比,在噪声与错位情况下的鲁棒性如何?
主要发现
- 在 5-way 1-shot 设置下,HyRSM 在 SSv2-Full 数据集上实现了 56.0% 的 top-1 准确率,优于以往最先进方法。
- 所提出的双向均 Hausdorff 距离(Bi-MHM)在 SSv2-Full 上达到 44.6% 的准确率,超过 OTAM(42.8%)与 TRX(42.0%),在相同设置下表现更优。
- 混合关系模块显著提升了特征判别性,相似性可视化显示正确匹配更加突出。
- 更深的主干网络(如 ResNet-34)进一步提升性能,且 HyRSM 在全部六个基准测试(包括 Kinetics、HMDB51 和 Epic-kitchens)中均保持最先进结果。
- 尽管参数量与 FLOPs 略有增加,但由于无需复杂分类器头,HyRSM 的推理速度仍快于 OTAM 与 TRX。
- 消融研究证实,集合匹配度量在噪声与错位情况下的鲁棒性优于标准 Hausdorff 距离与单向度量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。