[论文解读] Revisiting Few-shot Activity Detection with Class Similarity Control
本文提出F-PAD,一种新颖的端到端少样本时序动作检测框架,通过提议回归与类别相似性控制提升未剪辑视频中的检测准确率。通过引入分布自适应损失以解决帧率差异问题,并揭示预训练类别与新类别之间重叠对性能的显著影响,该方法在增加样本数时表现尤为出色,达到当前最优结果,同时倡导采用更严格的评估协议以避免数据泄露。
Many interesting events in the real world are rare making preannotated machine learning ready videos a rarity in consequence. Thus, temporal activity detection models that are able to learn from a few examples are desirable. In this paper, we present a conceptually simple and general yet novel framework for few-shot temporal activity detection based on proposal regression which detects the start and end time of the activities in untrimmed videos. Our model is end-to-end trainable, takes into account the frame rate differences between few-shot activities and untrimmed test videos, and can benefit from additional few-shot examples. We experiment on three large scale benchmarks for temporal activity detection (ActivityNet1.2, ActivityNet1.3 and THUMOS14 datasets) in a few-shot setting. We also study the effect on performance of different amount of overlap with activities used to pretrain the video classification backbone and propose corrective measures for future works in this domain. Our code will be made available.
研究动机与目标
- 开发一种简单而有效的少样本时序动作检测框架,能够在极少监督下泛化至罕见且未见的活动。
- 解决少样本示例视频与未剪辑测试视频之间帧率不匹配的问题,该问题会降低特征相似性与检测性能。
- 研究预训练数据与新检测类别之间的类别重叠对报告的少样本性能的影响,揭示现有基准中潜在的数据泄露问题。
- 通过强制基类与新类之间不相交的划分,提出更公平的评估协议,以提升方法鲁棒性的评估质量。
- 证明增加少样本示例数量可带来显著性能提升,尤其在端到端训练且特征对齐得到优化时。
提出的方法
- 模型使用3D卷积神经网络(C3D)主干网络,从少样本示例视频和未剪辑测试视频中提取特征。
- 时序提议网络从未剪辑视频流中生成候选动作片段(提议),采用感兴趣区域池化实现固定帧率处理。
- 基于相似性的分类头将每个提议的特征嵌入与少样本示例的特征进行比较,以分配最相似的动作标签。
- 引入分布自适应损失,以对齐提议与少样本视频的特征分布,缓解因帧率差异导致的性能下降。
- 整个模型支持端到端训练,实现提议生成与相似性评分的联合优化。
- 通过推理与训练期间引入额外示例,框架支持单样本与少样本学习。
实验结果
研究问题
- RQ1少样本示例视频与未剪辑视频提议之间的帧率差异在多大程度上影响特征相似性与检测性能?
- RQ2预训练数据集与新检测类别之间的类别重叠在多大程度上夸大了报告的少样本检测性能?
- RQ3提议式检测框架是否能在少样本时序动作检测中超越滑动窗口基线方法,同时保持更高的效率?
- RQ4增加少样本示例数量(如从一个增加到五个)对检测准确率的影响如何?这种提升在不同类别划分下是否具有鲁棒性?
- RQ5何种评估协议可确保少样本动作检测模型之间公平可靠的比较,最大限度减少预训练阶段的数据泄露?
主要发现
- 在五样本设置下,F-PAD在ActivityNet1.2上达到50.8% mAP@0.5,在ActivityNet1.3上达到51.6% mAP@0.5,显著优于类似条件下先前的工作。
- 在受控划分下,mAP@0.5在ActivityNet1.2上下降至31.7%,相比非受控划分显著降低,表明先前评估可能因类别重叠而被高估。
- 五样本F-PAD模型在ActivityNet1.2上相比单样本版本mAP@0.5提升9.3个百分点,在ActivityNet1.3上提升8.2个百分点,证明额外示例带来显著收益。
- 分布自适应损失有效减少了由帧率差异引起的特征差异,从而在跨帧率设置下带来可测量的性能提升。
- 在THUMOS’14上,受控划分下五样本设置的mAP@0.5仅为10.3%,凸显类别重叠的影响,凸显采用更严格评估协议的必要性。
- 本研究揭示标准少样本评估协议易受数据泄露影响,建议未来基准应采用不相交的基类与新类划分,并报告标准差,以确保方法鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。