[论文解读] Opening the Vocabulary of Egocentric Actions
本文提出了一种用于第一视角视频的开放词汇动作识别方法,通过使用与对象无关的动词编码器和基于CLIP的提示学习方法来识别活跃对象,使模型能够将动词泛化到训练中未见的新对象。该方法在EPIC-KITCHENS-100和Assembly101基准上实现了最先进性能,在识别未见的动词-对象组合方面显著优于封闭集方法。
Human actions in egocentric videos are often hand-object interactions composed from a verb (performed by the hand) applied to an object. Despite their extensive scaling up, egocentric datasets still face two limitations - sparsity of action compositions and a closed set of interacting objects. This paper proposes a novel open vocabulary action recognition task. Given a set of verbs and objects observed during training, the goal is to generalize the verbs to an open vocabulary of actions with seen and novel objects. To this end, we decouple the verb and object predictions via an object-agnostic verb encoder and a prompt-based object encoder. The prompting leverages CLIP representations to predict an open vocabulary of interacting objects. We create open vocabulary benchmarks on the EPIC-KITCHENS-100 and Assembly101 datasets; whereas closed-action methods fail to generalize, our proposed method is effective. In addition, our object encoder significantly outperforms existing open-vocabulary visual recognition methods in recognizing novel interacting objects.
研究动机与目标
- 为解决第一视角动作数据集中动词-对象组合稀疏的问题,该问题限制了对新对象的泛化能力。
- 使动作识别模型能够将动词泛化到训练期间未见的开放词汇对象。
- 克服第一视角视频理解中长尾分布和静态帧表征带来的偏差。
- 开发一种方法,即使在存在干扰物的杂乱场景中,也能识别出经历状态变化的活跃对象。
- 在EPIC-KITCHENS-100和Assembly101上创建真实的开放词汇基准,用于评估对基础类别之外的泛化能力。
提出的方法
- 采用与对象无关微调(OAP)策略,结合监督对比损失和针对第一视角视频的任务特定引导增强,实现动词与对象预测的解耦。
- 设计了保留时间运动和对象交互的引导增强,提升了对相机运动和干扰物的鲁棒性。
- 提出主动对象提示(AOP),一种可学习的、由动词条件控制的提示机制,引导CLIP识别第一视角场景中的活跃对象。
- 通过为每个对象类别微调可学习的词嵌入,对CLIP的文本编码器进行微调,提升了视觉特征与开放词汇对象标签之间的对齐。
- 采用双分支架构:一个在OAP上训练的动词编码器,用于学习与对象无关的表征;一个使用CLIP和AOP的物体编码器,实现零样本泛化。
- 通过重新利用EPIC-KITCHENS-100和Assembly101中现有的划分,创建开放词汇基准,在推理时引入新的对象类别。
实验结果
研究问题
- RQ1是否能够将动词表征与特定对象的特征解耦,从而实现在第一视角视频中对新对象的泛化?
- RQ2在存在干扰物的杂乱第一视角场景中,如何可靠地识别出经历状态变化的活跃对象?
- RQ3通过提示学习,基于CLIP的视觉-语言模型在多大程度上可以被适配,以识别第一视角动作识别中新的交互对象?
- RQ4使用引导增强进行与对象无关的训练,是否能提升动词在未见对象上的零样本泛化能力?
- RQ5与封闭集基线相比,该方法在真实世界的第一视角数据集的开放词汇设置下,效果如何?
主要发现
- 所提方法在HOI裁剪消融实验中达到10.8的调和平均(HM),显著优于全帧基线(HM=7.5),证明了局部对象和手部裁剪的有效性。
- 当每个对象使用m=5个可学习词嵌入时,模型在新类别上的表现最佳,表明微调提示词库可提升对未见对象的泛化能力。
- 与对象无关的动词编码器结合引导增强,提升了泛化能力,表现为在新对象组合上的性能优于标准对比学习方法。
- 主动对象提示(AOP)使CLIP模型能够在复杂的第一视角场景中正确识别出活跃对象,即使存在多个对象且仅一个发生状态变化。
- 可解释性分析表明,微调后的提示常能纠正复数形式(如“eggs”而非“egg”)或同义关系(如“faucet”而非“tap”),从而改善与自然语言的一致性。
- 该方法在EPIC-KITCHENS-100和Assembly101上显著优于封闭动作识别基线,证明了其在开放词汇泛化中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。