[论文解读] RareAct: A video dataset of unusual interactions
本文提出了RareAct,一个用于评估动作识别模型零样本和少样本组合能力的视频数据集,包含罕见的人-物交互行为,由不常见的动词-名词组合构成(例如‘搅拌手机’、‘用微波炉加热鞋子’)。通过使用在HowTo100M上预训练的视频-文本模型,研究发现联合建模动词-名词对的表现显著优于分别检测的方式,表明组合性仍是视频理解中的主要挑战。
This paper introduces a manually annotated video dataset of unusual actions, namely RareAct, including actions such as "blend phone", "cut keyboard" and "microwave shoes". RareAct aims at evaluating the zero-shot and few-shot compositionality of action recognition models for unlikely compositions of common action verbs and object nouns. It contains 122 different actions which were obtained by combining verbs and nouns rarely co-occurring together in the large-scale textual corpus from HowTo100M, but that frequently appear separately. We provide benchmarks using a state-of-the-art HowTo100M pretrained video and text model and show that zero-shot and few-shot compositionality of actions remains a challenging and unsolved task.
研究动机与目标
- 评估动作识别模型在罕见、不寻常的常见动作动词与物体名词组合上的组合能力。
- 通过构建一个罕见且异常的交互行为基准,弥补现有数据集中仅关注频繁动作的不足。
- 提供一种标准化的评估协议,包含共享动词或名词的困难负样本,以测试模型的泛化能力。
- 证明当前最先进模型在视频理解中仍难以应对零样本和少样本的组合性挑战。
- 通过公开可用的数据集,为未来在视频动作识别中研究组合泛化提供支持。
提出的方法
- 通过从HowTo100M中选取在该数据集中不常共现但各自本身频繁出现的动词-名词对,构建RareAct,确保语义合理性与识别难度。
- 利用视频分享平台基于查询搜索每个动词-名词对的视频,随后将视频分割为10秒的片段。
- 采用7类标注方案:正样本(动词作用于名词)、困难负样本(仅动词、仅名词,或动词与名词不发生交互)、负样本(两者均无)、模糊样本或被丢弃的片段。
- 使用逆视频频率加权计算mWAP,并对mSAP进行下采样,以减少单个视频中多个片段带来的偏差。
- 使用在HowTo100M上预训练的S3D视频-文本模型进行基准测试,计算动词、名词及动词-名词联合对的相似度得分。
- 评估三种基线方法:动词与名词得分的乘法、加法及联合建模方法,且分别在包含与不包含困难负样本的情况下进行评估。
实验结果
研究问题
- RQ1动作识别模型能否泛化到罕见、未见过的常见动词与名词组合在视频中的表现?
- RQ2包含共享动词或名词的困难负样本,如何影响模型在罕见组合上的性能表现?
- RQ3动词-名词对的联合建模是否优于分别检测动词与名词并组合得分的方法?
- RQ4当前最先进视频-文本模型在零样本和少样本组合性方面仍面临多大程度的挑战?
- RQ5不同评估指标(mWAP、mSAP)如何影响对罕见动作识别中组合泛化能力的评估?
主要发现
- 联合建模方法 $ s((Verb,Noun)|X) $ 达到了40.7 mWAP和44.6 mSAP,显著优于加法与乘法基线方法。
- 加法基线 $ s(Verb|X) + s(Noun|X) $ 的表现优于乘法方法,表明对于罕见组合,通过加法组合得分比使用逻辑与(AND)更有效。
- 在所有基线中引入困难负样本均导致性能下降,证实了其在评估组合泛化能力中的重要性。
- 包含困难负样本的联合模型仅达到30.5 mWAP和34.8 mSAP,表明即使最先进的模型在罕见组合上仍存在困难。
- 最佳联合模型与加法基线之间的性能差距凸显了在视频理解中提升组合推理能力的迫切需求。
- 该数据集表明,当前模型即使在大规模视频-文本数据上进行训练,仍无法对罕见人-物交互实现有效的组合泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。