[论文解读] All About Knowledge Graphs for Actions
该论文提出了一种基于知识图谱(KG)的零样本和少样本动作识别框架,采用多种知识表示形式——词嵌入、动词-名词对以及视觉特征,以提升对未见动作的泛化能力。通过构建混合知识图谱并利用图卷积网络(GCNs),该方法在零样本识别任务中取得显著性能提升,尤其在结合语言与视觉知识时,UCF101数据集上的零样本准确率相较基线方法最高提升15.8%。
Current action recognition systems require large amounts of training data for recognizing an action. Recent works have explored the paradigm of zero-shot and few-shot learning to learn classifiers for unseen categories or categories with few labels. Following similar paradigms in object recognition, these approaches utilize external sources of knowledge (eg. knowledge graphs from language domains). However, unlike objects, it is unclear what is the best knowledge representation for actions. In this paper, we intend to gain a better understanding of knowledge graphs (KGs) that can be utilized for zero-shot and few-shot action recognition. In particular, we study three different construction mechanisms for KGs: action embeddings, action-object embeddings, visual embeddings. We present extensive analysis of the impact of different KGs in different experimental setups. Finally, to enable a systematic study of zero-shot and few-shot approaches, we propose an improved evaluation paradigm based on UCF101, HMDB51, and Charades datasets for knowledge transfer from models trained on Kinetics.
研究动机与目标
- 探究不同知识图谱(KG)构建方法对零样本与少样本动作识别的影响。
- 评估基于词嵌入、基于动词-宾语对以及基于视觉特征的KG在将已见动作类别的知识迁移到未见动作类别方面的有效性。
- 设计一种稳健的评估范式,从Kinetics(训练集)与UCF101、HMDB51和Charades(测试集)中排除共用类别,以确保零样本与少样本学习基准的公平性。
- 证明通过sentence2vec对动作短语进行序列建模,可提升语义表征质量,优于单个词嵌入。
提出的方法
- 构建三个独立的知识图谱:KG1使用动作类别名称的词嵌入,KG2使用动作短语中的动词-名词对嵌入,KG3使用少样本示例的视觉特征嵌入。
- 利用sentence2vec将多词动作短语编码为密集语义向量,以提升相比单个词嵌入的表征能力。
- 在每个KG上构建图卷积网络(GCN),以实现从已见类别到未见类别的分类器权重传播。
- 将多个KG(如KG1 + KG2 + KG3)组合,构建混合知识图谱,以增强少样本学习中的特征迁移能力。
- 采用6层GCN作为信息传播与图平滑的最优深度。
- 设计一种新的评估协议,从Kinetics(训练集)与UCF101、HMDB51和Charades(测试集)中排除共用类别,以确保零样本与少样本基准的有效性。
实验结果
研究问题
- RQ1不同的知识图谱构建方法——词嵌入、动词-名词对以及视觉特征——如何影响零样本与少样本动作识别的性能?
- RQ2通过sentence2vec获得的语言语义与视觉特征相比,在提升对未见动作的泛化能力方面,各自贡献如何?
- RQ3结合多种知识图谱类型(如语言与视觉)是否能优于仅使用单一类型,在少样本学习中取得更优性能?
- RQ4图卷积网络(GCN)的深度如何影响动作识别中知识迁移的性能?
- RQ5基于GCN的知识迁移在多大程度上优于简单线性组合最近邻分类器权重的方法?
主要发现
- 使用sentence2vec对多词动作短语进行编码,显著提升了语义表征质量,相比单个词嵌入,能带来更好的零样本识别性能。
- KG1(基于词的)、KG2(基于动词-名词对的)与KG3(基于视觉特征的)知识图谱的组合实现了最高性能,在UCF101上的零样本准确率相较基线方法最高提升15.8%。
- KG3(基于视觉特征的KG)在具有显著视觉特征的动作(如“单杠”和“开枪”)上表现最佳,因为这些动作的视觉线索具有高度判别性。
- 6层GCN达到最优性能,更深的网络会导致过平滑,而更浅的网络则限制信息传播。
- 基于GCN的方法优于简单线性组合邻居分类器权重的方法,证明了图中结构化消息传递的价值。
- 视觉注意力图(CAM)表明,模型学习到了有意义的关系——例如,“弹奏西塔琴”会被“弹奏吉他”激活,但不会被无关动作如“骑自行车”激活——验证了模型的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。