[论文解读] Query Adaptive Few-Shot Object Detection with Heterogeneous Graph Convolutional Networks
该论文提出 QA-FewDet,一种基于异质图卷积网络的查询自适应少样本目标检测模型,通过建模提议区域与类别原型之间的多关系交互,实现少样本目标检测。通过在两阶段图结构中整合类别-类别、类别-提议和提议-提议之间的消息传递,该方法在 PASCAL VOC 和 MSCOCO 基准上取得当前最优性能,在少样本设置下 AP50 指标超越先前方法超过 4%。
Few-shot object detection (FSOD) aims to detect never-seen objects using few examples. This field sees recent improvement owing to the meta-learning techniques by learning how to match between the query image and few-shot class examples, such that the learned model can generalize to few-shot novel classes. However, currently, most of the meta-learning-based methods perform pairwise matching between query image regions (usually proposals) and novel classes separately, therefore failing to take into account multiple relationships among them. In this paper, we propose a novel FSOD model using heterogeneous graph convolutional networks. Through efficient message passing among all the proposal and class nodes with three different types of edges, we could obtain context-aware proposal features and query-adaptive, multiclass-enhanced prototype representations for each class, which could help promote the pairwise matching and improve final FSOD accuracy. Extensive experimental results show that our proposed model, denoted as QA-FewDet, outperforms the current state-of-the-art approaches on the PASCAL VOC and MSCOCO FSOD benchmarks under different shots and evaluation metrics.
研究动机与目标
- 解决现有基于元学习的少样本目标检测方法在匹配过程中将操作视为孤立的成对操作,而未建模类别间或上下文关系的局限性。
- 通过基于图的消息传递学习上下文感知的提议特征以及查询自适应、多类别增强的原型,提升特征表示能力。
- 通过类别-提议边实现相互适应,减少提议特征与类别原型之间的分布差异。
- 通过利用异质图结构提供的上下文和关系归纳偏置,在极端少样本场景(如 1-shot)中提升检测精度。
- 开发一种端到端可训练、高效的基于图的架构,使其在不同样本设置和基准上均具备可扩展性。
提出的方法
- 构建一个包含三种边类型的异质图:类别-类别边(用于多类别关系建模)、类别-提议边(用于相互适应)和提议-提议边(用于局部和全局上下文建模)。
- 将图划分为两个子图:一个与查询无关的类别间子图(用于建模类别间关系)和多个与查询相关的类别内子图(用于类别内消息传递)。
- 使用图卷积网络在节点间执行高效的消息传递,基于关系上下文更新提议特征和类别原型。
- 在基础类别数据上采用基于任务的训练策略,学习一种无需在新类别上微调即可泛化的少样本检测策略。
- 将原型学习与图传播相结合,生成查询自适应、多类别增强的类别表示,以增强对少样本变化的鲁棒性。
- 端到端训练使特征提取、图消息传递和匹配头预测能够联合优化。
实验结果
研究问题
- RQ1建模多类别关系是否能通过从相似基础类别迁移知识,提升少样本目标检测性能?
- RQ2是否通过引入提议到提议和类别到提议的消息传递,能够提升特征质量并减少提议与原型之间的分布偏移?
- RQ3在极端少样本设置下,具有多种边类型的异质图结构是否能优于成对匹配方法?
- RQ4与标准元学习基线相比,所提出的基于图的消息传递在不同样本设置下的泛化能力和鲁棒性如何?
- RQ5与基于微调的方法相比,基于图的模型在 1-shot 和 2-shot 检测中在多大程度上减少了过拟合?
主要发现
- 在 PASCAL VOC 的 1-shot 检测中,QA-FewDet 达到 42.4% AP 和超过 4.0% 的 AP50 提升,优于先前最先进方法;在 10-shot 设置下,AP 达到 63.4%。
- 在 MSCOCO 上,模型在 10-shot 检测中达到 35.2% AP、42.9% AP50 和 47.8% AP75,超越所有先前方法,包括使用微调的方法。
- 在 PASCAL VOC 的 1-shot 检测中,QA-FewDet 实现 5.1% AP 和 10.5% AP50,显著超过先前最先进方法的 4.9% AP 和 10.3% AP50。
- 即使在极端少样本场景(1/2/3-shot)中,该模型仍保持强大性能,而微调方法常因过拟合而失效,表明其具有优越的泛化能力。
- 消融研究证实,三类边(类别-类别、类别-提议、提议-提议)均对性能提升有显著贡献,其中类别-类别边带来的提升最大。
- 所提出的异质图结构实现了高效的消息传递和端到端训练,在无需对新类别进行微调的情况下,实现了最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。