[论文解读] Few-Shot Object Detection via Variational Feature Aggregation
本文提出一种元学习框架,用于少样本目标检测,结合类无关聚合(CAA)与变分特征聚合(VFA),以减少对基础类别的偏差,并提升对少样本示例差异的鲁棒性。通过使用在基础数据上预训练的变分自编码器建模类别分布,并将分类与回归解耦,VFA 实现了更准确且稳定的特征聚合,相较于强基线模型在 PASCAL VOC 和 COCO 上实现了高达 16% 的相对性能提升,达到当前最优水平。
As few-shot object detectors are often trained with abundant base samples and fine-tuned on few-shot novel examples,the learned models are usually biased to base classes and sensitive to the variance of novel examples. To address this issue, we propose a meta-learning framework with two novel feature aggregation schemes. More precisely, we first present a Class-Agnostic Aggregation (CAA) method, where the query and support features can be aggregated regardless of their categories. The interactions between different classes encourage class-agnostic representations and reduce confusion between base and novel classes. Based on the CAA, we then propose a Variational Feature Aggregation (VFA) method, which encodes support examples into class-level support features for robust feature aggregation. We use a variational autoencoder to estimate class distributions and sample variational features from distributions that are more robust to the variance of support examples. Besides, we decouple classification and regression tasks so that VFA is performed on the classification branch without affecting object localization. Extensive experiments on PASCAL VOC and COCO demonstrate that our method significantly outperforms a strong baseline (up to 16\%) and previous state-of-the-art methods (4\% in average). Code will be available at: \url{https://github.com/csuhan/VFA}
研究动机与目标
- 解决少样本目标检测器因训练数据中类别不平衡而导致对基础类别的偏差问题。
- 通过跨类别特征交互鼓励类无关表征,减少新类别与基础类别之间的混淆。
- 通过使用变分自编码器建模类别分布,提升对少样本示例类内差异的鲁棒性。
- 将分类与回归分支解耦,使特征聚合专注于平移不变表征,同时不影响定位性能。
- 在支持样本有限的情况下,实现在少样本目标检测基准上的最先进性能。
提出的方法
- 提出类无关聚合(CAA),实现查询特征与支持特征之间无论类别身份如何均能进行特征交互,降低类别偏差并提升泛化能力。
- 引入变分特征聚合(VFA),使用在基础类别上预训练的共享变分自编码器(VAE)从少样本支持示例中建模类别级分布。
- 使用 VAE 将支持特征编码为潜在分布(均值 μ 和方差 σ),然后通过 z = μ + ε·σ 采样得到鲁棒原型,用于与查询特征聚合。
- 在新类别上微调 VAE 时应用一致性损失 ℒcons,以在微调过程中保留类别特定信息,确保分布估计的有效性。
- 将分类头与回归头解耦,使 VFA 仅作用于分类分支,从而保持定位精度。
- 采用元学习训练范式:模型先在基础类别上进行预训练,再在包含 K 个支持样本的少样本新类别上进行微调。

实验结果
研究问题
- RQ1跨类别特征交互是否能减少少样本目标检测中对基础类别的偏差?
- RQ2通过变分自编码器建模类别分布是否能提升对少样本示例类内差异的鲁棒性?
- RQ3解耦分类与回归是否能实现更有效的特征聚合,同时不降低定位性能?
- RQ4从丰富基础类别中学习到的分布能否有效迁移至仅具 K 个样本的新类别上以实现泛化?
- RQ5特征表示的选择(如原始特征、重建特征、潜在特征)如何影响类别原型的鲁棒性与准确性?
主要发现
- 所提出的 VFA 方法在 1-shot 检测中将强基线 Meta R-CNN++ 的平均精度提升最高达 16%,在低样本场景下表现出显著增益。
- 在 PASCAL VOC 上,当 ℒcons 应用于重建特征 S′ 时,VFA 在 1-shot 检测中达到 57.7% 的 nAP,优于无 VFA 的 51.3% 基线。
- 该方法显著减少了新类别与基础类别之间的混淆:例如,在 CAA 和 VFA 下,新类别“cow”与基础类别如“horse”和“sheep”的相似度显著下降。
- 通过 VFA 估计的类别原型对样本数量减少更具鲁棒性;随着支持样本数减少,其与真实类别中心的距离增长更缓慢。
- VAE 输出的潜在表示 μ 和 σ 在原型准确性和鲁棒性方面优于原始特征 S 和重建特征 S′。
- 一致性损失 ℒcons 至关重要:将其应用于重建特征 S′ 时性能最佳(1-shot 时达到 57.7% nAP),表明其在分布学习过程中对保留类别特定信息的关键作用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。