[论文解读] Attentive Graph Neural Networks for Few-Shot Learning
该论文提出了一种带有三重注意力机制的注意力图神经网络(Attentive GNN)——节点自注意力、邻域注意力和层记忆注意力,以缓解少样本学习中的过平滑和过拟合问题。该方法在归纳和归纳设定下的 mini-ImageNet 与 tiered-ImageNet 基准测试中均取得了最先进性能,并通过理论和实证验证了其泛化能力和可扩展性的提升。
Graph Neural Networks (GNN) has demonstrated the superior performance in many challenging applications, including the few-shot learning tasks. Despite its powerful capacity to learn and generalize the model from few samples, GNN usually suffers from severe over-fitting and over-smoothing as the model becomes deep, which limit the scalability. In this work, we propose a novel Attentive GNN to tackle these challenges, by incorporating a triple-attention mechanism, i.e. node self-attention, neighborhood attention, and layer memory attention. We explain why the proposed attentive modules can improve GNN for few-shot learning with theoretical analysis and illustrations. Extensive experiments show that the proposed Attentive GNN model achieves the promising results, comparing to the state-of-the-art GNN- and CNN-based methods for few-shot learning tasks, over the mini-ImageNet and tiered-ImageNet benchmarks, under ConvNet-4 and ResNet-based backbone with both inductive and transductive settings. The codes will be made publicly available.
研究动机与目标
- 为解决深度图神经网络(GNN)在少样本学习中的过平滑和过拟合问题。
- 通过引入注意力机制,提升模型在低数据场景下的可扩展性和泛化能力。
- 设计一种图神经网络架构,通过图结构的支持集有效捕捉类内与类间关系。
- 从理论和实证两方面验证注意力模块在保持特征可区分性及减少维度损失方面的有效性。
- 在标准少样本学习基准(包括 mini-ImageNet 和 tiered-ImageNet)上实现最先进性能。
提出的方法
- 提出三重注意力机制:节点自注意力用于建模超越卷积神经网络(CNN)特征的节点间与类间相关性。
- 应用邻域注意力,通过基于特征相似性的 top-βV 选择机制,仅保留最相关的邻近节点,从而学习稀疏邻接矩阵。
- 采用层记忆注意力机制,结合密集跳跃连接,以保留并聚合早期层的特征,缓解信息损失。
- 采用可微分优化公式学习注意力权重:$\hat{\mathbf{A}}^{(k)} = \arg\min_{\mathbf{A}^{(k)}} \|\mathbf{A}^{(k)} - \mathbf{U}^{(k)}\|_F$,受约束于 $\|\mathbf{A}^{(k)}_i\|_0 \leq \beta V$,其中 $\mathbf{U}^{(k)}$ 通过在特征差异上应用多层感知机(MLP)计算得出。
- 理论分析表明,邻域注意力通过增加 $\epsilon$-平滑发生前的层数或减少特征空间中的维度缩减,从而降低过平滑风险。
- 模型在元学习的 episodic 训练范式下进行训练,采用 ConvNet-4 和 ResNet 作为主干网络,在归纳与归纳设定下均表现优异。
实验结果
研究问题
- RQ1三重注意力机制是否能有效缓解深度 GNN 在少样本学习中的过平滑与过拟合问题?
- RQ2在稀疏性约束下,邻域注意力如何提升 GNN 在低样本场景下的泛化能力?
- RQ3层记忆注意力在深层架构中在多大程度上能保持判别性特征?
- RQ4所提出的 Attentive GNN 是否在标准少样本基准上优于现有的 GNN 与 CNN 方法?
- RQ5所提出注意力模块在鲁棒性与可扩展性方面提升的理论依据是什么?
主要发现
- Attentive GNN 在 mini-ImageNet 与 tiered-ImageNet 基准测试中取得了最先进性能,优于现有的 GNN 与 CNN 方法。
- 模型在过平滑问题上表现出更强鲁棒性,理论分析证实邻域注意力可延迟 $\epsilon$-平滑的发生,从而增加可训练层数。
- 当使用所提出的注意力模块时,特征空间中的维度缩减显著减少,表现为在相同 $\epsilon$ 阈值下 $\Theta_{T(\tilde{\mathbf{G}},\epsilon),\tilde{\mathbf{G}}} < \Theta_{T(\mathbf{G},\epsilon),\mathbf{G}}$。
- 大量消融实验表明,三重注意力机制的每一项组件均对性能提升有贡献,尤其邻域注意力在稀疏化图连接方面效果显著。
- 该模型在归纳与归纳设定下均表现出良好泛化能力,持续优于基线 GNN 与元学习模型。
- 作者提供了理论依据与可视化结果,表明注意力机制能增强特征可区分性并减少特征坍塌。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。