[论文解读] ClusterGNN: Cluster-based Coarse-to-Fine Graph Neural Network for Efficient Feature Matching
ClusterGNN 提出了一种基于聚类的、自粗到细的图神经网络,通过动态地将关键点划分为局部子图,减少了视觉特征匹配中的计算和内存开销,实现了稀疏注意力计算。与 SuperGlue 相比,在密集检测任务中,其运行时间减少了 59.7%,内存使用量减少了 58.4%,同时在各项任务中保持了具有竞争力的准确性。
Graph Neural Networks (GNNs) with attention have been successfully applied for learning visual feature matching. However, current methods learn with complete graphs, resulting in a quadratic complexity in the number of features. Motivated by a prior observation that self- and cross- attention matrices converge to a sparse representation, we propose ClusterGNN, an attentional GNN architecture which operates on clusters for learning the feature matching task. Using a progressive clustering module we adaptively divide keypoints into different subgraphs to reduce redundant connectivity, and employ a coarse-to-fine paradigm for mitigating miss-classification within images. Our approach yields a 59.7% reduction in runtime and 58.4% reduction in memory consumption for dense detection, compared to current state-of-the-art GNN-based matching, while achieving a competitive performance on various computer vision tasks.
研究动机与目标
- 解决基于注意力机制的图神经网络在视觉特征匹配中面临的二次方计算和内存复杂度问题。
- 利用关键点注意力矩阵的固有稀疏性,减少完整图中冗余的消息传递。
- 开发一种可学习的、渐进式的聚类策略,构建局部子图,在不损失准确率的前提下提升效率。
- 在密集检测基准上实现高效率和具有竞争力的性能,同时保持在多样化计算机视觉任务中的鲁棒性。
- 引入一种自粗到细的聚类机制,通过在图像中逐步细化聚类,避免错误分组。
提出的方法
- 应用完整图初始化模块,首先使用基于注意力的 GNN 层构建并更新完整的图像内和图像间图。
- 使用渐进式聚类模块,基于学习到的相似性,将关键点分层划分为更小、更局部的子图,降低全局连接性。
- 构建局部图,使得每个关键点仅关注其聚类内的其他关键点,从而实现稀疏注意力计算并减少冗余。
- 采用自粗到细的策略:首先将关键点划分为少量聚类,然后递归地将其细分为更小的聚类,以避免误分类。
- 使用点积和双归一化 Softmax 的匹配模块计算匹配概率,并引入可学习的“尘桶”以处理非匹配关键点。
- 用非迭代的双归一化 Softmax 替代迭代的 Sinkhorn 算法,以实现更快的推理速度,同时保持匹配质量。
实验结果
研究问题
- RQ1关键点的动态聚类能否降低基于注意力机制的 GNN 在特征匹配中的计算和内存开销?
- RQ2自粗到细的聚类策略是否通过最小化图像内部的误分组来提升匹配准确率?
- RQ3基于聚类子图的稀疏注意力在多大程度上能近似全图注意力的性能?
- RQ4在密集检测任务中,该方法与最先进基于 GNN 的特征匹配方法(如 SuperGlue)相比,在效率和准确率方面表现如何?
- RQ5在性能和效率方面,固定聚类数量与动态变化的聚类数量之间存在怎样的权衡?
主要发现
- 在使用 Tesla P-100 GPU 的密集检测任务(10,000 个关键点)中,ClusterGNN 相较于 SuperGlue 将运行时间减少了 59.7%,内存消耗减少了 58.4%。
- 该方法在相对位姿估计、单应性矩阵估计和视觉定位任务中均达到了最先进准确率,包括在 InLoc 数据集上(0.25m, 2°)阈值下达到 89.4% / 95.5% / 98.5% 的准确率。
- 采用可变数量的聚类(渐进式细化)相比固定聚类数量性能显著更优,5° 阈值下准确率达到 42.62%,而使用 16 个固定聚类时仅为 31.26%。
- 双归一化 Softmax 操作器在 61ms 推理时间、94MB 内存下实现了具有竞争力的性能(5° 阈值下准确率为 42.62%),在速度上优于 Sinkhorn(68ms,94MB),同时保持了相同的准确率。
- 在 Aachen Day-Night 基准测试中,ClusterGNN 在(0.25m, 2°)阈值下实现了 88.6% / 95.5% / 98.4% 的定位准确率,部分设置下优于 SuperGlue。
- 消融实验证实,渐进式聚类至关重要——固定聚类数量会显著降低性能,尤其在更高阈值下表现更差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。