[论文解读] Learning to Route in Similarity Graphs
该论文通过训练顶点表征以引导贪心遍历趋向真实最近邻,提出在相似性图中实现可学习的路由机制,从而减少局部极小值问题。通过使用模仿学习优化路由策略,该方法在相同计算预算下相比基线图实现了显著更高的召回率(最高提升9.4%)。
Recently similarity graphs became the leading paradigm for efficient nearest neighbor search, outperforming traditional tree-based and LSH-based methods. Similarity graphs perform the search via greedy routing: a query traverses the graph and in each vertex moves to the adjacent vertex that is the closest to this query. In practice, similarity graphs are often susceptible to local minima, when queries do not reach its nearest neighbors, getting stuck in suboptimal vertices. In this paper we propose to learn the routing function that overcomes local minima via incorporating information about the graph global structure. In particular, we augment the vertices of a given graph with additional representations that are learned to provide the optimal routing from the start vertex to the query nearest neighbor. By thorough experiments, we demonstrate that the proposed learnable routing successfully diminishes the local minima problem and significantly improves the overall search performance.
研究动机与目标
- 为解决在相似性图上贪心路由中的局部极小值问题,即查询在次优顶点处停滞的问题。
- 通过将全局图结构融入路由决策,提升高维数据中的搜索精度。
- 学习紧凑的顶点表征,以从任意起始顶点引导至最近邻的最优路由路径。
- 减少对仅依赖局部距离的路由启发式方法的依赖,这些方法在复杂图拓扑中会失效。
- 证明所提出的可学习路由在固定计算预算下优于标准贪心路由及现有最近邻搜索(NNS)方法。
提出的方法
- 为相似性图中的每个顶点增加一个经过学习的、低维的表征,以编码全局路由上下文。
- 使用模仿学习训练路由函数,其中智能体学习模仿由监督数据集提供的查询到最近邻的最优路由轨迹。
- 使用带有卷积层和前馈层的深度神经网络 $f_{\theta}(\cdot)$,将顶点特征映射为路由得分。
- 使用多组件损失函数进行模型优化,结合top-$k$选择与完整路径路由监督,以提升鲁棒性与泛化能力。
- 在推理阶段应用学习到的路由策略:在每一步选择路由得分最高的邻居,而非仅选择距离最近的邻居。
- 在训练期间使用教师强制目标,通过提供最优路由轨迹而非自生成轨迹来稳定学习过程。
实验结果
研究问题
- RQ1可学习的顶点表征是否能通过减少局部极小值来改善相似性图中的贪心路由?
- RQ2将全局图结构融入路由决策是否能提升搜索精度?
- RQ3可学习路由的性能与标准贪心路由及其他最先进NNS方法相比如何?
- RQ4不同神经网络架构与训练目标对路由性能有何影响?
- RQ5可学习路由的优势是否会随着数据维度的提高而增强?
主要发现
- 在DPS=512预算下,所提出的可学习路由在GloVe100K数据集上的Recall@1比标准NSW图高出9.4%。
- 在SIFT100K数据集上,该方法优于所有基线方法,包括NSG和HNSW,Recall@1达到0.949。
- 消融实验表明,采用带有前馈头的卷积架构可实现60.4%的Recall@1,显著优于PCA(39.4%)和仅使用前馈网络的模型(54.9%)。
- 使用完整模仿学习目标(公式4)的训练结果优于教师强制方法(37.7% Recall@1),表明自洽策略学习更有效。
- 即使仅在top-$k$选择上进行训练,该方法仍能实现具有竞争力的性能,表明路由策略可在部分监督下学习。
- 性能提升在高维空间中最为显著,证实该方法在高维复杂场景中尤为有益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。