[论文解读] Backpropagation through Combinatorial Algorithms: Identity with Projection Works
本文提出了一种无需超参数、高效的反向传播方法,用于组合优化求解器,通过在反向传播中将求解器视为负恒等层,同时利用问题特定的不变性通过代价向量投影来稳定训练。该方法避免了额外的求解器调用,在深度图匹配和图像检索等任务中表现优于先前方法,并通过噪声诱导的正则化而非问题特定的边界提高了鲁棒性。
Embedding discrete solvers as differentiable layers has given modern deep learning architectures combinatorial expressivity and discrete reasoning capabilities. The derivative of these solvers is zero or undefined, therefore a meaningful replacement is crucial for effective gradient-based learning. Prior works rely on smoothing the solver with input perturbations, relaxing the solver to continuous problems, or interpolating the loss landscape with techniques that typically require additional solver calls, introduce extra hyper-parameters, or compromise performance. We propose a principled approach to exploit the geometry of the discrete solution space to treat the solver as a negative identity on the backward pass and further provide a theoretical justification. Our experiments demonstrate that such a straightforward hyper-parameter-free approach is able to compete with previous more complex methods on numerous experiments such as backpropagation through discrete samplers, deep graph matching, and image retrieval. Furthermore, we substitute the previously proposed problem-specific and label-dependent margin with a generic regularization procedure that prevents cost collapse and increases robustness.
研究动机与目标
- 通过解决离散优化中零梯度或未定义梯度的问题,实现端到端训练包含离散组合优化求解器的深度网络。
- 消除在组合优化求解器梯度估计中对昂贵求解器调用或超参数调优的需求。
- 通过利用组合优化问题中的不变性(如归一化和投影对称性)来稳定学习过程。
- 用通用的噪声基正则化替代问题特定的、依赖标签的边界,防止代价坍塌并提升鲁棒性。
- 提供一种理论基础坚实、具备几何感知能力的梯度估计方法,兼具简洁性与有效性。
提出的方法
- 在反向传播过程中将组合优化求解器视为负恒等层,直接传播输入梯度,无需额外的求解器评估。
- 在计算图中对代价向量引入投影操作,以消除对应于问题不变性的梯度分量(例如归一化、缩放)。
- 在反向传播中应用该投影,以消除不影响解的虚假更新,仅保留相关梯度方向。
- 通过输入噪声扰动隐式诱导解空间中的边界,替代先前工作中依赖真实标签的边界设计。
- 通过损失曲面的分段线性插值形式化该方法,并在弱假设下证明收敛性。
- 理论分析表明,该方法可避免代价坍塌,并在适当条件下确保线性化损失的下降。
实验结果
研究问题
- RQ1能否设计一种简单、无需超参数的梯度估计器,用于组合优化求解器,且在反向传播中无需额外的求解器调用?
- RQ2如何利用组合优化问题中的不变性(如尺度或归一化)来稳定梯度更新?
- RQ3用通用的噪声基正则化替代问题特定的边界,对模型鲁棒性和收敛性有何影响?
- RQ4将求解器视为负恒等层是否能在几何约束下产生损失曲面的下降方向?
- RQ5与更复杂的基线方法(如Blackbox Backpropagation)相比,该方法在性能和训练稳定性方面表现如何?
主要发现
- 所提出的带投影的恒等方法在深度图匹配、图像检索和离散推理任务中表现优异,无需超参数即可达到或超越先前方法的性能。
- 通过使用输入噪声诱导通用边界,该方法可防止代价坍塌并提升鲁棒性,从而无需设计依赖标签的边界。
- 理论分析证实,该方法在弱假设下可确保线性化损失函数的下降,且在解发生变化时实现严格改进。
- 实验结果表明,该方法在处理得当的不变性时具有更高的稳定性和更快的收敛速度,尤其优于基线方法。
- 该方法在反向传播中避免了额外的求解器调用,因此在计算效率上优于Blackbox Backpropagation等方法。
- 该方法对扰动具有鲁棒性,并在包括最短路径、排序优化和关键点匹配在内的多种组合问题中表现出良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。