[论文解读] Robust Training in High Dimensions via Block Coordinate Geometric Median Descent
本文提出块坐标几何中位数下降法(BGmD),一种计算高效的鲁棒优化方法,适用于在严重污染下的高维非凸问题。通过仅对选定的坐标块使用几何中位数聚合并结合记忆机制,BGmD 实现了 0.5 的崩溃点和近似最优的收敛速率,使深度学习训练的效率提升高达 90%,相比标准几何中位数 SGD 有显著加速。
Geometric median ( extsc{Gm}) is a classical method in statistics for achieving a robust estimation of the uncorrupted data; under gross corruption, it achieves the optimal breakdown point of 0.5. However, its computational complexity makes it infeasible for robustifying stochastic gradient descent (SGD) for high-dimensional optimization problems. In this paper, we show that by applying extsc{Gm} to only a judiciously chosen block of coordinates at a time and using a memory mechanism, one can retain the breakdown point of 0.5 for smooth non-convex problems, with non-asymptotic convergence rates comparable to the SGD with extsc{Gm}.
研究动机与目标
- 为解决在高维深度学习设置下基于几何中位数的鲁棒 SGD(GmD)存在的计算不可行性问题。
- 在保持对严重污染下 0.5 的最优崩溃点的同时,降低计算成本。
- 设计一种可扩展的一阶优化方法,对任意污染的梯度具有鲁棒性,且无需事先知晓恶意样本。
- 在通过坐标选择实现低维子空间操作的前提下,实现与完整 GmD 相当的收敛速率。
提出的方法
- BGmD 基于方向导数的平方 ℓ₂ 范数重要性,选择 k ≪ d 个坐标块。
- 仅对梯度的选定 k 维子向量应用几何中位数聚合,从而降低 Gm 计算的维度。
- 通过记忆机制存储历史梯度估计,以提升选定坐标上的鲁棒性和收敛性。
- 采用两阶段更新:首先在选定坐标上通过几何中位数进行部分更新;其次将鲁棒估计与其余参数结合,完成完整参数更新。
- 理论分析表明,在相同假设下,包括 Polyak-Łojasiewicz(PL)条件,BGmD 保持与完整 GmD 相同的收敛保证。
- 该算法设计兼容标准深度学习框架,支持小批量训练,并对高达 50% 的梯度污染具有鲁棒性。
实验结果
研究问题
- RQ1能否在不产生禁止性计算成本的前提下,高效地在高维优化中应用几何中位数聚合?
- RQ2选择性坐标方式的几何中位数聚合是否能在严重污染下保持 0.5 的最优崩溃点?
- RQ3基于记忆增强的块坐标方法能否实现与完整几何中位数 SGD 相当的收敛速率?
- RQ4坐标选择策略的选择如何影响非凸深度学习设置下的鲁棒性与收敛性?
主要发现
- BGmD 实现了 0.5 的崩溃点,与严重污染下鲁棒估计的理论最优值一致。
- 该方法在训练深度学习模型时相比标准 GmD 实现了 90% 的加速,且精度损失极小。
- 理论分析确认,在 PL 条件下,BGmD 保持与完整 GmD 相当的非渐近收敛速率。
- 记忆机制通过随时间稳定梯度估计,显著提升了鲁棒性,即使在稀疏或污染更新下亦然。
- 实验结果表明,BGmD 在 50% 梯度污染下仍能保持高测试精度,包括在后门攻击和异常值攻击场景中。
- 算法的收敛性对块大小 k 的选择具有鲁棒性,在 k ≪ d 的广泛范围内性能保持稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。