[论文解读] E-LPIPS: Robust Perceptual Image Similarity via Random Transformation Ensembles
E-LPIPS 通过对实际近乎无限的随机输入变换和架构调整的集合进行平均,扩展了 LPIPS,产生一个对抗干扰鲁棒且仍能保留人类判断的感知相似性度量。它还揭示了图像空间中的感知凸性,并在重建任务中提升损失表现。
It has been recently shown that the hidden variables of convolutional neural networks make for an efficient perceptual similarity metric that accurately predicts human judgment on relative image similarity assessment. First, we show that such learned perceptual similarity metrics (LPIPS) are susceptible to adversarial attacks that dramatically contradict human visual similarity judgment. While this is not surprising in light of neural networks' well-known weakness to adversarial perturbations, we proceed to show that self-ensembling with an infinite family of random transformations of the input --- a technique known not to render classification networks robust --- is enough to turn the metric robust against attack, while retaining predictive power on human judgments. Finally, we study the geometry imposed by our our novel self-ensembled metric (E-LPIPS) on the space of natural images. We find evidence of "perceptual convexity" by showing that convex combinations of similar-looking images retain appearance, and that discrete geodesics yield meaningful frame interpolation and texture morphing, all without explicit correspondences.
研究动机与目标
- 展示 LPIPS 风格的感知相似性度量对抗扰动的脆弱性,这些扰动与人类判断相矛盾。
- 通过对随机输入变换和网络结构修改进行集成来提出 E-LPIPS,以在不损失人类预测判断准确性的情况下提升鲁棒性。
- 分析 E-LPIPS 在自然图像空间上诱导的几何性质,包括感知凸性与有意义的测地线。
提出的方法
- 在计算 LPIPS 距离之前,对输入图像应用一组随机化的、实际近乎无限的几何与颜色变换集合。
- 在所有卷积层上计算距离,而不仅仅是最后一层,同时对输入颜色项使用学习得到的权重。
- 在所有层引入 dropout,并将最大池化替换为平均池化,以改进梯度流和鲁棒性。
- 将 E-LPIPS 定义为对变换集合的 LPIPS 的期望:d_E-LPIPS(x,y)=E[d_LPIPS(T(x),T(y))]。
- 给出实用指南:每次迭代只需一个随机样本,但为提高精度,建议 N>=300 个样本。
- 使用 EoT 风格的优化对白盒对抗攻击进行鲁棒性评估,并与 LPIPS 变体进行比较。
实验结果
研究问题
- RQ1LPIPS 风格的感知相似性度量是否会受到与人类判断不一致的对抗攻击的影响?
- RQ2随机变换自集成(E-LPIPS)是否在提升对攻击的鲁棒性的同时,保持与人类感知判断的相关性?
- RQ3在 E-LPIPS 度量下,会出现哪些几何性质(例如感知凸性、意义明确的测地线)?
- RQ4在不牺牲优化稳定性的前提下,E-LPIPS 能否作为图像重建及相关任务的有效损失函数?
主要发现
- 与 lpips-vgg 和 lpips-sqz 相比,E-LPIPS 对对抗攻击的鲁棒性显著更高,在攻击下降低了 L2 距离增长(在 LPIPS 变体中为 16.0–16.2,而在 E-LPIPS 为 3.7–14.5)。
- 限制在较小 L2 扰动下的攻击会使 LPIPS 距离显著增加得多,未能显著提升 E-LPIPS,显示出更强的鲁棒性。
- 消融实验表明每个变换分量都对鲁棒性有贡献,完整的集合获得最强的防御效果。
- E-LPIPS 在与人类判断预测的准确性方面与 LPIPS 相近(2AFC 任务:69.16% vs. 未集成变体的 68.65–70.07%)。
- E-LPIPS 展示感知凸性:重心保持外观的能力优于 L2 或 LPIPS,离散测地线在没有显式对应关系时也能实现有意义的帧插值和纹理变形。
- 在实验中,使用 E-LPIPS 作为损失函数的重建结果始终优于简单的 LPIPS。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。