[论文解读] RotDCF: Decomposition of Convolutional Filters for Rotation-Equivariant Deep Networks
该论文提出 RotDCF,一种旋转等变卷积神经网络,通过在空间和旋转域上联合使用可导向基函数对卷积滤波器进行分解,显著降低了模型大小和计算成本,同时隐式正则化滤波器。该方法在平面内和平面外旋转下的人脸识别任务中实现了最先进水平的鲁棒性和可解释性,已知样本的准确率为 97.04%,在特征对齐后平面外旋转的准确率为 89.66%。
Explicit encoding of group actions in deep features makes it possible for convolutional neural networks (CNNs) to handle global deformations of images, which is critical to success in many vision tasks. This paper proposes to decompose the convolutional filters over joint steerable bases across the space and the group geometry simultaneously, namely a rotation-equivariant CNN with decomposed convolutional filters (RotDCF). This decomposition facilitates computing the joint convolution, which is proved to be necessary for the group equivariance. It significantly reduces the model size and computational complexity while preserving performance, and truncation of the bases expansion serves implicitly to regularize the filters. On datasets involving in-plane and out-of-plane object rotations, RotDCF deep features demonstrate greater robustness and interpretability than regular CNNs. The stability of the equivariant representation to input variations is also proved theoretically under generic assumptions on the filters in the decomposed form. The RotDCF framework can be extended to groups other than rotations, providing a general approach which achieves both group equivariance and representation stability at a reduced model size.
研究动机与目标
- 为解决群等变卷积神经网络在旋转情况下的高计算和参数成本问题。
- 提升深度特征在平面内和平面外物体旋转下的鲁棒性和可解释性。
- 为旋转等变网络中输入形变下的表示稳定性提供理论保证。
- 实现高效、低秩的滤波器分解,隐式正则化滤波器而不损失性能。
- 通过统一的分解方法将该框架推广至 SO(2) 以外的其他紧致李群。
提出的方法
- 该方法将卷积滤波器表示为在空间域和旋转群 SO(2) 上分别使用截断的傅里叶-贝塞尔基函数和傅里叶基函数的展开形式。
- 通过在 ℝ² 和 SO(2) 上联合定义卷积操作,利用可导向基函数实现旋转等变性。
- 滤波器系数从数据中学习,而基函数(ψₖ(u)φₘ(α))保持固定,从而实现参数压缩和隐式正则化。
- 该框架采用改进的网络结构,其中特征图通过群索引通道表示,以编码旋转方向。
- 在推理阶段应用循环移位对齐,以利用旋转等变性提升识别准确率。
- 理论分析证明,在一般滤波器条件下,该等变表示对输入形变具有稳定性。
实验结果
研究问题
- RQ1在旋转等变卷积神经网络中,基于联合空间与旋转基函数的滤波器分解是否能降低模型复杂度而不损失性能?
- RQ2RotDCF 中截断基函数展开是否隐式正则化滤波器并提升对旋转变化的鲁棒性?
- RQ3与标准卷积神经网络相比,RotDCF 在平面内和平面外旋转下在表示稳定性和可解释性方面提升了多少?
- RQ4该等变表示的理论稳定性保证是否能在真实旋转场景中得到实证验证?
- RQ5RotDCF 框架是否可推广至 SO(2) 以外的其他紧致李群?
主要发现
- 在平面内旋转下,RotDCF 在已知样本上达到 97.04% 的识别准确率,在未知样本上达到 97.58%,经特征对齐后;而标准卷积神经网络分别仅达到 0.54% 和 5.05%。
- 在平面外旋转下,RotDCF 在已知样本上达到 89.66% 的准确率,在未知样本上达到 97.01%;而标准卷积神经网络分别为 80.79% 和 89.97%。
- 类激活图(CAM)显示,与标准卷积神经网络相比,RotDCF 在旋转图像中选择的判别区域更加一致,表明其具有更优的表示稳定性。
- 该分解方法在保持性能的同时显著降低了模型大小和计算复杂度,且截断带来的准确率下降可忽略不计。
- 理论分析证实,在一般假设下,分解后的滤波器形式可确保等变表示在输入形变下的稳定性。
- 通过选择适当的基函数(如球谐函数),该框架可推广至其他群(如 SO(3))
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。