[论文解读] A Simple Fix for Convolutional Neural Network via Coordinate Embedding
本文提出坐标嵌入(CoordEmb),一种简单且参数高效的将空间坐标信息注入卷积神经网络的方法,通过学习归一化的x和y坐标嵌入并将其添加到输入图像上。该方法提升了模型对仿射变换的鲁棒性,并在GTSDB基准上将mAP提升了2.47%,且无需修改网络架构或从头开始重新训练。
Convolutional Neural Networks (CNN) has been widely applied in the realm of computer vision. However, given the fact that CNN models are translation invariant, they are not aware of the coordinate information of each pixel. Thus the generalization ability of CNN will be limited since the coordinate information is crucial for a model to learn affine transformations which directly operate on the coordinate of each pixel. In this project, we proposed a simple approach to incorporate the coordinate information to the CNN model through coordinate embedding. Our approach does not change the downstream model architecture and can be easily applied to the pre-trained models for the task like object detection. Our experiments on the German Traffic Sign Detection Benchmark show that our approach not only significantly improve the model performance but also have better robustness with respect to the affine transformation.
研究动机与目标
- 解决CNN因平移不变性而难以处理仿射变换的局限性。
- 提升真实场景中小型或边缘定位目标的泛化能力和检测性能。
- 开发一种在不改变预训练模型架构的前提下注入坐标信息的方法。
- 增强对基于坐标的失真(如透视变化和目标重定位)的鲁棒性。
- 实现无需架构更改即可在现有目标检测流程中轻松部署坐标感知特征。
提出的方法
- 引入两个可学习的、归一化的坐标嵌入矩阵X和Y,大小为H×W×1,用于空间坐标。
- 在第一个卷积层之前,将坐标嵌入添加到输入图像张量I ∈ ℝ^{H×W×C}的每个通道上。
- 使用标准卷积层,无需修改,以保持原始模型架构不变。
- 使用标准优化方法(如RMSprop)端到端联合训练坐标嵌入与网络其余部分。
- 通过在GTSDB数据集上微调,将该方法应用于SSD等预训练模型(如Inception V2主干网络)。
- 通过归一化和可学习参数,确保嵌入具有空间感知能力且具备尺度不变性。
实验结果
研究问题
- RQ1在存在仿射失真的目标检测任务中,向CNN注入坐标信息是否能提升性能?
- RQ2像坐标嵌入这样简单且非侵入性的方法,是否能在检测小型或边缘定位目标方面优于标准CNN?
- RQ3在不改变模型架构的前提下,坐标嵌入能在多大程度上增强对空间变换的鲁棒性?
- RQ4该方法能否在不从头开始训练的情况下有效应用于预训练模型?
- RQ5在真实世界检测场景中,坐标嵌入的性能与更复杂的替代方法(如CoordConv)相比如何?
主要发现
- CoordEmb增强的SSD Inception V2模型在GTSDB测试集上mAP绝对提升了2.47%(从0.2041提升至0.2288)。
- 该模型在检测小型和中型交通标志方面表现显著提升,尤其在图像边缘附近的标志。
- 与原始CNN相比,CoordEmb使边缘标志(如远处的限速标志)的置信度得分最高提升了5%。
- 在仿射失真图像上,该模型仍保持高可靠性(93%和55%的置信度),而原始模型已失效。
- CoordEmb在不增加推理延迟或模型复杂度的前提下,提升了对透视失真的鲁棒性。
- 该方法在基于坐标的任务(如回归和分类)中表现出更好的泛化能力,如Liu等人基准任务所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。