[论文解读] Graph-Based Classification of Omnidirectional Images
本文提出一种基于图的深度学习方法,用于全景图像分类,显式建模鱼眼和猫眼相机的球面几何结构。通过构建保持图像各区域间保距关系的几何感知图,该方法使卷积滤波器对同一物体的响应在不同位置或镜头畸变下保持一致,在ETH-80数据集上达到80.7%的准确率,相比最先进方法最高提升4.0个百分点。
Omnidirectional cameras are widely used in such areas as robotics and virtual reality as they provide a wide field of view. Their images are often processed with classical methods, which might unfortunately lead to non-optimal solutions as these methods are designed for planar images that have different geometrical properties than omnidirectional ones. In this paper we study image classification task by taking into account the specific geometry of omnidirectional cameras with graph-based representations. In particular, we extend deep learning architectures to data on graphs; we propose a principled way of graph construction such that convolutional filters respond similarly for the same pattern on different positions of the image regardless of lens distortions. Our experiments show that the proposed method outperforms current techniques for the omnidirectional image classification problem.
研究动机与目标
- 为解决全景图像中几何畸变的问题,该问题会降低为平面图像设计的标准卷积神经网络的性能。
- 开发一种基于图的深度学习架构,其天然地考虑了全景相机投影的球面几何结构。
- 构建一种图结构,确保在严重镜头畸变下,同一物体在图像不同位置仍能获得一致的滤波器响应。
- 通过在图信号处理框架中引入相机特定的几何约束,提升全景图像数据集上的分类准确率。
提出的方法
- 该方法使用球面投影模型构建全景图像的图表示,其中节点对应图像像素,边根据球面上的测地线距离定义。
- 其利用一种几何感知的图构建方法,保持保距关系,确保同一图案在等距投影图像上的不同位置均引发相似响应。
- 该方法通过将TIGraNet——一种基于图的深度学习模型——中的规则网格图替换为球面几何感知图,以增强对畸变的不变性。
- 卷积滤波器通过切比雪夫多项式近似在图上应用,实现在不规则域上的局部化、空间自适应特征学习。
- 网络架构包含两层卷积层,分别具有10和20个滤波器,随后是三层全连接层,神经元数分别为300、200和100,滤波器大小为5×5,多项式阶数为5或10。
- 该方法使用ETH-80数据集进行评估,超参数经过调整以确保与竞争方法的参数量相当,实现公平比较。
实验结果
研究问题
- RQ1基于图的深度学习框架是否能在全景图像的几何畸变上实现比标准ConvNets更好的不变性?
- RQ2将球面几何结构融入图结构后,对特征一致性与分类准确率有何影响?
- RQ3在全景图像分类的图卷积网络中,几何感知图是否优于标准的网格图?
- RQ4所提出的方法在多大程度上降低了对等距投影上物体位置与朝向的敏感性?
主要发现
- 所提方法在ETH-80数据集上达到80.7%的分类准确率,优于次优方法(ChebNet-geometry)2.1个百分点。
- 几何感知图构建方法降低了不同物体位置之间的特征方差,即使在畸变程度不同的情况下,同一物体的滤波器响应也更加一致。
- 与在规则网格上的TIGraNet相比,所提方法将准确率从74.2%提升至80.7%,证明了图结构中几何建模的优势。
- 与标准ConvNets(76.7%)和空间变换网络(73.1%)相比,该方法在相同基准上分别提升4.0和7.6个百分点。
- 性能提升归因于保距不变性与几何感知图拓扑的结合,该组合增强了全局特征表示,同时保持了局部模式的一致性。
- 实验表明,所提图架构在泛化能力上优于基于网格的对应方法,尤其在处理由畸变引起的外观变化方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。