Skip to main content
QUICK REVIEW

[论文解读] SpherePHD: Applying CNNs on a Spherical PolyHeDron Representation of 360 degree Images

Yeonkun Lee, Jaeseok Jeong|arXiv (Cornell University)|Nov 20, 2018
Advanced Vision and Imaging参考文献 22被引用 10
一句话总结

本文提出SpherePHD,一种基于二十面体几何细分网格的新型球面多面体表示方法,用于360°图像,以最小化空间失真并保持连续性。通过在该几何结构上重新定义卷积与池化操作,该方法减少了ERP和立方体贴图投影固有的非均匀空间分辨率和边缘不连续性,在合成数据集和真实世界数据集上的分类、检测和语义分割任务中均取得更优性能,尤其在相机俯仰和数据增强条件下表现突出。

ABSTRACT

Omni-directional cameras have many advantages overconventional cameras in that they have a much wider field-of-view (FOV). Accordingly, several approaches have beenproposed recently to apply convolutional neural networks(CNNs) to omni-directional images for various visual tasks.However, most of them use image representations defined inthe Euclidean space after transforming the omni-directionalviews originally formed in the non-Euclidean space. Thistransformation leads to shape distortion due to nonuniformspatial resolving power and the loss of continuity. Theseeffects make existing convolution kernels experience diffi-culties in extracting meaningful information.This paper presents a novel method to resolve such prob-lems of applying CNNs to omni-directional images. Theproposed method utilizes a spherical polyhedron to rep-resent omni-directional views. This method minimizes thevariance of the spatial resolving power on the sphere sur-face, and includes new convolution and pooling methodsfor the proposed representation. The proposed method canalso be adopted by any existing CNN-based methods. Thefeasibility of the proposed method is demonstrated throughclassification, detection, and semantic segmentation taskswith synthetic and real datasets.

研究动机与目标

  • 解决将非欧几里得空间转换为欧几里得空间时,应用于360°图像的卷积神经网络所面临的空间失真与不连续性问题。
  • 减少等距长方投影(ERP)和立方体贴图表示所导致的空间分辨率不均匀性。
  • 在卷积神经网络处理过程中保持全景图像的循环性和连续性。
  • 开发适用于新表示形式的几何感知卷积与池化操作,且与现有卷积神经网络架构兼容。
  • 在合成与真实数据集上,证明该方法在分类、目标检测和语义分割任务中的性能提升。

提出的方法

  • 本文提出SpherePHD,一种源自二十面体几何细分网格的球面多面体表示方法,以最小化空间失真和空间分辨率的不均匀性。
  • 提出一种新颖的投影方法,将360°图像映射到二十面体的各个面上,相比ERP和立方体贴图,能更好地保持几何连续性并减少形状失真。
  • 通过利用网格上的局部邻域,定义了一种新的球面多面体上的卷积操作,确保球面上各处感受野形状的一致性。
  • 设计了一种自定义的池化层,用于下采样特征同时保持空间结构,采用最大池化并跟踪索引,以便在自编码器架构中实现反池化。
  • 该框架与现有卷积神经网络兼容,可无缝集成到标准网络中,无需对网络架构进行大规模修改。
  • 实现支持通过随机相机俯仰进行数据增强,提升对真实世界变化的鲁棒性。

实验结果

研究问题

  • RQ1与ERP和立方体贴图投影相比,球面多面体表示是否能减少空间失真并提升360°图像处理中的空间分辨率均匀性?
  • RQ2所提出的几何感知卷积与池化操作在保持球面上特征一致性方面,相较于标准卷积神经网络在失真投影上的表现如何?
  • RQ3在相机俯仰和数据增强条件下,SpherePHD表示是否能提升检测与分割精度,而这些条件下ERP和立方体贴图会失效?
  • RQ4SpherePHD中对循环连续性的保持在多大程度上减少了检测任务中的目标分裂伪影?
  • RQ5SpherePHD框架是否能有效集成到现有基于卷积神经网络的模型中,而无需进行重大架构修改?

主要发现

  • 在SYNTHIA数据集上,SpherePHD在旋转增强数据下的车辆检测任务中达到64.52%的平均精度,显著优于ERP(39.87%)和立方体贴图(26.03%)表示方法。
  • 在SYNTHIA数据集的语义分割任务中,SpherePHD达到70.08%的平均类别准确率和97.20%的整体像素准确率,优于ERP(62.69%和95.07%)和立方体贴图(36.07%和66.04%)方法。
  • 在更具挑战性的Stanford2D3D真实世界数据集上,SpherePHD达到26.40%的平均类别准确率和51.40%的整体像素准确率,显著优于ERP(17.97%和35.02%)和立方体贴图(17.42%和32.38%)表示方法。
  • ERP表示方法在数据增强下性能下降,而SpherePHD保持高准确率,表明其对相机俯仰和空间变化具有更强鲁棒性。
  • 图12和图13的可视化结果证实,SpherePHD减少了目标分裂伪影,提升了分割一致性,尤其在图像边界和倾斜图像上表现更优。
  • 该方法在所有任务——分类、检测和分割——上均表现出一致的优越性,尤其在相机俯仰和高类别多样性等挑战性条件下表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。