Skip to main content
QUICK REVIEW

[论文解读] Deep Image Orientation Angle Detection

Subhadip Maji, Smarajit Bose|arXiv (Cornell University)|Jun 21, 2020
Advanced Neural Network Applications参考文献 18被引用 5
一句话总结

本文提出一种基于自定义损失函数和Xception架构迁移学习的深度学习方法,用于从0°到359°精确估计图像方向角。通过处理角度预测的循环特性,该方法在性能上达到当前最先进水平,尤其在完全旋转图像上表现优异,在COCO数据集上的平均绝对误差(MAE)达到8.38°。

ABSTRACT

Estimating and rectifying the orientation angle of any image is a pretty challenging task. Initial work used the hand engineering features for this purpose, where after the invention of deep learning using convolution-based neural network showed significant improvement in this problem. However, this paper shows that the combination of CNN and a custom loss function specially designed for angles lead to a state-of-the-art results. This includes the estimation of the orientation angle of any image or document at any degree (0 to 360 degree),

研究动机与目标

  • 解决在自然图像中准确估计任意图像方向角(0°至359°)的挑战。
  • 克服传统L1损失在角度回归中,特别是在0°/360°边界附近的局限性。
  • 提升在完全旋转图像上的性能,其中标准损失函数因不连续性而失效。
  • 证明自定义损失函数对方向估计的贡献大于网络架构本身。
  • 提供一种可推广的解决方案,适用于计算机视觉中任意与角度相关的回归任务。

提出的方法

  • 通过在COCO数据集上微调预训练的Xception网络,利用迁移学习进行图像方向估计。
  • 通过将Xception架构的最终分类器替换为包含三层全连接层(512、256、64)后接单节点线性输出层的回归头,对网络进行适配。
  • 引入一种自定义的角度感知损失函数,计算预测角度与真实角度之间的最小圆形差值,避免在0°/360°处的不连续性。
  • 对COCO图像进行人工旋转(0°至359°),以模拟真实世界的方向变化,并构建三个训练任务:±30°、±45°和完整360°旋转。
  • 在三个不同难度的任务上训练模型:OAD-30、OAD-45和OAD-360,难度逐级递增。
  • 使用平均绝对误差(MAE)评估性能,并与先前方法(包括Fischer等人[6]和Wei等人[18])进行比较。

实验结果

研究问题

  • RQ1与标准L1损失相比,一种考虑圆形角度差值的自定义损失函数是否能显著提升方向估计的准确性?
  • RQ2相较于AlexNet,使用更先进的预训练网络如Xception是否能在图像方向回归任务中带来更好的性能?
  • RQ3在完全旋转图像(0°至359°)上,模型表现如何,其中标准回归损失函数因不连续性而失效?
  • RQ4网络架构与损失函数设计在提升方向估计性能方面,各自的相对贡献是什么?
  • RQ5所提出的方法是否能推广至计算机视觉中的其他角度回归任务?

主要发现

  • 在±30°旋转的图像上,所提方法的平均绝对误差(MAE)为1.52°,显著优于Fischer等人[6]及先前方法。
  • 在±45°旋转的图像上,模型的MAE为1.95°,表明即使在旋转范围扩大时仍具有鲁棒性。
  • 对于完全旋转图像(0°至359°),模型的MAE为8.38°,远优于Fischer等人[6]在相同设置下的20.97° MAE。
  • 消融实验表明,自定义损失函数对性能提升的贡献大于网络架构本身,因为使用自定义损失的AlexNet优于使用L1损失的Xception。
  • 即使在非最先进网络上,自定义损失函数也表现出有效性,表明其可推广至其他与角度相关的任务。
  • 可视化结果表明,模型能成功纠正大多数图像的方向,但在模糊或对称场景中性能下降,此类情况甚至人类判断也存在不确定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。