Skip to main content
QUICK REVIEW

[论文解读] Adaptive Fractional Dilated Convolution Network for Image Aesthetics Assessment

Qiuyu Chen, Wei Zhang|arXiv (Cornell University)|Apr 6, 2020
Visual Attention and Saliency Detection参考文献 32被引用 12
一句话总结

该论文提出了一种自适应分数阶空洞卷积(AFDC)网络,通过在卷积核层面显式建模图像宽高比,以提升图像美学评估性能。通过根据宽高比在最近邻整数空洞卷积核之间自适应插值,AFDC 保留了图像构图,同时在不引入额外参数的情况下实现了小批量训练,在 AVA 数据集上取得了 83.24% 的分类准确率和 0.271 的 MSE,达到当前最先进水平。

ABSTRACT

To leverage deep learning for image aesthetics assessment, one critical but unsolved issue is how to seamlessly incorporate the information of image aspect ratios to learn more robust models. In this paper, an adaptive fractional dilated convolution (AFDC), which is aspect-ratio-embedded, composition-preserving and parameter-free, is developed to tackle this issue natively in convolutional kernel level. Specifically, the fractional dilated kernel is adaptively constructed according to the image aspect ratios, where the interpolation of nearest two integers dilated kernels is used to cope with the misalignment of fractional sampling. Moreover, we provide a concise formulation for mini-batch training and utilize a grouping strategy to reduce computational overhead. As a result, it can be easily implemented by common deep learning libraries and plugged into popular CNN architectures in a computation-efficient manner. Our experimental results demonstrate that our proposed method achieves state-of-the-art performance on image aesthetics assessment over the AVA dataset.

研究动机与目标

  • 解决在基于深度学习的图像美学评估中,数据增强过程导致图像宽高比和构图失真的挑战。
  • 克服标准数据增强方法(如裁剪、变形)导致宽高比失真和标签噪声的问题。
  • 开发一种与小批量训练兼容的方法,同时保持与图像构图相关的美学感知能力。
  • 实现即插即用的集成,无需额外参数或架构修改,可无缝嵌入现有 CNN 架构。
  • 通过将宽高比信息直接嵌入卷积核设计,提升模型在图像美学评估任务中的鲁棒性与性能。

提出的方法

  • 提出一种自适应分数阶空洞卷积(AFDC),根据输入图像的宽高比动态构建空洞卷积核。
  • 通过在两个最近邻整数空洞卷积核之间进行线性插值,计算分数阶空洞率,避免采样错位。
  • 通过应用保持构图的变形操作,将方法适配小批量训练,以在批量处理过程中保持宽高比。
  • 引入分组策略以降低推理和训练过程中的计算成本,提升效率。
  • 通过在不同分数阶空洞率级别间共享卷积核权重,确保方法无参数化,从而可轻松集成到现有网络中。
  • 使用标准深度学习框架(如 PyTorch、TensorFlow)通过标准操作(如插值和深度可分离卷积)实现 AFDC 层。

实验结果

研究问题

  • RQ1能否有效将宽高比信息嵌入卷积核中,以提升图像美学评估性能?
  • RQ2自适应分数阶空洞卷积是否能保持图像构图,并减少数据增强带来的标签噪声?
  • RQ3能否使无参数、自适应的卷积层与标准深度学习流水线中的小批量训练兼容?
  • RQ4在图像美学评估基准上,AFDC 与现有方法相比在性能和效率方面表现如何?
  • RQ5AFDC 是否能无需架构修改或额外参数,无缝集成到主流 CNN 架构中?

主要发现

  • 所提出的 AFDC 方法在 AVA 数据集上实现了 83.24% 的分类准确率和 0.271 的 MSE,优于先前的最先进方法。
  • 在使用四个变形图像块(尺寸 224–320)时,AFDC 将 MSE 降低至 0.271,相比 NIMA(MSE: 0.275)展现出更优的回归性能。
  • 仅使用一个变形图像块时,AFDC 仍达到 82.98% 的分类准确率,表明其在无需多图块聚合的情况下也具备强大性能。
  • AFDC 在分类准确率上优于 MNA-CNN-Scene(76.5%)和 AMP(80.3%),证实其在学习美学特征方面的有效性。
  • 该方法在避免多图块采样与聚合复杂性的同时,仍保持了 83.24% 的高准确率,优于 MP-Net 和 A-Lamp 等方法。
  • AFDC 支持包含多种宽高比的图像进行小批量训练,解决了以往方法因需单图处理而存在的关键局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。