Skip to main content
QUICK REVIEW

[论文解读] Camera View Adjustment Prediction for Improving Image Composition

Yu-Chuan Su, Raviteja Vemulapalli|arXiv (Cornell University)|Apr 15, 2021
Visual Attention and Saliency Detection参考文献 40被引用 5
一句话总结

该论文提出了一种基于深度学习的系统,可预测最优的相机视角调整(如平移、俯仰、变焦和旋转),以在拍摄前改善图像构图。通过在从裁剪数据集构建的自建视角调整数据集上采用新颖的半监督方法,该模型在79%的用户研究中提升了构图质量,优于仅使用裁剪的方法。

ABSTRACT

Image composition plays an important role in the quality of a photo. However, not every camera user possesses the knowledge and expertise required for capturing well-composed photos. While post-capture cropping can improve the composition sometimes, it does not work in many common scenarios in which the photographer needs to adjust the camera view to capture the best shot. To address this issue, we propose a deep learning-based approach that provides suggestions to the photographer on how to adjust the camera view before capturing. By optimizing the composition before a photo is captured, our system helps photographers to capture better photos. As there is no publicly-available dataset for this task, we create a view adjustment dataset by repurposing existing image cropping datasets. Furthermore, we propose a two-stage semi-supervised approach that utilizes both labeled and unlabeled images for training a view adjustment model. Experiment results show that the proposed semi-supervised approach outperforms the corresponding supervised alternatives, and our user study results show that the suggested view adjustment improves image composition 79% of the time.

研究动机与目标

  • 为解决后处理裁剪在提升图像构图方面的局限性,通过提供拍摄前的视角调整建议来实现改进。
  • 创建一个新的视角调整预测基准数据集,因为此前该任务尚无公开数据集。
  • 开发一种两阶段半监督训练方法,利用有标签和无标签图像提升模型泛化能力。
  • 评估视角调整建议是否相比基线裁剪方法能显著提升图像构图质量。
  • 展示模型在360°图像上的泛化能力,支持复杂构图的迭代调整。

提出的方法

  • 通过将现有图像裁剪标注转换为2D边界框上的视角调整操作(平移、俯仰、变焦、旋转),构建了视角调整数据集。
  • 提出一种两阶段半监督训练框架:首先在有标签数据上训练构图评分模型;其次通过自监督对比学习在无标签数据上微调模型。
  • 将视角调整表示为相对变换:水平/垂直位移(占图像尺寸的百分比)、变焦(缩放因子)和旋转(以弧度为单位)。
  • 使用视觉Transformer主干网络提取输入图像的特征,并预测最优调整向量。
  • 在360°图像评估中应用迭代视角调整,允许多步调整以从初始视口获得更优构图。
  • 通过预测与真实视角调整之间的IoU评估模型性能,并通过用户研究评估构图质量的主观感受。

实验结果

研究问题

  • RQ1深度学习模型能否有效预测拍摄前的相机视角调整,以提升图像构图质量,超越仅靠裁剪所能实现的效果?
  • RQ2在有标签数据有限的情况下,半监督训练方法在提升视角调整预测性能方面的有效性如何?
  • RQ3所提出的模型是否能泛化到360°图像,其中不存在透视失真且视场角不受限?
  • RQ4用户标注的偏好在构图质量方面与模型建议的调整在多大程度上一致?
  • RQ5在复杂场景中,迭代视角调整是否比单步预测更可靠地改善构图?

主要发现

  • 所提出的半监督方法与真实视角调整的IoU达到0.75,显著优于最先进GAIC裁剪模型(0.61 IoU)。
  • 在用户研究中,模型建议的调整在79.0%的案例中改善了图像构图,仅有12.6%的建议导致构图下降。
  • 模型在360°图像上表现出良好的泛化能力,在Pano2Vid数据集上实现了78.9%的构图改善成功率,尽管未在该类数据上进行训练。
  • 模型可在360°环境中执行迭代调整,表明多步优化可提升构图质量,即使单步调整不足以达到理想效果。
  • 失败案例主要源于微小调整或初始视图中关键内容缺失,且幅度预测错误有时会降低构图质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。