Skip to main content
QUICK REVIEW

[论文解读] OPA: Object Placement Assessment Dataset

Liu Liu, Liu, Zhenchen|arXiv (Cornell University)|Jul 5, 2021
Advanced Neural Network Applications参考文献 23被引用 12
一句话总结

本文提出了物体放置评估(OPA)数据集,这是首个用于评估合成图像中物体放置合理性的基准。它提出了一种简单而有效的基线模型SimOPA,该模型使用ResNet-18分类器结合前景掩码,在新数据集上实现了0.780的F1分数和0.842的平衡准确率,优于基于GAN的判别器和标准ResNet-18模型。

ABSTRACT

Image composition aims to generate realistic composite image by inserting an object from one image into another background image, where the placement (e.g., location, size, occlusion) of inserted object may be unreasonable, which would significantly degrade the quality of the composite image. Although some works attempted to learn object placement to create realistic composite images, they did not focus on assessing the plausibility of object placement. In this paper, we focus on object placement assessment task, which verifies whether a composite image is plausible in terms of the object placement. To accomplish this task, we construct the first Object Placement Assessment (OPA) dataset consisting of composite images and their rationality labels. We also propose a simple yet effective baseline for this task. Dataset is available at https://github.com/bcmi/Object-Placement-Assessment-Dataset-OPA.

研究动机与目标

  • 为解决图像合成中物体放置合理性评估缺乏标准化基准的问题。
  • 构建一个大规模、高质量的数据集,包含人类标注的合理性标签,用于合成图像。
  • 提出一种简单而有效的物体放置评估基线模型,其性能优于现有的基于GAN的判别器。
  • 实现对合成图像质量的客观、自动化评估,无需依赖用户研究或下游任务表现。

提出的方法

  • 通过将COCO数据集中未遮挡的前景物体随机缩放并放置在兼容的背景图像上,构建OPA数据集。
  • 由四位人类标注员对合成图像进行标注;仅保留标签一致的图像以确保标注质量。
  • 该数据集包含62,074张训练图像和11,396张测试图像,包含4,137种独特的前景物体和1,389种独特的背景,训练集与测试集之间无重叠。
  • 提出一种基线模型SimOPA,通过将前景掩码与合成图像输入拼接后输入ResNet-18分类器,以增强对物体位置的感知能力。
  • 由于数据集中类别不平衡,采用F1分数和平衡准确率作为性能评估指标。
  • 对比实验包括标准ResNet-18、PlaceNet以及TERSE(使用和不使用ResNet-18替换判别器两种设置)。

实验结果

研究问题

  • RQ1哪些关键视觉线索决定了合成图像中物体放置的合理性或不合理性?
  • RQ2如何构建一个可靠、自动化的基准,用于评估物体放置合理性,而无需依赖用户研究或下游任务?
  • RQ3一个仅使用前景掩码输入的简单分类器,能否优于为图像生成训练的复杂GAN判别器?
  • RQ4正样本与负样本的分布如何随物体类别和放置配置而变化?

主要发现

  • SimOPA基线模型在F1分数上达到0.780,平衡准确率达到0.842,显著优于标准ResNet-18(F1分数0.680)和其他基于GAN的判别器。
  • PlaceNet和TERSE判别器在OPA任务上表现较差,F1分数分别为0.488和0.476,表明它们不适合直接用于放置合理性评估。
  • 将TERSE的判别器替换为ResNet-18后性能略有提升(F1分数0.355),但仍显著低于SimOPA,凸显了引入前景掩码的重要性。
  • 训练集中包含21,376个正样本和40,698个负样本,测试集中包含3,588个正样本和7,808个负样本,且正负样本在前景或背景上无重叠。
  • 由于不同物体在可行尺度和放置方式上的差异,各类物体的正样本比例存在显著差异,反映出该任务的复杂性。
  • 大多数合成图像的尺寸比例落在[0.0, 0.6]区间内,且中心区域(1,1)包含最多图像,这是由于必须完整显示前景物体的约束。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。