[论文解读] Learning Image Aesthetic Assessment from Object-level Visual Components
本文提出 IAA-OVC,一种新颖的深度学习框架,用于图像美学评估,通过通用目标检测器检测的基于对象的视觉组件(OVCs)来建模美学。通过应用基于对象的注意力机制与图注意力机制,动态加权各个 OVC 及其成对关系,该模型在美学评分分布预测方面提升了性能,并首次提供了对视觉组件如何贡献于美学判断的可解释性分析,与摄影学和心理学理论相一致。
As it is said by Van Gogh, great things are done by a series of small things brought together. Aesthetic experience arises from the aggregation of underlying visual components. However, most existing deep image aesthetic assessment (IAA) methods over-simplify the IAA process by failing to model image aesthetics with clearly-defined visual components as building blocks. As a result, the connection between resulting aesthetic predictions and underlying visual components is mostly invisible and hard to be explicitly controlled, which limits the model in both performance and interpretability. This work aims to model image aesthetics from the level of visual components. Specifically, object-level regions detected by a generic object detector are defined as visual components, namely object-level visual components (OVCs). Then generic features representing OVCs are aggregated for the aesthetic prediction based upon proposed object-level and graph attention mechanisms, which dynamically determines the importance of individual OVCs and relevance between OVC pairs, respectively. Experimental results confirm the superiority of our framework over previous relevant methods in terms of SRCC and PLCC on the aesthetic rating distribution prediction. Besides, quantitative analysis is done towards model interpretation by observing how OVCs contribute to aesthetic predictions, whose results are found to be supported by psychology on aesthetics and photography rules. To the best of our knowledge, this is the first attempt at the interpretation of a deep IAA model.
研究动机与目标
- 解决现有深度图像美学评估(IAA)方法中可解释性不足与组件级建模缺失的问题。
- 不从整体图像特征出发建模图像美学,而是将预定义的基于对象的视觉组件(OVCs)作为基本构建单元。
- 实现基于重要性与相互关系的动态、注意力驱动的 OVC 特征聚合。
- 通过将 OVC 贡献与美学预测关联,首次实现对深度 IAA 模型的定量可解释性分析。
- 验证模型与摄影规则(例如注意力-主体一致性)及心理学理论(例如视觉正确性)的一致性。
提出的方法
- 基于对象的视觉组件(OVCs)被定义为来自通用目标检测器(如 Faster R-CNN)的目标检测结果,作为基本视觉单元。
- 每个 OVC 通过其区域提取的深层通用特征(如 MLSP 特征)表示,构成模型的输入。
- 基于对象的注意力重加权模块为每个 OVC 计算动态重要性得分,模拟主体检测与注意力分配。
- 基于图注意力的聚合模块计算 OVC 之间的成对相关性得分,建模对象组织的显著性。
- 最终的美学表征通过使用学习到的注意力权重聚合 OVC 特征形成,随后通过回归头进行评分分布预测。
- 通过相关性分析将 OVC 注意力得分与美学得分关联,实现在训练集与测试集上的可解释性验证。
实验结果
研究问题
- RQ1通过基于对象的视觉组件(OVCs)建模图像美学,是否能提升深度 IAA 模型的性能与可解释性?
- RQ2学习到的基于对象的注意力得分是否与摄影中的主体检测及注意力-主体一致性相关?
- RQ3基于图注意力的 OVC 成对相关性是否能预测美学质量,如心理学中的视觉正确性理论所建议?
- RQ4训练过程中学习到的注意力模式是否能泛化到未见过的测试图像,表明所学规则的鲁棒性与泛化能力?
- RQ5模型学习到的注意力模式是否与既定的摄影规则及美学感知的心理学原理一致?
主要发现
- 所提出的 IAA-OVC 框架在 AVA 数据集上表现优异,在美学评分分布预测的 SRCC 与 PLCC 指标上均优于先前方法。
- 基于对象的注意力得分与主体存在性显著相关:对‘人脸’或‘人物’等主体的高注意力与更高美学评分正相关,而对‘耳朵’等非主体的注意力则与美学评分负相关。
- 对模糊区域的高注意力与美学评分强烈负相关,证实图像失真会损害美学质量。
- 对象类别对(如‘眼睛’与‘人脸’)的图注意力得分与美学评分呈强正相关,表明显著的对象组织能提升感知质量。
- 注意力模式与美学评分之间的相关性在训练集与测试集间保持一致,表明注意力机制具有鲁棒性与泛化能力。
- 模型的注意力行为与心理学理论一致:主体被优先关注,显著的对象配对(如面部特征)被强调,支持视觉正确性与注意力-主体一致性原则。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。