Skip to main content
QUICK REVIEW

[论文解读] Formal Analysis of Art: Proxy Learning of Visual Concepts from Style Through Language Models

Diana Kim, Ahmed Elgammal|arXiv (Cornell University)|Jan 5, 2022
Aesthetic Perception and Analysis被引用 4
一句话总结

本文提出一种代理学习框架,通过风格标签和语言模型量化细密艺术绘画中的视觉元素,无需昂贵的视觉标注。新颖的深度代理方法对语言模型输出的噪声具有鲁棒性,在零样本视觉概念学习中优于现有属性学习方法。

ABSTRACT

We present a machine learning system that can quantify fine art paintings with a set of visual elements and principles of art. This formal analysis is fundamental for understanding art, but developing such a system is challenging. Paintings have high visual complexities, but it is also difficult to collect enough training data with direct labels. To resolve these practical limitations, we introduce a novel mechanism, called proxy learning, which learns visual concepts in paintings though their general relation to styles. This framework does not require any visual annotation, but only uses style labels and a general relationship between visual concepts and style. In this paper, we propose a novel proxy model and reformulate four pre-existing methods in the context of proxy learning. Through quantitative and qualitative comparison, we evaluate these methods and compare their effectiveness in quantifying the artistic visual concepts, where the general relationship is estimated by language models; GloVe or BERT. The language modeling is a practical and scalable solution requiring no labeling, but it is inevitably imperfect. We demonstrate how the new proxy model is robust to the imperfection, while the other models are sensitively affected by it.

研究动机与目标

  • 解决细密艺术中色彩、线条和纹理等艺术元素直接视觉标注稀缺的问题。
  • 开发一种仅依赖风格标签和语言模型、无需视觉标注的机器学习框架,以学习视觉概念。
  • 评估不同代理学习方法在语言模型监督不完善情况下的鲁棒性。
  • 证明深度代理方法——一种结合深度卷积神经网络与语言模型提供的风格-概念关系的新方法——比现有方法更能抵御语言模型错误。

提出的方法

  • 提出‘代理学习’——一种通过其与风格的一般线性关系学习视觉概念的框架,仅使用风格标签和语言模型。
  • 在代理学习范式下重构四种现有属性学习方法(稀疏编码、逻辑回归、主成分分析、ESZSL)。
  • 提出一种新方法‘深度代理’,该方法使用仅作为风格分类器训练的深度卷积神经网络,但利用语言模型估计的风格-概念关系来提取视觉概念嵌入。
  • 使用预训练语言模型(GloVe 和 BERT)生成嵌入矩阵 $ G $,以编码风格与视觉概念之间的关系。
  • 训练深度卷积神经网络以预测风格,同时通过线性投影约束其最后一层隐藏层与语言模型的概念嵌入对齐。
  • 使用正则化损失优化模型,以确保预测风格与代理概念表征之间的一致性。

实验结果

研究问题

  • RQ1能否通过利用艺术风格与视觉概念之间的一般关系,在无需直接视觉标注的情况下有效学习艺术中的视觉概念?
  • RQ2在语言模型监督不完善的情况下,代理学习方法的性能如何变化?
  • RQ3哪种代理学习方法对语言模型对风格-概念关系估计的噪声或不准确最为鲁棒?
  • RQ4当仅通过代理监督进行风格分类训练时,深度卷积神经网络在在多大程度上能学习艺术元素的视觉语义?

主要发现

  • 深度代理方法在使用 BERT 嵌入时,视觉概念预测的 AUC 得分最高(eval-TEST 上为 0.78),优于其他代理方法。
  • 在代理学习框架中,奇异值分解(SVD)对语言模型不完善具有更优的鲁棒性,eval-VAL 分割上的 AUC 得分为 0.73(BERT)和 0.78(GloVe)。
  • 逻辑回归(LGT)对语言模型质量高度敏感,AUC 降至 0.38(BERT),但升至 0.77(GloVe),表明其对嵌入质量的强依赖性。
  • 语言模型质量评分与 AUC 结果之间的皮尔逊相关系数,LGT 为 r ≈ 0.65,SVD 为 r ≈ 0.55,证实 SVD 对噪声语言模型更具韧性。
  • 对于单词 'planar',BERT 将其错误地与印象派和表现主义关联为负面,这严重损害 LGT(AUC:0.38),但仅中度影响 SVD(AUC:0.73)。
  • 在 12 个训练风格、8 个测试风格的划分中,SVD 始终优于 LGT,前 15 个视觉概念的 AUC 得分为 0.71(SVD)对比 0.63(LGT)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。