Skip to main content
QUICK REVIEW

[論文レビュー] Formal Analysis of Art: Proxy Learning of Visual Concepts from Style Through Language Models

Diana Kim, Ahmed Elgammal|arXiv (Cornell University)|Jan 5, 2022
Aesthetic Perception and Analysis被引用数 4
ひとこと要約

本稿では、視覚的アノテーションの代わりにスタイルラベルと言語モデルを用いて、細密な芸術的絵画における視覚的要素を定量化するためのプロキシ学習フレームワークを提案する。このフレームワークは、高価な視覚的アノテーションの必要性を回避する。新規のディープ・プロキシ手法は、言語モデルの出力にノイズが混入しても頑健であり、既存の属性学習手法に比べてゼロショット視覚的概念学習で優れた性能を示す。

ABSTRACT

We present a machine learning system that can quantify fine art paintings with a set of visual elements and principles of art. This formal analysis is fundamental for understanding art, but developing such a system is challenging. Paintings have high visual complexities, but it is also difficult to collect enough training data with direct labels. To resolve these practical limitations, we introduce a novel mechanism, called proxy learning, which learns visual concepts in paintings though their general relation to styles. This framework does not require any visual annotation, but only uses style labels and a general relationship between visual concepts and style. In this paper, we propose a novel proxy model and reformulate four pre-existing methods in the context of proxy learning. Through quantitative and qualitative comparison, we evaluate these methods and compare their effectiveness in quantifying the artistic visual concepts, where the general relationship is estimated by language models; GloVe or BERT. The language modeling is a practical and scalable solution requiring no labeling, but it is inevitably imperfect. We demonstrate how the new proxy model is robust to the imperfection, while the other models are sensitively affected by it.

研究の動機と目的

  • 色彩、線、質感といった芸術的要素の直接的な視覚的アノテーションが不足している問題に対処する。
  • 視覚的アノテーションに依存せず、スタイルラベルと言語モデルのみに依存して視覚的概念を学習する機械学習フレームワークを開発する。
  • 不完全な言語モデルの監視下での、さまざまなプロキシ学習手法の頑健性を評価する。
  • スタイル・コンセプト関係を言語モデルが推定する情報を利用し、深層畳み込みニューラルネットワーク(CNN)を用いて視覚的コンセプト埋め込みを抽出する、新規手法「ディープ・プロキシ」が、既存手法に比べて言語モデルの誤りに対してより耐性があることを示す。

提案手法

  • 『プロキシ学習』を導入する。これは、スタイルとの一般的な線形関係を用いて、スタイルラベルと言語モデルのみで視覚的コンセプトを学習するフレームワークである。
  • 既存の4つの属性学習手法(スパースコーディング、ロジスティック回帰、主成分分析(PCA)、ESZSL)を、プロキシ学習の枠組みに再定式化する。
  • 深層畳み込みニューラルネットワーク(CNN)をスタイル分類器としてのみ訓練するが、言語モデルが推定するスタイル・コンセプト関係を活用して視覚的コンセプト埋め込みを抽出する、新規手法「ディープ・プロキシ」を提案する。
  • 事前学習済みの言語モデル(GloVeとBERT)を用いて、スタイルと視覚的コンセプトの関係を符号化する埋め込み行列 $ G $ を生成する。
  • ディープCNNをスタイルを予測するように訓練するが、その最終隠れ層を、言語モデルのコンセプト埋め込みに一致させる線形射影によって制約する。
  • 予測されたスタイルとプロキシコンセプト表現の整合性を保つ正則化損失関数を最適化する。

実験結果

リサーチクエスチョン

  • RQ1芸術的スタイルとの一般的な関係を活用することで、直接的な視覚的アノテーションがなくても、芸術における視覚的コンセプトを効果的に学習できるか?
  • RQ2不完全な言語モデルの監視下において、プロキシ学習手法の性能はどのように変化するか?
  • RQ3どのプロキシ学習手法が、スタイル・コンセプト関係の推定に誤差がある言語モデルに対して最も頑健か?
  • RQ4プロキシ監視のもとで、スタイル分類のみに訓練された深層CNNが、芸術的要素の視覚的意味をどの程度学習できるか?

主な発見

  • ディープ・プロキシ手法は、BERT埋め込みを用いた場合、評価用テスト(eval-TEST)で最高のAUCスコア(0.78)を達成し、他のプロキシ手法を上回った。
  • プロキシ学習フレームワークにおける特異値分解(SVD)は、言語モデルの不完全さに対して優れた頑健性を示し、評価用バリデーション(eval-VAL)スプリットでAUCスコアがBERTで0.73、GloVeで0.78を記録した。
  • ロジスティック回帰(LGT)は言語モデルの品質に極めて敏感であり、BERTではAUCが0.38に低下するが、GloVeでは0.77に上昇する。これは、埋め込み品質に強く依存していることを示している。
  • 言語モデルの品質スコアとAUC結果とのピアソン相関係数は、LGT(r ≈ 0.65)がSVD(r ≈ 0.55)よりも高い。これはSVDがノイズの多い言語モデルに対してより耐性があることを確認している。
  • 語「planar」に関して、BERTは印象派や表現主義と否定的関連を誤ってエンコードしており、これによりLGTの性能に著しい悪影響(AUC: 0.38)を及ぼすが、SVDにはややの影響(AUC: 0.73)にとどまる。
  • 12の訓練スタイル、8のテストスタイルに分けるスプリットにおいて、SVDはLGTを一貫して上回り、上位15個の視覚的コンセプトでAUCスコアがSVDで0.71、LGTで0.63を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。