Skip to main content
QUICK REVIEW

[論文レビュー] An analysis of the transfer learning of convolutional neural networks for artistic images

Nicolas Gonthier, Yann Gousseau|arXiv (Cornell University)|Nov 5, 2020
Generative Adversarial Networks and Image Synthesis参考文献 32被引用数 16
ひとこと要約

この論文は、微調整されたアート画像データセット上で転移学習が事前学習済み畳み込みニューラルネットワーク(CNN)に与える影響を調査する。特徴の可視化と特徴空間およびパrameter空間における定量的指標を用いて、中規模のアートデータセット(RASTA)で微調整した後、より小さなデータセットをターゲットにすることで、タスクが異なっていても分類性能が向上することを示している。これは、フィルタの適応性と高層層におけるクラスの濃縮が向上するためである。

ABSTRACT

Transfer learning from huge natural image datasets, fine-tuning of deep neural networks and the use of the corresponding pre-trained networks have become de facto the core of art analysis applications. Nevertheless, the effects of transfer learning are still poorly understood. In this paper, we first use techniques for visualizing the network internal representations in order to provide clues to the understanding of what the network has learned on artistic images. Then, we provide a quantitative analysis of the changes introduced by the learning process thanks to metrics in both the feature and parameter spaces, as well as metrics computed on the set of maximal activation images. These analyses are performed on several variations of the transfer learning procedure. In particular, we observed that the network could specialize some pre-trained filters to the new image modality and also that higher layers tend to concentrate classes. Finally, we have shown that a double fine-tuning involving a medium-size artistic dataset can improve the classification on smaller datasets, even when the task changes.

研究の動機と目的

  • 事前学習済みCNNが転移学習を通じてアート画像データセットにどのように適応するかを理解すること。
  • 特に特徴空間およびパrameter空間におけるネットワーク表現への微調整の影響を調査すること。
  • 中規模のアートデータセットでの中間的微調整が、より小さな下流のアート分類タスクでのパフォーマンスを向上させるかどうかを評価すること。
  • 可視化と定量的指標を用いて、微調整中のフィルタおよび特徴活性化の構造的変化を分析すること。

提案手法

  • CNNがアート画像で学習した内部表現を解釈するために、特徴の可視化技術を適用した。
  • 特徴空間およびパrameter空間における微調整中の変化を定量化するために、線形中心化カーネル整合性(CKA)とℓ₂距離を用いた。
  • 最大活性化画像の集合に対する重複率とエントロピーを計算し、フィルタの特化度および構造的変化を評価した。
  • 複数の微調整戦略を比較した:小さなデータセットへの直接微調整、中間のアートデータセット(RASTA)経由の微調整、およびスクラッチからの学習。
  • 2つのアートデータセットにおけるパフォーマンスを評価した:Paintings(物体分類)とIconArt(インフォグラフィック分類)。
  • 異なる初期化および微調整戦略を用いたInceptionV1アーキテクチャを用いてモデルを学習・比較した。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みCNNの内部表現は、アート画像データセットで微調整された際にどのように変化するか?
  • RQ2中規模のアートデータセット(RASTA)で微調整することで、より小さな下流のアート分類タスクでのパフォーマンスはどの程度向上するか?
  • RQ3CNNの低層および高層におけるフィルタは、アート画像で微調整する際に異なる方法で特化するか?
  • RQ4CKAやℓ₂ノルムなどの定量的指標は、アート画像文脈における転移学習の適応度をどの程度反映するか?

主な発見

  • 中規模のアートデータセット(RASTA)で微調整した後、より小さなデータセットをターゲットにすることで、分類性能が顕著に向上した。IconArtデータセットでは平均平均適合率が67.4%、Paintingsデータセットでは65.6%を記録した。
  • 二重微調整戦略(RASTA → ターゲットデータセット)が最高のパフォーマンスを達成し、直接微調整やオフザシェル特徴の使用を上回った。
  • 微調整後のネットワークの高層層ではクラスの濃縮が見られ、より特徴的な特徴学習が進んでいることが示された。
  • 一部の事前学習済みフィルタはアートモダリティに特化していた一方、微調整中にスクラッチから高密度の構造的フィルタが出現した。
  • 二重微調整後の最終モデルとImageNetで事前学習されたモデル間のCKA類似度は、IconArtで0.73、Paintingsで0.76に低下し、顕著な構造的適応が示された。
  • RASTAでスクラッチから微調整したモデルはパフォーマンスが低かった(それぞれ49.1%および50.1%)、ImageNetで初期化されたモデルよりも劣っており、RASTA単体では良好な初期化には不十分であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。