Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Feature Learning by Learning to Spot Artifacts

Simon Jenni, Paolo Favaro|arXiv (Cornell University)|Jun 13, 2018
Generative Adversarial Networks and Image Synthesis参考文献 42被引用数 10
ひとこと要約

本論文は、符号化された特徴量を劣化させ、限られた容量のネットワークを用いて修復することで生成された合成アーティファクトを含む画像と本物の画像を区別するように訓練されたディスクラミネーターを用いる自己教師あり特徴学習手法を提案する。グローバルな不整合や欠落した特徴エントリを検出させることで、人為的ラベルなしで、ImageNet、Pascal VOC、STL-10ベンチマークで最先端の性能を達成する高品質で転移可能な表現を学習する。

ABSTRACT

We introduce a novel self-supervised learning method based on adversarial training. Our objective is to train a discriminator network to distinguish real images from images with synthetic artifacts, and then to extract features from its intermediate layers that can be transferred to other data domains and tasks. To generate images with artifacts, we pre-train a high-capacity autoencoder and then we use a damage and repair strategy: First, we freeze the autoencoder and damage the output of the encoder by randomly dropping its entries. Second, we augment the decoder with a repair network, and train it in an adversarial manner against the discriminator. The repair network helps generate more realistic images by inpainting the dropped feature entries. To make the discriminator focus on the artifacts, we also make it predict what entries in the feature were dropped. We demonstrate experimentally that features learned by creating and spotting artifacts achieve state of the art performance in several benchmarks.

研究の動機と目的

  • 人為的ラベルデータを一切用いずに、転移可能な視覚的特徴を学習する自己教師あり手法の開発。
  • モデルが合成アーティファクトを検出するように訓練することで、意味的に意味のあるオブジェクト表現を学習するための事前学習タスクの設計。
  • 符号化された特徴量を損傷させ、限られた容量の修復ネットワークを用いて、現実的だが劣化した画像を生成する。
  • 欠落した特徴エントリの位置を予測させることで、ディスクラミネーターの汎化性能を向上させ、オブジェクトレベルの詳細に注目させる。
  • ImageNet、Pascal VOC、STL-10といった複数の標準ベンチマークで、最先端の転移学習性能を達成する。

提案手法

  • 高容量のオートエンコーダーを事前学習して画像表現を学習し、その後エンコーダーを凍結する。
  • ランダムにエントリを欠落させることで、符号化された特徴量を劣化させ、合成アーティファクトを生成する。
  • 欠落したエントリを補完するが、限られた容量のため完全な回復を防ぐ修復ネットワークをデコーダーに追加する。
  • ディスクラミネーターを敵対的に訓練し、本物の画像と劣化した画像を分類するとともに、欠落したエントリのマスクを予測する。
  • 真のマスクを用いて、欠落した特徴位置にのみ修復ネットワークの更新を制限し、グローバルな整合性を保つ。
  • 転移学習のため、ディスクラミネーターの中間層から特徴を抽出し、下流タスクで線形分類器を用いる。

実験結果

リサーチクエスチョン

  • RQ1合成アーティファクトの検出に基づく自己教師あり学習手法は、既存の事前学習タスクを上回る転移学習性能を達成できるか?
  • RQ2欠落した特徴の位置を予測させることで、特徴の質と汎化性能が向上するか?
  • RQ3限られた容量の修復ネットワークを用いても、現実的で劣化した画像を生成しつつ、ディスクラミネーターが検出可能なグローバルな不整合を保持できるか?
  • RQ4提案手法は、ImageNet、Pascal VOC、STL-10といった標準ベンチマークで最先端の性能を達成できるか?
  • RQ5ディスクラミネーターが学習する特徴は、標準的なGANやオートエンコーダーの設定よりも意味的により明確な意味を持つのか?

主な発見

  • 提案手法は、固定された特徴量に対して線形分類器を用いた場合、ImageNetで19.5%のトップ-1精度を達成し、表4に示されたすべての先行自己教師あり手法を上回った。
  • Placesデータセットでは、conv5層で37.3%のトップ-1精度を達成し、表5に比較されたすべての手法の中で最高であった。
  • Grad-CAMの可視化結果から、ディスクラミネーターが頭部や脚部といったオブジェクト部品に注目していることが示され、意味的な注目を示している。
  • ディスクラミネーターの最初の畳み込み層から得られる特徴量は、Placesで23.3%の精度を達成し、同じ層で教師ありのImageNet事前学習をわずかに上回った。
  • 評価されたすべてのベンチマークで、Norooziら[29] や Zhang ら[45] のような先行自己教師ありアプローチを上回った。
  • 定性的な分析から、ディスクラミネーターがエッジ検出器やオブジェクト部品に敏感な特徴を学習していることが示され、教師ありモデルと類似した特徴を学習している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。