Skip to main content
QUICK REVIEW

[論文レビュー] Neural Architecture Search for Deep Image Prior

Kary Ho, Andrew Gilbert|arXiv (Cornell University)|Jan 14, 2020
Advanced Image Processing Techniques参考文献 43被引用数 8
ひとこと要約

本稿では、深層画像プライアリ(DIP)の性能を向上させるために、コンテンツに特化したエンコーダ・デコーダネットワークを自動で発見する進化的ニューラルアーキテクチャ探索手法NAS-DIPを提案する。バイナリゲノム上で遺伝的アルゴリズムを用いてアーキテクチャとメタパラメータを最適化することで、ノイズ除去、穴埋め補完、超解像の各タスクにおいて、従来のDIPよりも優れた視覚的品質を達成し、500の個体からなる集団で10〜20世代のうちに収束する。

ABSTRACT

We present a neural architecture search (NAS) technique to enhance the performance of unsupervised image de-noising, in-painting and super-resolution under the recently proposed Deep Image Prior (DIP). We show that evolutionary search can automatically optimize the encoder-decoder (E-D) structure and meta-parameters of the DIP network, which serves as a content-specific prior to regularize these single image restoration tasks. Our binary representation encodes the design space for an asymmetric E-D network that typically converges to yield a content-specific DIP within 10-20 generations using a population size of 500. The optimized architectures consistently improve upon the visual quality of classical DIP for a diverse range of photographic and artistic content.

研究の動機と目的

  • 従来の深層画像プライアリ(DIP)が固定で最適化されていないネットワークアーキテクチャに依存しており、多様な画像コンテンツにおいて最適でない性能を示すという限界を是正すること。
  • 教師なしで、コンテンツに適応したニューラルアーキテクチャ探索(NAS)フレームワークを構築し、個々の画像に適合したエンコーダ・デコーダ構造とメタパラメータを最適化すること。
  • 遺伝的アルゴリズムによるアーキテクチャ探索が、教師なしの環境下でも単一画像修復タスクにおける知覚的品質を顕著に向上させられることを示すこと。
  • 発見されたアーキテクチャが、元来の視覚的スタイルを反映しており、スタイルごとに分類可能な教師なしクラスタリングが可能かどうかを検討すること。

提案手法

  • 非対称エンコーダ・デコーダネットワークのアーキテクチャ空間を、フィルターサイズ、チャネル数、スキップ接続を含むバイナリ文字列として表現し、離散的でコンactなゲノム上で進化的探索を可能にする。
  • トーナメント選択、均一クロスオーバー、ビット反転変異を用いた遺伝的アルゴリズムが、10〜20世代にわたり500個体の集団を進化させ、知覚的品質を最適化する。
  • 教師なしの環境下で、視覚的品質の代理指標として知覚的メトリクス(LPIPS)を用いてフィットネスを評価する。これにより、教師画像が不要なブレインド最適化が可能となる。
  • アーキテクチャ空間には10段階の畳み込み層が含まれており、フィルターサイズとチャネル幅を可変とし、対称的および非対称なE-D構造を両方サポートする。
  • アーキテクチャ空間のt-SNE可視化により、ペーパーワークや水彩画など、類似した視覚的スタイルを持つネットワークがクラスタを形成していることが判明し、スタイルに特化したアーキテクチャの好みが示唆された。
  • ノイズ除去、穴埋め補完、超解像に本手法を適用し、画像修復のための損失関数としてLPIPSに基づく再構成損失を定義する。

実験結果

リサーチクエスチョン

  • RQ1進化的ニューラルアーキテクチャ探索は、教師なし環境下でも、標準DIPを著しく上回るエンコーダ・デコーダアーキテクチャを発見できるか?
  • RQ2画像修復の最適なネットワークアーキテクチャはコンテンツに特化しており、異なる画像スタイルに応じて異なる構成を必要とするか?
  • RQ3発見されたアーキテクチャを用いて、視覚的スタイルに基づいて教師なしで画像をクラスタリングできるか?
  • RQ4教師なし環境下で、収束性と視覚的品質が最良となる変異率と集団サイズは何か?

主な発見

  • NAS-DIPは、知覚的メトリクスと定性的比較により検証された結果、ノイズ除去、穴埋め補完、超解像の各タスクにおいて、従来のDIPよりも一貫して視覚的品質が向上している。
  • 収束性と高いフィットネスを達成する最適な変異率は5%(0.05)であり、N=5の条件下で平均して1オフスプリングあたり4ビットの反転が発生し、低・高の変異率よりも優れた性能を示した。
  • 500の集団サイズを用いた場合、10〜20世代のうちに収束が達成され、1枚の画像あたり単一GPUで数時間のトレーニングで実現可能である。
  • アーキテクチャ空間のt-SNE可視化により、コミック、3Dレンダリング、水彩画など、異なる視覚的スタイルに対応する明確なクラスタが確認され、スタイルに特化したアーキテクチャが発見されたことが示された。
  • 超解像タスクでは、対称的E-Dアーキテクチャが非対称型を上回ったが、ノイズ除去および穴埋め補完では非対称構造が最適であった。
  • 同じコンテンツ(例:8 BAM!スタイルの花)でも、異なる芸術的スタイルを有する画像に対して最良の性能を示すアーキテクチャは、アーキテクチャ空間で明確に分離したクラスタを形成しており、コンテンツに特化した設計発見が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。