Skip to main content
QUICK REVIEW

[論文レビュー] Color2Embed: Fast Exemplar-Based Image Colorization using Color Embeddings

Hengyuan Zhao, Wenhao Wu|arXiv (Cornell University)|Jun 15, 2021
Generative Adversarial Networks and Image Synthesis参考文献 41被引用数 12
ひとこと要約

Color2Embedは、自己増強自己参照学習と学習された色埋め込みを用いて、高速で軽量なエキスブレートベースの画像色付け手法を提案する。薄板スプライン変換を用いて合成された参照画像を生成し、段階的な特徴形式化ネットワークを通じて色埋め込みを注入することで、1024×1024画像において0.32秒未満の推論速度を達成し、視覚的品質において最先端の性能を発揮する。従来手法に比べて高速性とアーチファクト低減の両面で優れている。

ABSTRACT

In this paper, we present a fast exemplar-based image colorization approach using color embeddings named Color2Embed. Generally, due to the difficulty of obtaining input and ground truth image pairs, it is hard to train a exemplar-based colorization model with unsupervised and unpaired training manner. Current algorithms usually strive to achieve two procedures: i) retrieving a large number of reference images with high similarity for preparing training dataset, which is inevitably time-consuming and tedious; ii) designing complicated modules to transfer the colors of the reference image to the target image, by calculating and leveraging the deep semantic correspondence between them (e.g., non-local operation), which is computationally expensive during testing. Contrary to the previous methods, we adopt a self-augmented self-reference learning scheme, where the reference image is generated by graphical transformations from the original colorful one whereby the training can be formulated in a paired manner. Second, in order to reduce the process time, our method explicitly extracts the color embeddings and exploits a progressive style feature Transformation network, which injects the color embeddings into the reconstruction of the final image. Such design is much more lightweight and intelligible, achieving appealing performance with fast processing speed.

研究の動機と目的

  • 外部データセットを必要としないエキスブレートベースの色付けモデルの学習を可能にするために、自己増強を用いたペaired学習パラダイムを提供すること。
  • 推論時に高価な参照画像の検索や複雑な対応関係計算を不要とする。
  • 高視覚的忠実度を維持しつつ、リアルタイム処理を実現する軽量で効率的なアーキテクチャの開発。
  • 複雑な損失関数への依存を減らすために、ピクセル単位の再構成損失と知覚的損失のみを用いる安定した学習。
  • 色の汚染やアーチファクトを引き起こさずに、多様な参照画像に対して強力な色付けを可能にする。

提案手法

  • 1つの入力カラー画像から薄板スプライン(TPS)変換を用いて複数の自己参照画像を生成し、外部データセットを必要としないペアド監視学習を可能にする。
  • 多層パーセプトロン(MLP)を用いて、参照画像特徴から高次元の色埋め込みを抽出し、グローバルな色統計を捉える。
  • 専用のコンテンツエンコーダーネットワークを用いて、入力グレースケール画像を深層コンテンツ埋め込みに符号化する。
  • 段階的な特徴形式化ブロック(PFFB)を備えた段階的特徴形式化ネットワーク(PFFN)を導入し、色埋め込みを段階的にコンテンツ特徴に注入する。
  • モデルの効率的で安定した学習のため、ピクセル単位の再構成損失と知覚的損失の2つの損失関数のみを活用する。
  • 非局所演算や対応マップ計算を回避することで、推論時間と計算コストを顕著に削減する。

実験結果

リサーチクエスチョン

  • RQ1自己増強された自己参照学習は、外部参照データベースを必要とせずに、エキスブレートベースの色付けの有効な学習を可能にするか?
  • RQ2変換された参照画像から抽出した色埋め込みは、複雑な対応モデリングを伴わずに、グレースケール入力に色を効果的に転送できるか?
  • RQ3最小限の損失関数を用いた軽量アーキテクチャは、リアルタイム推論を可能にしつつも、競争力のある性能を達成できるか?
  • RQ4提案手法は、既存のエキスブレートベースの色付け手法と比較して、速度と視覚的品質の両面で優れているか?
  • RQ5多様な参照画像に対して、色の汚染やアーチファクトを引き起こさずに、モデルは一貫した汎用性を示せるか?

主な発見

  • Color2Embedは、256×256、512×512、1024×1024の画像解像度に対して、それぞれ0.03秒、0.08秒、0.32秒の推論時間を達成し、He et al. [12] や Lu et al. [29] といった従来手法に比べて高速性とスケーラビリティで優れている。
  • アブレーションスタディの結果、自己増強された自己参照学習が色の汚染を防止することを確認した。図8では、増強なしのモデルが著しいアーチファクトを生じている。
  • 再構成損失と知覚的損失のみを用いたモデルが、複雑な損失バンドルを用いたモデルに比べて優れた結果を示した。図10では、単一損失モデルが誤ったまたは一貫性のない色を生成している。
  • 定性的な比較では、Color2Embedが[12] や [29] よりも色の汚染を回避し、特に局所領域でより自然な結果を生成している。
  • 図9に示すように、異なる参照画像に対してもモデルは強い耐性を示し、一貫性がありスタイルに適した色付けを実現している。
  • 実際の古い写真(図7および図9)において、Color2Embedは最小限のアーチファクトと正確な色の転送を実現し、最先端の視覚的品質を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。