Skip to main content
QUICK REVIEW

[論文レビュー] Colorization Transformer

M. P. Pavan Kumar, Dirk Weissenborn|arXiv (Cornell University)|Feb 8, 2021
Generative Adversarial Networks and Image Synthesis参考文献 33被引用数 5
ひとこと要約

Colorization Transformer (ColTran) は、条件付きトランスフォーマーレイヤーと3段階のプロセスを用いて、高精細で多様な画像色分けを実現する、完全に自己注意に基づく新規なアーキテクチャを導入した。まず低解像度での自己回帰的色分けを行い、その後に空間的および色のスーパーサンプルを並列で処理する。Mechanical Turk 評価において、FID 19.37 の最先端性能を達成し、正解画像よりも 62% のケースで人間の好みを上回った。

ABSTRACT

We present the Colorization Transformer, a novel approach for diverse high fidelity image colorization based on self-attention. Given a grayscale image, the colorization proceeds in three steps. We first use a conditional autoregressive transformer to produce a low resolution coarse coloring of the grayscale image. Our architecture adopts conditional transformer layers to effectively condition grayscale input. Two subsequent fully parallel networks upsample the coarse colored low resolution image into a finely colored high resolution image. Sampling from the Colorization Transformer produces diverse colorings whose fidelity outperforms the previous state-of-the-art on colorising ImageNet based on FID results and based on a human evaluation in a Mechanical Turk test. Remarkably, in more than 60% of cases human evaluators prefer the highest rated among three generated colorings over the ground truth. The code and pre-trained checkpoints for Colorization Transformer are publicly available at https://github.com/google-research/google-research/tree/master/coltran

研究の動機と目的

  • 深層学習を用いてグレースケール画像の多様で高精細な色分けを生成する課題に対処する。
  • 従来の自己回帰的およびCNNベースのモデルが、グローバルな文脈を捉えることや、知覚的に現実的な出力を生成することに制限を受けるのを克服する。
  • 条件付き注意メカニズムを通じて、効率的で高解像度の色分けを可能にするトランスフォーマー基盤のアーキテクチャを開発する。
  • 自己回帰的モデリングと並列的スーパーサンプル処理を組み合わせることで、より高速で高品質な推論を実現する。
  • 人間の評価において、モデルが生成した色分けが正解画像を上回る傾向にあることから、知覚的な現実性を示す。

提案手法

  • 自己回帰的色分けの粗い段階として、64×64 解像度の条件付き軸方向トランスフォーマーを用い、自己注意層内で各画素および各チャネルごとの学習可能な成分を用いて条件付けを行う。
  • グレースケール入力を複数の学習可能な成分を介して明示的に統合する条件付きトランスフォーマーレイヤーを導入し、単純な入力加算よりも条件付けの忠実度を向上させる。
  • 256×256 解像度の色分けを3段階に分解する:まず自己回帰的色分けを行い、その後に空間的および色のスーパーサンプル処理を並列で実行する完全結合ネットワークを用いる。
  • 軸方向トランスフォーマーで準並列サンプリング機構を採用し、自己回帰的生成の高品質を維持しつつ推論を高速化する。
  • 粗い色分けモデルと同時に学習する補助的並列予測モデルを導入し、特徴表現の向上により FID スコアを改善する。
  • 最終的な高解像度出力のために高速で決定論的なアップサンプリングを適用し、256×256 解像度での効率的な生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1自己注意に基づくモデルは、多様性と高精細さを維持したまま、画像色分け分野で最先端の性能を達成できるか?
  • RQ2自己回帰的色分けにおいて、トランスフォーマーレイヤー内の学習可能な成分による明示的条件付けは、入力バイアスや加算による条件付けと比べてどのように異なるか?
  • RQ3補助的スーパーサンプルモデルと共同で学習させることで、色分け品質および FID スコアはどの程度向上するか?
  • RQ4自己回帰的トランスフォーマーに軸方向注意を適用した場合、カスタムカーネルや複雑な注意メカニズムを用いずに、高解像度の色分けを効率的に生成できるか?
  • RQ5人間の好みにおいて、生成された色分けと正解画像の間で、現実性および知覚的品質の観点からどの程度差が生じるか?

主な発見

  • ColTran は ImageNet 256×256 グレースケール画像において、FID スコア 19.37 という新たな最先端を達成し、PixColor (24.32) や cINN (25.13) など従来手法を大きく上回った。
  • Mechanical Turk の 2AFC テストにおいて、モデルが生成した色分けの最良3例が正解画像よりも 62.0% のケースで好まれ、知覚的な現実性の優位性を示した。
  • ColTran-B(入力加算による軸方向トランスフォーマー)は FID 19.98 を達成し、ColTran-S(28×28 で学習)は 22.06 を達成した。これは、より高解像度の自己回帰的モデリングが有効であることを示している。
  • 対数尤度と FID の間に中程度の正の相関(0.57)が確認され、尤度モデリングの向上が知覚的品質の向上に繋がることを示唆している。
  • 可視化結果から、物体の境界や複雑なテクスチャ部で高い不確実性が観察され、モデルが曖昧な色の遷移を適切に推論していることが確認された。
  • 補助的並列予測モデルは FID の向上に寄与し、トレーニング中における特徴表現および色の忠実度の向上に有効であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。