Skip to main content
QUICK REVIEW

[論文レビュー] Tag2Pix: Line Art Colorization Using Text Tag With SECat and Changing Loss

Hyun‐Su Kim, Ho Young Jhoo|arXiv (Cornell University)|Aug 16, 2019
Generative Adversarial Networks and Image Synthesis参考文献 9被引用数 13
ひとこと要約

Tag2Pixは、テキストベースの色タグを用いた線画色分けのためのGANベースの手法を提案する。マルチラベルセグメンテーションの向上のためのSECat(Squeeze-and-Excitation with Concatenation)を導入し、学習の安定化を図るための損失関数を変更する二段階訓練戦略を採用する。本手法は、特に目などの細かいディテールにおいて、現実世界のデータセットで39.21のFIDスコアを達成し、色分け品質の分野で最先端の性能を発揮する。

ABSTRACT

Line art colorization is expensive and challenging to automate. A GAN approach is proposed, called Tag2Pix, of line art colorization which takes as input a grayscale line art and color tag information and produces a quality colored image. First, we present the Tag2Pix line art colorization dataset. A generator network is proposed which consists of convolutional layers to transform the input line art, a pre-trained semantic extraction network, and an encoder for input color information. The discriminator is based on an auxiliary classifier GAN to classify the tag information as well as genuineness. In addition, we propose a novel network structure called SECat, which makes the generator properly colorize even small features such as eyes, and also suggest a novel two-step training method where the generator and discriminator first learn the notion of object and shape and then, based on the learned notion, learn colorization, such as where and how to place which color. We present both quantitative and qualitative evaluations which prove the effectiveness of the proposed method.

研究の動機と目的

  • イラスト制作業界における線画の手作業による色分けの高コストと困難さに対処すること。
  • 色のスティックや参照画像といった複雑な入力ではなく、テキストベースの色タグのみを用いて、低負荷で使いやすい線画色分け手法を開発すること。
  • 既存手法でしばしば不正確に描画される、目や髪の毛のような小さな細かい特徴の色分けの正確性を向上させること。
  • 新規の二段階訓練スキームと損失関数の適応により、GANベースの色分けにおける学習の安定性と性能を向上させること。
  • 再現可能性と今後の研究を支援するため、新しいデータセットと事前学習済みモデルを公開すること。

提案手法

  • 本手法は、補助識別器GAN(ACGAN)に基づく条件付きGANフレームワークを採用し、識別器が画像の真正性と入力の色タグの両方を分類する。
  • 空間的な位置にわたり関連する色特徴を動的に強調するための新規なネットワークモジュール、SECat(Squeeze-and-Excitation with Concatenation)を導入し、小さな特徴への注目を向上させる。
  • 生成器は、線画用に事前学習されたセマンティックエンコーダと、テキストベースの色ヒントを処理する専用のCVT(Color Variant Tag)エンコーダを統合する。
  • 二段階訓練戦略を採用:最初に再構成損失を用いてオブジェクトと形状のセグメンテーションを学習し、その後に敵対的損失と知覚的損失を組み合わせた色分け学習を行う。
  • 訓練ステップに応じて損失関数を動的に調整し、初期段階ではセグメンテーションを優先し、後続段階では色分けを優先する。
  • スキップ接続と特徴の連結を用いて空間的ディテールを保持し、CVT特徴を複数のデコーダ段階でSECatブロックを介して統合する。

実験結果

リサーチクエスチョン

  • RQ1テキストベースのタグシステムは、色のスティックや参照画像といった複雑な色ヒントを効果的に置き換えることができるか?
  • RQ2SECatモジュールは、目や髪の毛のような小さな細かい特徴の色分けを顕著に改善するか?
  • RQ3損失関数を変更する二段階訓練戦略は、GANベースの線画色分けにおける学習の安定性と最終的な色分け品質を向上させることができるか?
  • RQ4本手法は、従来のGANベースおよび非GANベースの色分け手法と比較して、定量的および定性的にどのように優れているか?
  • RQ5専用のデータセットと事前学習済みコンponentsの使用は、性能向上と再現可能性にどの程度寄与するか?

主な発見

  • SECatモジュールは、テストセットで39.21のFréchet Inception Distance(FID)を達成し、ResNeXt(52.49)、SE-ResNeXt(45.48)および他の埋め込み手法を上回った。
  • SECatは、比較的手法のConcat all(17.37M)よりも少ないパラメータ数(15.81M)でFIDを最良に達成し、より高い効率性を示した。
  • ユーザースタディーでは、SECatがセグメンテーション(3.51)、自然さ(3.60)、正確性(3.60)、総合的品質(3.54)の各分野で最高スコアを記録し、すべてのベースラインを上回った。
  • 定性的な結果から、SECatのみが、曖昧またはスパarsなタグがある状況でも、目や髪の毛のような小さな特徴を正しく色分けしていた。
  • 二段階訓練戦略により、収束が速くなり、安定性が向上した。ネットワークは第二段階で10エポック目で最適なFIDに到達した。
  • 本研究で提案するTag2Pixデータセットは、4,127枚の現実世界の線画イラストとそれに対応する色タグを含み、高精細で再現可能な学習と評価を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。