[論文レビュー] Learning from Multi-domain Artistic Images for Arbitrary Style Transfer
本稿では、多様なドメインの芸術的画像を用いた敵対的訓練を用いて、任意のスタイル転送のための高速なフォワード伝搬ニューラルネットワークを提案する。条件付き生成器と条件付き識別器、および学習可能なマスクモジュールを組み合わせることで、未観測のコンテンツ・スタイルペアに対しても高品質で多様なスタイル化出力を達成し、代表的なスタイル化画像の自動順位付けを可能にする。
We propose a fast feed-forward network for arbitrary style transfer, which can generate stylized image for previously unseen content and style image pairs. Besides the traditional content and style representation based on deep features and statistics for textures, we use adversarial networks to regularize the generation of stylized images. Our adversarial network learns the intrinsic property of image styles from large-scale multi-domain artistic images. The adversarial training is challenging because both the input and output of our generator are diverse multi-domain images. We use a conditional generator that stylized content by shifting the statistics of deep features, and a conditional discriminator based on the coarse category of styles. Moreover, we propose a mask module to spatially decide the stylization level and stabilize adversarial training by avoiding mode collapse. As a side effect, our trained discriminator can be applied to rank and select representative stylized images. We qualitatively and quantitatively evaluate the proposed method, and compare with recent style transfer methods. We release our code and model at https://github.com/nightldj/behance_release.
研究の動機と目的
- 未観測のコンテンツ画像とスタイル画像ペアに一般化可能な高速でフォワード伝搬型のニューラルネットワークを開発すること。
- 多様な芸術的画像ドメインにおける敵対的訓練を活用することで、スタイル化の品質を向上させること。
- 入力(コンテンツ)と出力(スタイル)の両方が多様なドメインにまたがる状況におけるマルチドメイン敵対的訓練の課題に対処すること。
- 訓練済みの識別器を用いて、各スタイルカテゴリごとに高品質で代表的なスタイル化画像を自動選択すること。
- 同じアーキテクチャを用いて、デスタイライゼーションとフォトリアルなスタイル転送を実現すること。
提案手法
- コンテンツ画像の深層特徴統計をスタイル画像から移すことでスタイル転送を実現する、適応的インスタンス正規化(AdaIN)に基づく条件付き生成器を用いる。
- 粗いスタイルカテゴリで訓練された条件付き識別器を用い、本物の画像と生成画像を区別することで、敵対的訓練を安定化させる。
- 空間的にスタイル化の強度を制御する学習可能なマスクモジュールを導入し、コンテンツ特徴とスタイル化特徴をブレンドすることでアーティファクトを低減し、モードコラプスを回避する。
- 条件付き識別器からの敵対的損失に加え、コンテンツおよびスタイル再構成損失(深層特徴とグラム行列を介して)を組み合わせた損失関数で生成器を訓練する。
- 訓練済みの識別器をスタイル分類器として再利用し、各スタイルカテゴリごとに高品質で代表的なスタイル化画像を順位付け・選択する。
- 複数のドメイン(例:コミック、油絵、水彩、ベクトルアートなど)にまたがる大規模かつ多様な芸術的画像データセットで訓練を行う。
実験結果
リサーチクエスチョン
- RQ1敵対的訓練により、コンテンツおよびスタイル再構成損失を超えて、任意のスタイル転送の視覚的品質と多様性が向上するか?
- RQ2入力(コンテンツ)と出力(スタイル)の両方が複数の多様なドメインにまたがる状況において、敵対的訓練をどのように安定化できるか?
- RQ31つの訓練済み生成器ネットワークが、複数の芸術的ドメインにまたがる未観測のコンテンツ・スタイル画像ペアに一般化可能か?
- RQ4訓練済みの識別器を再利用して、各スタイルカテゴリにおける最も代表的なスタイル化画像を順位付け・特定できるか?
- RQ5同じアーキテクチャが、芸術的画像で訓練されたにもかかわらず、フォトリアルな画像からのスタイル転送およびデスタイライゼーションを実現できるか?
主な発見
- 提案手法は、従来手法と比較して、特に背景の詳細を保持し、アーティファクトを低減する点で、スタイル化出力の視覚的品質と多様性が優れている。
- マルチドメインの芸術的画像で訓練された識別器は、スタイル化画像の順位付けに成功しており、ユーザースタディーでは識別器の優位性比が0.5068(強力なベースライン分類器より)を示している。
- モデルは、テクスチャが豊富なスタイル画像を含む標準的なスタイル転送ベンチマークにおいても良好に一般化し、最先端のベースラインと同等またはそれ以上の結果を達成している。
- 同じアーキテクチャを用いてデスタイライゼーションも可能であり、芸術的画像でのみ学習したにもかかわらず、ベースラインよりもより現実的である画像を生成している。
- マスクモジュールは敵対的訓練を効果的に安定化させ、空間的なスタイル化制御を可能にし、モードコラプスを低減し、特徴のブレンドを改善している。
- モデルはフォトリアルなスタイル転送にも適用可能であることが、定性的な結果から示されており、実画像からのスタイル転送を成功裏に実現している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。