Skip to main content
QUICK REVIEW

[論文レビュー] Stroke Controllable Fast Style Transfer with Adaptive Receptive Fields

Yongcheng Jing, Yang Liu|arXiv (Cornell University)|Feb 20, 2018
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 16
ひとこと要約

本稿では、適応的受容 field と2つの新規トレーニング戦略を用いて、連続的かつ空間的に変化するスティックサイズの制御を可能にする、スティック制御可能な高速スタイル転送ネットワークを提案する。受容 field とスタイル画像スケールを明示的にモデル化することにより、1枚の画像内で異なる領域に異なるスティックサイズを持つリアルタイムのスタイル転送を実現し、品質を損なわずに柔軟性と効率性の面で先行手法を上回る。

ABSTRACT

The Fast Style Transfer methods have been recently proposed to transfer a photograph to an artistic style in real-time. This task involves controlling the stroke size in the stylized results, which remains an open challenge. In this paper, we present a stroke controllable style transfer network that can achieve continuous and spatial stroke size control. By analyzing the factors that influence the stroke size, we propose to explicitly account for the receptive field and the style image scales. We propose a StrokePyramid module to endow the network with adaptive receptive fields, and two training strategies to achieve faster convergence and augment new stroke sizes upon a trained model respectively. By combining the proposed runtime control strategies, our network can achieve continuous changes in stroke sizes and produce distinct stroke sizes in different spatial regions within the same output image.

研究の動機と目的

  • 高速スタイル転送におけるスティックサイズに対する細かい制御の欠如に取り組むこと、特にアートスタイル転送において。
  • 再トレーニングなしに1つのモデルで連続的かつ空間的に変化するスティックサイズの制御を可能にすること。
  • トレーニング効率を向上させ、トレーニング後の新しいスティックサイズのインクリメンタル学習を可能にすること。
  • 受容 field とスタイル画像スケールがスタイライズド出力におけるスティックサイズに与える影響を分析すること。
  • 高いスタイル化品質と速度を維持しながら、柔軟なアート的制御を可能にする統合フレームワークを開発すること。

提案手法

  • 異なるスティックサイズを異なる受容 field サイズで学習できるように、ネットワークに適応的受容 field を付与する StrokePyramid モジュールを提案する。
  • スティックサイズを順次学習することで収束速度を向上させるプログレッシブトレーニング戦略を導入し、ブランチ間の知識移譲を活用する。
  • 事前にトレーニングされたモデルに対して、再トレーニングから始めずに新しいスティックサイズを追加できるインクリメンタルトレーニング戦略を開発する。
  • 実行時制御メカニズムを採用し、1つの出力画像内で連続的なスティックサイズの変化と空間的に変化するスティックサイズを可能にする。
  • スタイライズド結果におけるスティックサイズに影響を与える主要因として、受容 field サイズとスタイル画像スケールを明示的に扱う。
  • 各ブランチが異なる受容 field 設定を介して特定のスティックサイズを学習する、マルチブランチネットワークアーキテクチャを用いる。

実験結果

リサーチクエスチョン

  • RQ1受容 field サイズとスタイル画像スケールが、ニューラルスタイル転送出力におけるスティックサイズにどのように統合的に影響を与えるか?
  • RQ21つのモデルが再トレーニングなしに連続的かつ空間的に変化するスティックサイズの制御を達成できるか?
  • RQ3複数のスティックサイズを学習する際、収束を加速する方法は何か?
  • RQ4完全な再トレーニングなしに、トレーニング済みモデルに新しいスティックサイズを追加できるか?
  • RQ5適応的受容 field がスティックサイズ制御とスタイル化品質に与える影響は何か?

主な発見

  • プログレッシブトレーニング戦略により、各スティックサイズを個別にトレーニングする場合と比較して収束時間が短縮され、ブランチ間の知識移譲のおかげで学習が高速化される。
  • インクリメンタルトレーニング戦略により、再トレーニングから始めずに新しいスティックサイズを追加できるが、その際のトレーニング時間は大幅に短縮される。
  • 提案手法の平均スタイル損失は、[35]のような最先端手法と同等であり、平均コンテンツ損失はわずかに低くなる。
  • 1台のNVIDIA Quadro M6000を用いて、1024×1024画像あたり平均0.09秒のリアルタイム推論を達成する。
  • モデルサイズはたったの0.99 MBであり、リソース制約のある環境へのデプロイに適している。
  • 本手法は、1つのモデルで連続的かつ空間的なスティックサイズ制御を達成した最初の手法であり、同じ出力画像の異なる領域に異なるスティックサイズを実現可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。