Skip to main content
QUICK REVIEW

[論文レビュー] Towards Ultra-Resolution Neural Style Transfer via Thumbnail Instance Normalization

Zhe Chen, Wenhai Wang|arXiv (Cornell University)|Mar 22, 2021
Advanced Image Processing Techniques被引用数 4
ひとこと要約

本稿では、任意解像度の画像(例:10000×10000)をパッチに分割し、スタイルの一貫性を維持するための新規「タイニーマップインスタンス正規化(TIN)」層を導入することで、超高解像度ニューラルスタイル転送を実現するURSTという新しいフレームワークを提案する。本手法は、従来手法と比較して15倍のメモリ削減を達成し、再訓練を必要とせず、大ぶりなブラシストロークを実現するためのストローク知覚損失を導入することで、最先端の性能を達成している。

ABSTRACT

We present an extremely simple Ultra-Resolution Style Transfer framework, termed URST, to flexibly process arbitrary high-resolution images (e.g., 10000x10000 pixels) style transfer for the first time. Most of the existing state-of-the-art methods would fall short due to massive memory cost and small stroke size when processing ultra-high resolution images. URST completely avoids the memory problem caused by ultra-high resolution images by (1) dividing the image into small patches and (2) performing patch-wise style transfer with a novel Thumbnail Instance Normalization (TIN). Specifically, TIN can extract thumbnail features' normalization statistics and apply them to small patches, ensuring the style consistency among different patches. Overall, the URST framework has three merits compared to prior arts. (1) We divide input image into small patches and adopt TIN, successfully transferring image style with arbitrary high-resolution. (2) Experiments show that our URST surpasses existing SOTA methods on ultra-high resolution images benefiting from the effectiveness of the proposed stroke perceptual loss in enlarging the stroke size. (3) Our URST can be easily plugged into most existing style transfer methods and directly improve their performance even without training. Code is available at https://git.io/URST.

研究の動機と目的

  • 超高解像度画像処理における従来のニューラルスタイル転送手法のメモリ制限と小さなブラシストロークの問題に対処すること。
  • フル画像処理を避けることで、標準的なGPUで任意解像度のスタイル転送を可能にすること。
  • パッチ単位のアプローチにおいてしばしば損なわれる、パッチ間の視覚的整合性を維持すること。
  • より大きな、より知覚的に快適なブラシストロークを促進することで、超高解像度出力におけるスタイリング品質を向上させること。

提案手法

  • GPUメモリ消費を低減するために、超高解像度コンテンツ画像を小さな非重複パッチに分割する。
  • 各パッチの低解像度タイニーマップから正規化統計(平均と分散)を計算する新しい「タイニーマップインスタンス正規化(TIN)」層を導入する。
  • 各パッチの特徴を、そのパッチのタイニーマップから得た統計に基づいてTINで正規化し、画像全体にわたる一貫性あるスタイルを確保する。
  • ネットワークがより大きな、疎なブラシストロークを学習するよう促すために、補助損失としてストローク知覚損失($\mathcal{L}_{\rm sp}$)を組み込む。
  • パッチ単位のスタイリングパイプラインを採用:分割 → TINと$\mathcal{L}_{\rm sp}$を用いたスタイリング → パッチを合成してフル解像度出力へ。
  • 再訓練を必要とせず、ほとんどの既存のインスタンス正規化(IN)またはインスタンスワイズ正規化(IW)ベースのスタイル転送モデルと即座に統合可能である。

実験結果

リサーチクエスチョン

  • RQ1標準的なGPU上で、メモリ制限を超えないように超高解像度スタイル転送を実現できるか?
  • RQ2大規模画像をパッチ単位で処理する際、パッチ間のスタイルの一貫性をどのように維持できるか?
  • RQ3スタイリング出力におけるストロークサイズを、高解像度結果における密集したテクスチャアーチファクトを低減する効果的に拡大できるか?
  • RQ4提案されたTIN層は、高解像度入力に対して、フル画像インスタンス正規化の安定的かつ正確な近似を提供するか?
  • RQ5スタイリング品質をモデルアーキテクチャの変更なしに向上させるために、ストローク知覚損失は有効に機能するか?

主な発見

  • URSTは、先行研究の最先端手法(Wang et al., 2020)と比較して15倍のメモリ削減を達成し、10000×10000の画像処理において、1.94GBのGPUメモリで実行可能であるのに対し、ベースラインは30.25GBを要する。
  • 本フレームワークは、12000×8000ピクセル(96メガピクセル)の画像を、単一の12GB GPUで2.5GBのGPUメモリのみで処理できた。
  • タイニーマップサイズが少なくとも1024×1024ピクセルであるTINは、フル画像インスタンス正規化と非常に近い正規化統計を生成し、高品質なスタイリングを保証する。
  • ストローク知覚損失により、ブラシストロークのサイズが顕著に増大し、ベースライン手法と比較してより自然で視覚的に快適な出力が得られた。
  • URSTは再訓練を必要とせず、多数の既存のスタイル転送モデルにおいて性能を向上させ、強力な汎化性とプラグアンドプレイ互換性を示した。
  • 本手法は、小さなストロークアプローチで一般的な密集したテクスチャアーチファクトを回避する、大ぶりで疎なブラシストロークを有する高品質なスタイリング結果を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。