Skip to main content
QUICK REVIEW

[論文レビュー] High-Resolution Photorealistic Image Translation in Real-Time: A Laplacian Pyramid Translation Network

Jie Liang, Hui Zeng|arXiv (Cornell University)|May 19, 2021
Advanced Image Processing Techniques参考文献 32被引用数 7
ひとこと要約

本稿では、ラプラシアンピラミッド分解を用いて低周波属性(例:照明、色調)と高周波詳細を分離する、リアルタイムで高解像度の写真的画像対画像翻訳手法であるLaplacian Pyramid Translation Network(LPTN)を提案する。低解像度の低周波成分に軽量なネットワークを適用し、高周波成分を段階的にマスクすることで精緻化することで、単一GPU上で4Kリアルタイム推論を実現するとともに、写真的品質やスタイル転送性能において最先端の手法と同等またはそれを上回る性能を達成する。

ABSTRACT

Existing image-to-image translation (I2IT) methods are either constrained to low-resolution images or long inference time due to their heavy computational burden on the convolution of high-resolution feature maps. In this paper, we focus on speeding-up the high-resolution photorealistic I2IT tasks based on closed-form Laplacian pyramid decomposition and reconstruction. Specifically, we reveal that the attribute transformations, such as illumination and color manipulation, relate more to the low-frequency component, while the content details can be adaptively refined on high-frequency components. We consequently propose a Laplacian Pyramid Translation Network (LPTN) to simultaneously perform these two tasks, where we design a lightweight network for translating the low-frequency component with reduced resolution and a progressive masking strategy to efficiently refine the high-frequency ones. Our model avoids most of the heavy computation consumed by processing high-resolution feature maps and faithfully preserves the image details. Extensive experimental results on various tasks demonstrate that the proposed method can translate 4K images in real-time using one normal GPU while achieving comparable transformation performance against existing methods. Datasets and codes are available: https://github.com/csjliang/LPTN.

研究の動機と目的

  • 高解像度画像における既存の写真的画像対画像翻訳(I2IT)手法の非効率性を是正する。これは、高解像度特徴マップにおける重い畳み込み演算に起因する。
  • 高解像度特徴処理に依存する従来のオートエンコーダー型およびGAN型I2ITモデルにおける計算ボトルネックを克服する。
  • 細部のコンテンツを保持しつつ、写真的スタイル転送を実現する4K画像でのリアルタイム推論を可能にする。
  • ラプラシアンピラミッドの周波数帯構造を活用して、ドメイン固有の属性(例:時間帯、季節)とコンテンツ詳細を分離する。
  • 再構成忠実度を維持し、教師なし・敵対的学習をサポートする、軽量でエンドツーエンドで訓練可能なフレームワークを開発する。

提案手法

  • 閉形式のラプラシアンピラミッド分解を適用し、高解像度入力画像を複数スケールの周波数帯(1つの低周波成分と、解像度が段階的に低下する複数の高周波成分)に分割する。
  • 低解像度で処理される低周波成分を、軽量な残差ネットワークで翻訳することで、計算コストを最小限に抑えつつ、照明や色調などのグローバル属性を保持する。
  • 最小の高周波成分に対してマスクを学習し、双線形補間と2層の畳み込み層を用いてアップサンプリングすることで、高周波成分を段階的に精緻化するプログレッシブマスク戦略を設計する。
  • 敵対的損失を用いて、写真的品質とコンテンツの一貫性を確保するため、教師なしでエンドツーエンドにネットワーク全体を訓練する。
  • 逆ラプラシアンピラミッド再構成を用いて、翻訳された低周波成分と精緻化された高周波成分を組み合わせ、最終出力を再構成する。
  • 高周波成分間の空間相関を活用することで計算を削減する。高解像度マップにおける重い畳み込みを避けるために、最小の高周波マスクのみを小さなネットワークで予測する。

実験結果

リサーチクエスチョン

  • RQ1ラプラシアンピラミッド分解により、属性操作と詳細精緻化を分離することで、効率的かつ高解像度の写真的画像翻訳が可能になるか?
  • RQ2低周波成分の翻訳と、プログレッシブマスク戦略による高周波成分の適応的精緻化により、画像品質を損なわず計算コストを削減できるか?
  • RQ3提案手法は、4K画像においてリアルタイム推論を実現できるか? また、最先端のI2ITモデルと比較して競争力のある性能を維持できるか?
  • RQ4ドメイン固有の属性(例:日中・夜間、季節)とコンテンツ詳細の分離が、翻訳の忠実度と写真的品質にどのように影響するか?
  • RQ5標準的なGAN型またはオートエンコーダー型I2IT手法と比較して、プログレッシブマスク戦略は、細粒度のテクスチャをどれほど効果的に保持し、アーチファクトを低減できるか?

主な発見

  • LPTNは、1台のデスクトップGPUを用いて4K画像でリアルタイム推論を達成し、L=4の場合、1080p画像におけるCycleGANと比較して約×80の高速化を実現した。
  • L=5段階のラプラシアンピラミッド分解を用いることで、4K解像度の画像においてもリアルタイムで動作する。
  • ユーザースタディーでは、昼間→夜間翻訳において、写真的品質の好みが78.3%、美的品質が57.5%にのぼり、CycleGAN(16.4%および21.3%)や他のベースラインと顕著に優れた。
  • 定量的評価では、昼間と夜間の画像間の高周波成分間のMSEが、低周波成分の約1/71および1/65にとどまり、属性変化が主に低周波成分に支配されていることを示している。
  • LPTNは高い再構成忠実度を維持し、特に広い均一領域を含むシーンで顕著な構造的歪みやアーチファクトを回避する。これは、CycleGAN や UNIT などの手法と比較して顕著である。
  • プログレッシブマスク戦略により、2層の畳み込み層と双線形補間のみで高周波成分の効率的精緻化が可能となり、高解像度マップにおける重い畳み込みを回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。