Skip to main content
QUICK REVIEW

[論文レビュー] JSI-GAN: GAN-Based Joint Super-Resolution and Inverse Tone-Mapping with Pixel-Wise Task-Specific Filters for UHD HDR Video

Soo Ye Kim, Jihyong Oh|arXiv (Cornell University)|Sep 10, 2019
Advanced Image Processing Techniques参考文献 20被引用数 4
ひとこと要約

本稿では、UHD HDR動画における詳細なディテールとコントラストの強化を目的とした、タスク固有のサブネットワークとピクセルワイドな1次元分離可能フィルタおよび2次元局所フィルタを用いたGANベースのフレームワーク、JSI-GANを提案する。本手法は、新規のディテール GAN 損失および特徴マッチング損失を導入することで、安定的かつ知覚的に現実的な高解像度 HDR 再構成を実現し、先行手法と比較して0.41 dBのPSNR向上を達成した。

ABSTRACT

Joint learning of super-resolution (SR) and inverse tone-mapping (ITM) has been explored recently, to convert legacy low resolution (LR) standard dynamic range (SDR) videos to high resolution (HR) high dynamic range (HDR) videos for the growing need of UHD HDR TV/broadcasting applications. However, previous CNN-based methods directly reconstruct the HR HDR frames from LR SDR frames, and are only trained with a simple L2 loss. In this paper, we take a divide-and-conquer approach in designing a novel GAN-based joint SR-ITM network, called JSI-GAN, which is composed of three task-specific subnets: an image reconstruction subnet, a detail restoration (DR) subnet and a local contrast enhancement (LCE) subnet. We delicately design these subnets so that they are appropriately trained for the intended purpose, learning a pair of pixel-wise 1D separable filters via the DR subnet for detail restoration and a pixel-wise 2D local filter by the LCE subnet for contrast enhancement. Moreover, to train the JSI-GAN effectively, we propose a novel detail GAN loss alongside the conventional GAN loss, which helps enhancing both local details and contrasts to reconstruct high quality HR HDR results. When all subnets are jointly trained well, the predicted HR HDR results of higher quality are obtained with at least 0.41 dB gain in PSNR over those generated by the previous methods.

研究の動機と目的

  • 従来の低解像度・標準ダイナミックレンジ(SDR)動画を、UHD HDR放送向けに高解像度・高ダイナミックレンジ(HDR)動画に変換する課題に対処すること。
  • 単純なL2損失と共有畳み込みフィルタを用いるCNNベースの手法が、微細なディテールや局所コントラストを十分に保持できないという限界を克服すること。
  • スーパーレゾリューションと逆トーンマッピングを同時に実行する統合学習フレームワークを設計し、知覚的品質と客観的指標の両方を向上させること。
  • 新規のディテール GAN 損失および特徴マッチング損失を導入することで、この複雑なタスクにおける GAN の安定した学習を可能にすること。
  • スケーラブルで適応可能なピクセルワイドなフィルタを設計し、アップスケーリング倍率に応じて調整可能であり、画像の基本層とディテール層に特化した処理を可能にすること。

提案手法

  • 生成器は、画像再構成(IR)、ディテール回復(DR)、局所コントラスト強化(LCE)の3つのタスク固有サブネットワークから構成され、それぞれがその固有の役割に最適化されている。
  • DR サブネットワークは、入力のディテール層に高周波成分および微細なテクスチャを回復するために、ピクセルワイドな1次元分離可能フィルタを用いる。
  • LCE サブネットワークは、基本層にピクセルワイドな2次元局所フィルタを適用し、自然な外観を保ちながら局所コントラストを強化する。
  • 処理の前段階として、ガイドフィルタを用いて各低解像度 SDR フレームを基本層とディテール層に分解する。
  • リアルなディテール生成を強制するため、新規のディテール GAN 損失を導入し、訓練の安定化と客観的指標の向上を図る特徴マッチング損失も採用する。
  • すべてのサブネットワークは、敵対的損失、ディテール GAN 損失、再構成損失の組み合わせを用いて共同で学習され、知覚的品質と忠実度のバランスをとる。

実験結果

リサーチクエスチョン

  • RQ1GANベースのフレームワークは、スーパーレゾリューションと逆トーンマッピングを統合的に最適化し、知覚的および客観的性能を向上させることができるか?
  • RQ2共有畳み込みフィルタと比較して、ピクセルワイドな1次元分離可能フィルタおよび2次元局所フィルタは、ディテール回復とコントラスト強化においてどのように向上をもたらすか?
  • RQ3専用のディテール GAN 損失を導入することで、HR HDR 出力における微細なテクスチャやエッジのリアルさが向上するか?
  • RQ4特徴マッチング損失は、GANベースの画像生成で一般的に見られる客観的指標(例:PSNR)の低下を緩和できるか?
  • RQ5適応可能なフィルタを備えたタスク固有サブネットワークは、統合的な共有ネットワークに比べて、ジョイント SR-ITM タスクにおいてどの程度優れた性能を示すか?

主な発見

  • JSI-GAN は、UHD HDR 動画再構成において、先行手法と比較して0.41 dBのPSNR向上を達成し、優れた客観的性能を示した。
  • 提案されたディテール GAN 損失は、ぼやけたまたはアーチファクトを含む出力と比較して、微細なテクスチャやエッジのリアルさが顕著に向上していることが定性的に示された。
  • L2損失のみを用いるモデルと比較して、特に背景部の均一領域において、リバーブや色アーチファクトを効果的に低減した。
  • アップスケーリング倍率にかかわらず高い性能を維持しており、タスク固有のフィルタ学習に伴い、パラメータ数が比例的に増加した。
  • NVIDIA TITAN Xp GPU 上での推論時間は、リアルタイム応用に十分なほど効率的であり、パラメータ数はアップスケーリング倍率に比例して増加した。
  • アブレーションスタディの結果、ディテール GAN 損失および特徴マッチング損失の両方が、高品質な知覚的再構成と安定した訓練を達成するために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。