[論文レビュー] Unpaired Image Super-Resolution using Pseudo-Supervision
本論文は、ペア化された訓練データの制限を克服するための擬似教師付き手法を用いた非ペア画像超解像法を提案する。ネットワークを、カーネル/ノイズ除去のためのCycleGANベースの補正ネットワークと、HR画像から得られる合成されたクリアなLR画像を用いて訓練される擬似ペアSRネットワークに分離することで、標準的なピクセル単位の損失関数の使用が可能となり、対応するHR-LRペアを必要とせずに、実世界および合成データセットで最先端の性能を達成する。
In most studies on learning-based image super-resolution (SR), the paired training dataset is created by downscaling high-resolution (HR) images with a predetermined operation (e.g., bicubic). However, these methods fail to super-resolve real-world low-resolution (LR) images, for which the degradation process is much more complicated and unknown. In this paper, we propose an unpaired SR method using a generative adversarial network that does not require a paired/aligned training dataset. Our network consists of an unpaired kernel/noise correction network and a pseudo-paired SR network. The correction network removes noise and adjusts the kernel of the inputted LR image; then, the corrected clean LR image is upscaled by the SR network. In the training phase, the correction network also produces a pseudo-clean LR image from the inputted HR image, and then a mapping from the pseudo-clean LR image to the inputted HR image is learned by the SR network in a paired manner. Because our SR network is independent of the correction network, well-studied existing network architectures and pixel-wise loss functions can be integrated with the proposed framework. Experiments on diverse datasets show that the proposed method is superior to existing solutions to the unpaired SR problem.
研究の動機と目的
- ペア化されたHR-LR訓練データが利用できない状況における実世界画像の超解像の課題に対処すること。
- 分布シフトやピクセル単位の教師信号の欠如に起因する既存の非ペアSR手法の制限を克服すること。
- 非ペア設定において、広く用いられているSRネットワークおよびピクセル単位の損失関数の使用を可能にすること。
- 複雑で未知のプロセスによって劣化した実世界画像における性能向上を図ること。
提案手法
- 本手法は、実際のLR画像をクリアなLR画像に変換するためのCycleGANベースの非ペアカーネル/ノイズ補正ネットワークを用いる。
- 補正ネットワークは、双方向のサイクル整合性損失を介して、HR画像からも擬似クリアなLR画像を生成する。
- 別個のSRネットワークをペア化された設定で訓練し、擬似クリアなLR画像からHR画像を再構築する。これにより、標準的なピクセル単位の損失関数の使用が可能になる。
- 全体のネットワークは、サイクル整合性損失、アイデンティティ損失、および幾何的アンサンブル損失を含む組み合わせ損失を用いてエンドツーエンドで訓練可能である。
- 幾何的アンサンブル損失($\mathcal{L}_{geo}$)は、再構築画像における構造的一致性を保証する。
- 補正とSRのタスクを分離することで、既存のSRアーキテクチャおよび損失関数との統合が可能になる。
実験結果
リサーチクエスチョン
- RQ1GANベースの非ペアSR手法は、ペア化されたデータを必要とせずに、従来の間接的・直接的アプローチを上回る性能を達成できるか?
- RQ2HRデータから得られる合成クリアLR画像による擬似教師付き学習により、非ペア設定において標準的なSRネットワークの有効な訓練が可能になるか?
- RQ3双方向補正ネットワークの使用により、実画像と生成画像の間の分布シフトが低減されるか?
- RQ4ピクセル単位の損失と幾何的整合性損失の統合により、非ペアSRにおける知覚的品質と構造的一致性が向上するか?
主な発見
- AIM 2019 実世界超解像チャレンジ(トラック2)において、本手法はPSNR 22.88、SSIM 0.6612、LPIPS 0.4539を達成し、ZSSR、ESRGAN、Lugmayrら[32]を上回った。
- 追加の訓練を経て、PSNR 23.01、SSIM 0.6655、LPIPS 0.4567に向上し、堅牢性とスケーラビリティを示した。
- WiderFaceから得た実世界の顔画像において、本手法は細部を良好に保持し、RL-restore や ZSSR よりも優れたアーチファクト除去を実現し、最も視覚的に自然な結果を得た。
- DOTAの航空画像において、本手法は幾何的一致性とオブジェクト構造の維持を図り、特に幾何的アンサンブル損失($\mathcal{L}_{geo}$)を用いた場合に顕著であった。
- アブレーションスタディにより、幾何的アンサンブル損失が構造的一致性を顕著に向上させ、再構築における幾何的不整合を低減することが確認された。
- 本手法は、合成劣化画像、実顔画像、実航空画像を含む多様なデータセットで優れた結果を達成し、広範な適用可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。