[論文レビュー] Learning to Zoom-in via Learning to Zoom-out: Real-world Super-resolution by Generating and Adapting Degradation
この論文は、対応するLR-HR画像ペアを必要とせず、高分解能画像から現実の低分解能画像を合成するための劣化生成ネットワークを訓練し、超解像訓練中に特徴レベルのアライメントによってドメインギャップを最小化することで、新たな非ペaired現実世界超解像手法を提案する。この手法は、現実世界のデータセットにおいて最先端の性能を達成しており、ペアデータで訓練された手法をも上回っている。
Most learning-based super-resolution (SR) methods aim to recover high-resolution (HR) image from a given low-resolution (LR) image via learning on LR-HR image pairs. The SR methods learned on synthetic data do not perform well in real-world, due to the domain gap between the artificially synthesized and real LR images. Some efforts are thus taken to capture real-world image pairs. The captured LR-HR image pairs usually suffer from unavoidable misalignment, which hampers the performance of end-to-end learning, however. Here, focusing on the real-world SR, we ask a different question: since misalignment is unavoidable, can we propose a method that does not need LR-HR image pairing and alignment at all and utilize real images as they are? Hence we propose a framework to learn SR from an arbitrary set of unpaired LR and HR images and see how far a step can go in such a realistic and "unsupervised" setting. To do so, we firstly train a degradation generation network to generate realistic LR images and, more importantly, to capture their distribution (i.e., learning to zoom out). Instead of assuming the domain gap has been eliminated, we minimize the discrepancy between the generated data and real data while learning a degradation adaptive SR network (i.e., learning to zoom in). The proposed unpaired method achieves state-of-the-art SR results on real-world images, even in the datasets that favor the paired-learning methods more.
研究の動機と目的
- 超解像における合成された低分解能画像と現実世界の低分解能画像の間のドメインギャップを解消すること。
- 現実世界の超解像において、ペアで整列されたLR-HR画像データを必要としないこと。
- 非ペアのLRおよびHR画像セットのみを用いて、現実の画像を超解像する方法を開発すること。
- 敵対的学習およびサイクル整合性学習を用いて、生成された低分解能画像と現実の低分解能画像の差を最小化すること。
- 実画像と生成画像の分布間のネットワーク応答をアライメントすることで、耐性および一般化性能を向上させること。
提案手法
- サイクル-GANに基づく劣化生成ネットワークを訓練し、高分解能画像から現実的な低分解能画像を合成する。これは、現実世界の劣化プロセスを模倣する。
- ネットワークは敵対的損失およびサイクル整合性損失を用い、ペアの教師信号を必要とせずに、現実の低分解能画像の分布を学習する。
- 実画像と生成画像の間の特徴レベルのドメイン差を最小化することで、劣化適応型超解像ネットワークを訓練する。
- 実画像と生成画像の両方の入力に対して、超解像ネットワークの中間および出力特徴をアライメントすることで、特徴レベルのアライメントを実現する。
- 本手法は教師なし・非ペア設定で動作し、画像ペア化や事前登錏に依存しない。
- 本フレームワークは、標準的および非オーバーラップ学習設定の両方で評価され、耐性をテストする。
実験結果
リサーチクエスチョン
- RQ1ペアまたは整列されたLR-HR画像データが存在しない状況でも、現実世界の超解像を効果的に学習できるか?
- RQ2劣化生成ネットワークは、現実世界の低分解能画像の複雑な分布を正確にモデル化できるか?
- RQ3特徴レベルでのドメインギャップ最小化は、現実世界の画像における超解像性能を向上させるか?
- RQ4提案手法は、現実世界のデータセットにおいて、ペア学習および不整列学習のベースラインと比較して優れているか?
- RQ5重複するコンテンツがないLRおよびHRセットにおいても、本手法は多様な現実世界の劣化パターンに一般化可能か?
主な発見
- 提案手法は、RCAN-Real や ESRGAN-Bic といったペアデータで訓練されたモデルをも上回る、現実世界の超解像ベンチマークで最先端の性能を達成した。
- 視覚的比較では、特にテキストや細かい模様のような複雑な領域で、よりシャープなテクスチャとより少ないアーティファクトを生成していることが示された。
- 劣化生成ネットワークは、現実世界の低分解能画像の分布に近い分布を持つ実際の劣化特性を効果的に捉えており、生成された低分解能画像は現実の低分解能画像と類似している。
- コンテンツが重複しない非オーバーラップ学習設定下でも、本手法は強い性能を維持しており、耐性を示している。
- RealSR、SR-RGB、City100 データセットにおける定量的評価結果は、CinCGAN などの先行非ペア手法に比べてPSNRおよびSSIMの継続的向上を確認した。
- 合成バイキューブ劣化で訓練されたベースラインモデルと比較して、ぼやけや構造的アーティファクトが低減されており、現実世界データへの一般化性能が向上していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。