[論文レビュー] Old Photo Restoration via Deep Latent Space Translation
本稿では、実写画像、合成ペア、クリーンな参照画像を活用して重度に劣化した古い写真を復元するための深層潜在空間変換フレームワークを提案する。変分オートエンコーダーを用いて潜在空間におけるドメインを整合させ、構造的な欠陥のための部分的非局所ブロックと、高精細なポートレートを実現するための粗〜細かい顔の修正ネットワークを適用し、実世界の古い写真において最先端の知覚的品質を達成した。
We propose to restore old photos that suffer from severe degradation through a deep learning approach. Unlike conventional restoration tasks that can be solved through supervised learning, the degradation in real photos is complex and the domain gap between synthetic images and real old photos makes the network fail to generalize. Therefore, we propose a novel triplet domain translation network by leveraging real photos along with massive synthetic image pairs. Specifically, we train two variational autoencoders (VAEs) to respectively transform old photos and clean photos into two latent spaces. And the translation between these two latent spaces is learned with synthetic paired data. This translation generalizes well to real photos because the domain gap is closed in the compact latent space. Besides, to address multiple degradations mixed in one old photo, we design a global branch with apartial nonlocal block targeting to the structured defects, such as scratches and dust spots, and a local branch targeting to the unstructured defects, such as noises and blurriness. Two branches are fused in the latent space, leading to improved capability to restore old photos from multiple defects. Furthermore, we apply another face refinement network to recover fine details of faces in the old photos, thus ultimately generating photos with enhanced perceptual quality. With comprehensive experiments, the proposed pipeline demonstrates superior performance over state-of-the-art methods as well as existing commercial tools in terms of visual quality for old photos restoration.
研究の動機と目的
- スクラッチ、ダスト、ぼやけ、色あせなど複雑で混合された劣化を示す古い写真の復元という課題に対処すること。
- 従来の手法が一般化を制限する、合成学習データと実際の古い写真との間のドメインギャップを克服すること。
- 知覚的品質にとって重要でありながら、既存の手法でしばしば十分に保持されない顔の詳細の復元を向上させること。
- 非構造的(例:ノイズ)および構造的(例:スクラッチ)欠陥を同時に処理できる統合フレームワークを構築すること。
- 実世界の、現実の状況下の古い写真において、最先端の手法や商業ツールを上回る視覚的品質を達成すること。
提案手法
- 実際の古い写真、合成された劣化画像、それに該当するクリーンな真値画像を用いた三重ドメイン変換フレームワークを導入する。
- 実際の古い写真とクリーンな画像を共通の潜在空間にマップする2つの変分オートエンコーダー(VAE)を訓練し、ドメインシフトを低減する。
- 劣化画像とクリーン画像の潜在空間間のマッピングを学習する合成画像間変換ネットワークを導入し、実データへの一般化を可能にする。
- スクラッチやダストのような構造的欠陥のインpaintingに効果的に機能するため、潜在空間における長距離依存関係を捉える部分的非局所ブロックを設計する。
- 階層的空間適応的条件付けを備えた別個の粗〜細かいジェネレータを用い、顔領域を精緻に修正し、アイデンティティとテクスチャを保持する。
- 顔の修正ネットワークを主な復元パイプラインと共同で訓練することで、分布バイアスを低減し、現実性を向上させる。
実験結果
リサーチクエスチョン
- RQ1潜在空間変換フレームワークは、合成データから実世界の複雑な劣化を示す古い写真への一般化を効果的に可能にするか?
- RQ2モデルは、ノイズなどの非構造的劣化とスクラッチなどの構造的劣化を同時に処理できるか?
- RQ3顔専用の修正ネットワークは、元の構造やアイデンティティを損なわず、知覚的品質を向上させられるか?
- RQ4ジェネレータにおける階層的空間インジェクションは、単一スケールの条件付けよりも顔再構築に優れた結果をもたらすか?
- RQ5共通のVAEによるドメイン整合化は、ピクセルレベルの直接変換と比較して性能をどのように向上させるか?
主な発見
- 提案手法は、最先端の手法や商業ツールと比較して、実際の古い写真において優れた視覚的品質を達成しており、顔の詳細回復において特に顕著である。
- ドメイン整合のための共有VAEの使用は、合成データから実データへの変換で一般的に見られるドメインシフト問題を顕著に低減し、一般化性能を向上させる。
- 部分的非局所ブロックは、グローバルなコンテキストを活用することで、構造的欠陥のインpaintingに効果的に機能し、より構造的に整合性のある再構築を実現した。
- 階層的空間インジェクションを備えた粗〜細かい顔の修正により、単一スケールのインジェクションやベースラインのGANと比較して、より現実的でアイデンティティを保持した顔が再構築された。
- 合成データセットにおける定量的評価では、階層的インジェクションがFID、LPIPS、PSNR、SSIMのスコアで最良を記録し、単一スケールのベースラインを上回った。
- 複雑な照明アーティファクトの処理においては、訓練データが不十分なため限界があることが示され、より多様なデータや照明効果の明示的モデリングの必要性が示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。