Skip to main content
QUICK REVIEW

[論文レビュー] Blind Face Restoration via Deep Multi-scale Component Dictionaries

Xiaoming Li, Chaofeng Chen|arXiv (Cornell University)|Aug 2, 2020
Advanced Image Processing Techniques参考文献 47被引用数 14
ひとこと要約

本稿では、高品質な顔画像上でK-meansを用いて学習された、深層マルチスケールコンポonent辞書を用いて、本人一致リファレンスを必要とせずに顔の復元を実行する盲目的な顔復元手法DFDNetを提案する。コンポonent固有の適応的インスタンス正規化(CAdaIN)と信頼度スコアに基づく融合機構を採用することで、入力の粗いスケールから細かいスケールへと段階的に高周波成分を転送し、本人固有のリファレンスが不要な状況でも、実際の低品質画像に対して最先端の性能を達成する。

ABSTRACT

Recent reference-based face restoration methods have received considerable attention due to their great capability in recovering high-frequency details on real low-quality images. However, most of these methods require a high-quality reference image of the same identity, making them only applicable in limited scenes. To address this issue, this paper suggests a deep face dictionary network (termed as DFDNet) to guide the restoration process of degraded observations. To begin with, we use K-means to generate deep dictionaries for perceptually significant face components (\ie, left/right eyes, nose and mouth) from high-quality images. Next, with the degraded input, we match and select the most similar component features from their corresponding dictionaries and transfer the high-quality details to the input via the proposed dictionary feature transfer (DFT) block. In particular, component AdaIN is leveraged to eliminate the style diversity between the input and dictionary features (\eg, illumination), and a confidence score is proposed to adaptively fuse the dictionary feature to the input. Finally, multi-scale dictionaries are adopted in a progressive manner to enable the coarse-to-fine restoration. Experiments show that our proposed method can achieve plausible performance in both quantitative and qualitative evaluation, and more importantly, can generate realistic and promising results on real degraded images without requiring an identity-belonging reference. The source code and models are available at \url{https://github.com/csxmli2016/DFDNet}.

研究の動機と目的

  • 本人固有の高品質リファレンス画像を必要とするリファレンスベースの顔復元手法の限界を解消すること。
  • 本人固有のリファレンスが入手不可能な実世界の状況に適応可能な柔軟で汎用性の高い顔復元フレームワークを構築すること。
  • 学習された深層辞書を用いて、視覚的に顕著な顔のコンポonent(目、鼻、口)をリファレンス候補として活用することで、復元品質を向上させること。
  • コンポonent固有の正規化と信頼度ベースの統合を用いて、劣化した入力と辞書特徴間の分布シフトを低減すること。
  • 段階的で粗いスケールから細かいスケールへの復元を可能にする、マルチスケール辞書統合を用いたプロセスを実現すること。

提案手法

  • 高品質な顔画像のマルチスケール特徴に対してK-meansクラスタリングを適用し、左目、右目、鼻、口コンポonent用の深層辞書を構築する。
  • RoIAlignを用いて顔のランドマークからコンポonent特徴を切り出し、辞書学習における空間的整合性を確保する。
  • コンポonent固有のAdaIN(CAdaIN)は、入力と辞書特徴の間のスタイル差異(例:照明、肌色)を低減するための正規化を実行する。
  • 辞書特徴転送(DFT)ブロックは、内積類似度により最も類似した辞書クラスタを特定し、学習された信頼度スコアを用いて入力特徴と統合する。
  • 複数のデコーダブロックにわたり、マルチスケール辞書を段階的に適用することで、高周波成分の粗いスケールから細かいスケールへの復元を実現する。
  • 最終的なモデルは、SFTベースの精緻化と、異なるスケールでのDFTブロックを統合したU-Netに類似したアーキテクチャを採用し、リアリズムと詳細回復を向上させる。

実験結果

リサーチクエスチョン

  • RQ1多様なアイデンティティから学習された深層コンポonent辞書は、顔復元において本人固有の高品質リファレンスの必要性を代替できるか?
  • RQ2コンポonent固有の適応的インスタンス正規化(CAdaIN)は、劣化入力と辞書特徴の間の分布シフトをどの程度効果的に補正できるか?
  • RQ3段階的でマルチスケールの辞書統合は、復元品質と詳細回復にどのような影響を及ぼすか?
  • RQ4信頼度ベースの特徴統合は、盲的な顔復元におけるロバスト性とリアリズムをどのように向上させるか?
  • RQ5提案手法は、本人固有のリファレンスが一切不要な状況でも、実世界の低品質画像に一般化可能か?

主な発見

  • VggFace2データセットにおける4倍スーパーレゾリューションにおいて、DFDNetはPSNR 27.54、SSIM 0.923を達成し、ベースラインのリファレンスベース手法を上回る性能を示した。
  • 256個の辞書クラスタを用いたモデル(Ours(#256))は、512クラスタよりも低い推論コストでほぼ最適な性能を達成し、実装に適している。
  • CAdaINを除去するとPSNRが2.0 dB以上低下し、入力と辞書特徴の間のスタイル変動を処理する上でCAdaINが果たす重要性が明確になった。
  • 信頼度スコア機構により特徴統合が向上し、アーチファクトが低減され、特に低劣化度の場合に本人の一貫性が保たれた。
  • 視覚的比較では、Ours(#256)がOurs(#16)やOurs(#64)よりもシャープで現実的で、より豊富な顔の詳細と少ない歪みを実現した。
  • 本モデルは、本人固有のリファレンスが一切不要な状況でも、実世界の劣化画像に良好に一般化され、妥当で現実的な出力を得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。