Skip to main content
QUICK REVIEW

[論文レビュー] Learning Warped Guidance for Blind Face Restoration

Xiaoming Li, Ming Liu|arXiv (Cornell University)|Apr 13, 2018
Facial Nerve Paralysis Treatment and Research被引用数 9
ひとこと要約

本稿では、歪みのない顔画像の復元を向上させるために、フローフィールド予測ネットワーク(WarpNet)を介してアライメントされたワープドガイド画像を用いるガイドド・フェイスレスタレーションネットワーク(GFRNet)を提案する。ランドマーク損失と全変動正則化を組み合わせることで、真のフローフィールドが存在しない状況下でもWarpNetを訓練可能にし、合成および実際の低品質顔画像の両方で最先端の性能を達成。顔の識別に特化した明確でリアルなディテールを再構築した、写真のようにリアルな結果を生成する。

ABSTRACT

This paper studies the problem of blind face restoration from an unconstrained blurry, noisy, low-resolution, or compressed image (i.e., degraded observation). For better recovery of fine facial details, we modify the problem setting by taking both the degraded observation and a high-quality guided image of the same identity as input to our guided face restoration network (GFRNet). However, the degraded observation and guided image generally are different in pose, illumination and expression, thereby making plain CNNs (e.g., U-Net) fail to recover fine and identity-aware facial details. To tackle this issue, our GFRNet model includes both a warping subnetwork (WarpNet) and a reconstruction subnetwork (RecNet). The WarpNet is introduced to predict flow field for warping the guided image to correct pose and expression (i.e., warped guidance), while the RecNet takes the degraded observation and warped guidance as input to produce the restoration result. Due to that the ground-truth flow field is unavailable, landmark loss together with total variation regularization are incorporated to guide the learning of WarpNet. Furthermore, to make the model applicable to blind restoration, our GFRNet is trained on the synthetic data with versatile settings on blur kernel, noise level, downsampling scale factor, and JPEG quality factor. Experiments show that our GFRNet not only performs favorably against the state-of-the-art image and face restoration methods, but also generates visually photo-realistic results on real degraded facial images.

研究の動機と目的

  • 劣化の種類(ぼやけ、ノイズ、圧縮、低解像度)が未知でモデル化されていない状況における盲目的顔画像復元の課題に対処すること。
  • ガイド画像と劣化画像のアライメントが異なる(ポーズ、表情、照明)場合に、標準的なCNNが顔の識別に特化したディテールを保持できないという限界を克服すること。
  • 入力とガイド画像の間の不一致に対処しつつ、高品質なガイド画像を活用して復元品質を向上させる統合的フレームワークの構築。
  • 真のフローフィールドが存在しない状況下で、ワーピングネットワークをエンドツーエンドで訓練可能にするために、ランドマーク損失と全変動正則化を導入すること。
  • 実世界の複雑で未知の劣化に強い性能を発揮するよう、一般化された劣化モデルを用いてモデルを学習すること。

提案手法

  • 2本のブランチからなるネットワークを提案:WarpNetは、ガイド画像を劣化観測画像のポーズと表情に合わせてワープするためのフローフィールドを予測する。
  • 劣化画像とワープドガイド画像の両方を入力とし、最終的な高品質顔画像を出力する再構築サブネットワーク(RecNet)を採用する。
  • ランドマーク損失を導入し、予測された顔のキーポoin位置を真の位置に近づけることで、真のフローフィールドが存在しない状況下でもWarpNetを監視可能にする。
  • 予測されたフローフィールドに全変動(TV)正則化を適用し、空間的な滑らかさを確保し、不自然なワープを防ぐ。
  • 再構築損失(L1/L2)と adversarial 損失を用いて、GFRNet全体を訓練し、知覚的品質とリアルさを向上させる。
  • 実世界の状況を模倣するため、ぼやけ、ダウンサンプリング、AWGN、JPEG圧縮を組み合わせた一般化された劣化モデルを用いて多様な訓練データを合成する。

実験結果

リサーチクエスチョン

  • RQ1ガイド画像と劣化画像の間でポーズ、表情、照明が著しく異なる状況下でも、ガイド画像の入力が盲目的顔画像復元の性能向上に寄与するか?
  • RQ2真のフローフィールドが存在しない状況下で、顔画像復元における画像アライメントのためのワーピングネットワークを効果的に訓練する方法は何か?
  • RQ3真のフローフィールドが存在しない状況下で、正確で滑らかなフローフィールドを学習するための監視信号(例:ランドマーク損失、TV正則化)として、どの手法が最も効果的か?
  • RQ4ガイド画像と劣化画像がアライメントされていない状況下で、直接統合するのと比較して、ワーピングサブネットワークを組み込むことで復元品質が顕著に向上するか?
  • RQ5合成された劣化データで学習したモデルは、実世界の未知で複雑な劣化に一般化可能か?

主な発見

  • WarpNet、フローロス、ランドマーク監視を備えたGFRNet(フルコンポーネント)が、PSNRおよび知覚的品質の両面で、すべての変種および最先端手法を上回る最高の性能を達成した。
  • アブレーションスタディの結果、WarpNetおよびランドマーク損失の両方が不可欠であることが確認された。両方の要素を削除すると、特にポーズや表情のアライメントにおいて顕著な性能低下が生じた。
  • Ours(Full)は、VggFace2における8倍スーパーレンジングを含むすべてのベンチマークで最高のPSNRとSSIMを達成し、ベースラインと比較してよりシャープでリアルな結果を生成した。
  • ぼやけ、ノイズ、ダウンサンプリング、JPEG圧縮を含む完全な劣化モデルで学習したモデルが、実際の低品質画像への一般化性能が最も高く、アーティファクトのない明確な出力を生成した。
  • ランダム(アライメントされていない)ガイド画像を用いても、Ours(R)は2番目に高い性能を達成しており、アイデンティティの不一致に対しても高いロバストネスを示したが、誤った微細ディテールを生成する可能性はあった。
  • 可視的比較から、Ours(Full)はOurs(-F)と比較して著しく優れたワープドガイド画像を生成しており、安定的かつ正確なワープを実現するためのフローロスの必要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。