[論文レビュー] Universal Face Restoration With Memorized Modulation
本稿では、ノイズと自己教師波ドレットメモリからのアダプティブな注目メカニズムを用いて、多様な低品質な顔画像を復元する、普遍的顔復元フレームワークRMM(Memorized Modulationを用いた復元)を提案する。学習可能なノイズ事前知識、ウェーブレットベースの高周波成分テクスチャメモリ、およびマルチレベル正規化マップ(AdaAO、AdaALN、AdaAIN)を統合することで、合成および実世界の劣化条件下でも最先端の性能を達成し、コマics、油絵、NIR画像など多様なドメインにわたる強力な一般化性能を示す。
Blind face restoration (BFR) is a challenging problem because of the uncertainty of the degradation patterns. This paper proposes a Restoration with Memorized Modulation (RMM) framework for universal BFR in diverse degraded scenes and heterogeneous domains. We apply random noise as well as unsupervised wavelet memory to adaptively modulate the face-enhancement generator, considering attentional denormalization in both layer and instance levels. Specifically, in the training stage, the low-level spatial feature embedding, the wavelet memory embedding obtained by wavelet transformation of the high-resolution image, as well as the disentangled high-level noise embeddings are integrated, with the guidance of attentional maps generated from layer normalization, instance normalization, and the original feature map. These three embeddings are respectively associated with the spatial content, high-frequency texture details, and a learnable universal prior against other blind image degradation patterns. We store the spatial feature of the low-resolution image and the corresponding wavelet style code as key and value in the memory unit, respectively. In the test stage, the wavelet memory value whose corresponding spatial key is the most matching with that of the inferred image is retrieved to modulate the generator. Moreover, the universal prior learned from the random noise has been memorized by training the modulation network. Experimental results show the superiority of the proposed method compared with the state-of-the-art methods, and a good generalization in the wild.
研究の動機と目的
- ぼかし、ノイズ、圧縮などの未知の劣化パターンに起因するブラインド顔復元(BFR)の課題に対処する。
- 高品質なリファレンスや外部モデルに依存する手法の限界を克服し、推論時に高品質なリファレンスや外部モデルを必要としない。
- 実世界、コマics、芸術的顔画像を含む多様なドメインに一般化可能な統一フレームワークを開発する。
- ウェーブレット変換された特徴量から高周波成分テクスチャ詳細を記憶・取得するメモリ拡張機構を導入する。
- 注目誘導による特徴量モードレーションを通じて、空間的コンテンツ、テクスチャ詳細、普遍的ノイズ事前知識を統合的にモデリングし、復元忠実度を向上させる。
提案手法
- オリジナル特徴量、レイヤー正規化特徴量、インスタンス正規化特徴量から導出される3つのアダプティブ注目マップ(AdaAO、AdaALN、AdaAIN)を用いたRMMモジュール(RM³)を提案し、特徴量モードレーションをガイドする。
- 低レベルの空間的特徴量(コンテンツ)、高周波成分ウェーブレット係数(テクスチャ)、分離されたノイズ埋め込み(普遍的事前知識)の3つの埋め込みを統合し、マルチレベルの復元制御を実現する。
- ウェーブレットスタイルのコードを値として記憶し、低解像度の空間的特徴量をキーとして用いるWavelet Memory Module(WMM)を実装し、推論時に類似空間特徴量に基づいて一致する高周波成分詳細を取得可能にする。
- 固定された潜在次元を持つランダムノイズを、解像度に依存しない普遍的事前知識として用い、学習可能なモードレーションネットワークを介して生成器をモードレートする。
- 注目マップを用いて複数のデコーダーステージでアダプティブ特徴量モードレーションを適用し、構造的整合性とテクスチャ詳細再構築のバランスを動的に制御する。
- 敵対的損失と知覚的損失を用いて、エンド・トゥ・エンドでモデルを学習し、推論時に空間的特徴量の類似度に基づいてメモリの検索を実行する。
実験結果
リサーチクエスチョン
- RQ1高品質なリファレンス画像に依存せずに、未知の多様な劣化パターンにわたる普遍的顔復元フレームワークが、優れた性能を達成できるか?
- RQ2自己教師的ウェーブレットメモリは、ブラインド顔復元の過程で高周波成分テクスチャ詳細を効果的に保持できるか?
- RQ3学習可能な解像度に依存しないノイズ事前知識は、ブラインド顔復元における一般化性能をどの程度向上させるか?
- RQ4オリジナル、レイヤー正規化、インスタンス正規化からのマルチレベル注目マップは、構造的復元とテクスチャ復元のバランスにどのように寄与するか?
- RQ5提案された記憶型モードレーション機構は、コマics、鉛筆画、NIR画像などの多様なドメインに一般化可能か?
主な発見
- FF-HQデータセットにおいて、RMMは全バリエーションの中で最高のFID(100.61)、KID(8.24)、NIQE(4.54)スコアを達成し、より深いVGG層からのウェーブレット分解を用いたモデルを上回る性能を示した。
- 入力画像のウェーブレットパッケージ分解を用いたバージョン(RMM)は、最低のNIQE(4.54)と最高のFID(100.61)を記録し、優れた知覚的品質と忠実度を示した。
- 浅い層特徴量(例:conv1_1)を用いたウェーブレット分解では、NIQEは最良(4.29)であったが、FID(109.41)とKID(9.29)は悪化し、知覚的品質と構造的正確性のトレードオフが生じた。
- 深い層(例:ResNet18の層0, 2, 4, 6)からのクエリベクトルは、RMMよりも高いFIDとKIDスコア(106.9–107.33)を示し、浅い層からのクエリは空間的特徴量マッチングにあまり効果的でないことが示された。
- アブレーションスタディにより、ノイズモードレーション($w/o ext{ }Z_N$)とウェーブレットメモリ($w/o ext{ }Z_W$)の両方が性能を著しく低下させることを確認し、訓練および推論における両者の不可欠な役割を裏付けた。
- コマicsやNIR画像などの多様なドメインでは、コマics顔が実顔と類似した目の大きさを持つ場合、スタイライズド特徴量が消失するなど失敗事例が発生する。また、極端な化粧も顔部品の復元に誤差を引き起こす。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。