Skip to main content
QUICK REVIEW

[論文レビュー] Learning Residual Images for Face Attribute Manipulation

Wei Shen, Rujie Liu|arXiv (Cornell University)|Dec 16, 2016
Face recognition and analysis参考文献 28被引用数 11
ひとこと要約

本稿では、元の顔と操作された顔の差分に当たる残差画像を学習することで、GANベースの顔属性操作手法を提案する。これにより、顔の識別に必要な詳細を保持しつつ、局所的かつ効率的な修正が可能となる。逆操作(例:眼鏡の追加と除去)の間で二重学習を活用することで、生成品質が向上し、顔の構造が保たれる。眼鏡除去後の顔面特徴点検出精度の向上により、有効性が検証された。

ABSTRACT

Face attributes are interesting due to their detailed description of human faces. Unlike prior researches working on attribute prediction, we address an inverse and more challenging problem called face attribute manipulation which aims at modifying a face image according to a given attribute value. Instead of manipulating the whole image, we propose to learn the corresponding residual image defined as the difference between images before and after the manipulation. In this way, the manipulation can be operated efficiently with modest pixel modification. The framework of our approach is based on the Generative Adversarial Network. It consists of two image transformation networks and a discriminative network. The transformation networks are responsible for the attribute manipulation and its dual operation and the discriminative network is used to distinguish the generated images from real images. We also apply dual learning to allow transformation networks to learn from each other. Experiments show that residual images can be effectively learned and used for attribute manipulations. The generated images remain most of the details in attribute-irrelevant areas.

研究の動機と目的

  • 顔画像を所望の属性値へ変更する逆問題を解決すること。これは、画像から属性を予測するのではなく、顔画像を特定の属性値へ操作することを目的とする。
  • 顔の識別に寄与する詳細(例:髪の毛、肌の質感)を、オートエンコーダーに基づく手法やGAN単体の手法でよく見られる劣化を避けて保持すること。
  • 全体画像の生成ではなく、属性固有の領域に注目することで、残差画像学習により、学習効率と画像品質を向上させること。
  • 加算と除去といった逆操作(例:眼鏡の追加と除去)の間で、特徴の整合性と現実性を高める二重学習フレームワークを用いて、相互に監視を可能とすること。
  • 特に眼鏡除去の文脈において、顔面特徴点検出精度を代理指標として用いることで、手法の有効性を定量的に検証すること。

提案手法

  • 本手法は、顔属性操作を、入力画像と目的の操作済み画像との間のピクセル単位の差分に当たる残差画像を学習することとして定式化する。
  • G₀とG₁の2つの画像変換ネットワークを訓練し、それぞれが主な操作(例:眼鏡の追加)と双対的な操作(例:眼鏡の除去)を学習する。各ネットワークは入力画像に対する残差画像を出力する。
  • 最終的な操作済み画像は、入力画像と予測された残差画像の要素ごとの和によって生成される。
  • 共有の識別ネットワークDは、G₀から生成された画像、G₁から生成された画像、属性ラベルが陽性の実画像、属性ラベルが陰性の実画像の4つのカテゴリに分類する。
  • G₀とG₁が互いに逆操作となるように、二重学習を適用することで、訓練中に相互に監視しあい、特徴の整合性を向上させる。
  • 損失関数には、 adversarial loss、二重学習によるサイクル整合性損失、および識別的詳細の保持とリアルさの向上を目的とした感知損失を組み合わせる。

実験結果

リサーチクエスチョン

  • RQ1残差画像学習は、顔の識別に重要な領域への影響を最小限に抑えつつ、属性固有の変更を効果的に捉えられるか?
  • RQ2加算と除去といった逆操作間の二重学習は、生成画像の品質と一貫性を向上させるか?
  • RQ3本手法は、髪の毛や肌の質感といった顔の詳細を、VAE-GAN手法で見られる劣化を避けて保持できるか?
  • RQ4眼鏡除去によって、顔面特徴点検出精度がどの程度向上するか。また、この指標は操作品質の妥当な定量的指標として使えるか?
  • RQ5顔の大きな姿勢やレアな属性組み合わせ(例:女性にひげ)といった困難な状況において、本手法はどの程度頑健か?

主な発見

  • 提案手法を用いた眼鏡除去後、目の領域の平均正規化特徴点検出誤差は、眼鏡の影響を受ける画像での0.03570から0.03048に低下し、顔の構造保持の観点から顕著な改善が確認された。
  • 操作済みテストセット(D1_m)における特徴点検出誤差は、クリアセット(D0)とほぼ同一であり、属性に関係のない領域が操作後にほとんど変化していないことを示している。
  • VAE-GANモデルと比較して、本手法は女性の顔に対してひげ追加の際、元の髪の長さを正確に保持しており、特徴相関に起因する誤った短髪アーチファクトを回避した。
  • 失敗事例の多くは、顔の大きな姿勢に起因しており、この場合、残差画像学習が一般化に失敗していた。これは極端なポーズ状況における制限を示している。
  • 二重学習スキームにより、アーチファクトが減少し、より自然な見た目の操作が実現されたことから、画像品質と特徴の一貫性が顕著に向上した。
  • 本手法は、ピクセル単位の変更を最小限に抑えつつ高精細な属性操作を達成しており、残差画像学習が関連する顔領域のみを的確に分離・変更できていることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。