Skip to main content
QUICK REVIEW

[論文レビュー] Live Face De-Identification in Video

Oran Gafni, Lior Wolf|arXiv (Cornell University)|Nov 19, 2019
Face recognition and analysis参考文献 48被引用数 4
ひとこと要約

本論文は、顔のアイデンティティを完全に相関解除し、ポーズ、表情、照明、アイデンティティに依存しない外見を保持する、ライブ動画の顔非特定化のための新規でフォワード伝搬型のエンコーダデコーダネットワークを提案する。顔認識モデルの特徴量を事前学習済みのものに条件づけ、新規のアトラクタ・リペラー知覚損失を用いることで、再訓練なしに高精細でアーティファクトのない動画変更を実現する。これにより、リアルタイムかつアイデンティティ破壊型の顔変換が可能となる。

ABSTRACT

We propose a method for face de-identification that enables fully automatic video modification at high frame rates. The goal is to maximally decorrelate the identity, while having the perception (pose, illumination and expression) fixed. We achieve this by a novel feed-forward encoder-decoder network architecture that is conditioned on the high-level representation of a person's facial image. The network is global, in the sense that it does not need to be retrained for a given video or for a given identity, and it creates natural looking image sequences with little distortion in time.

研究の動機と目的

  • ポーズ、表情、照明といったアイデンティティ以外の属性を保持しつつ、完全に自動的かつリアルタイムに動画の顔非特定化を可能にすること。
  • フレーム間で知覚的整合性を保つことができる動画対応の非特定化手法の不足を解消すること。
  • 既存データセットの顔に交換するのではなく、新規に自然な顔を生成すること。
  • 最先端の顔認識モデルが非特定化された被験者を同定できないようにすること。
  • 再訓練なしに多様なポーズ、照明、遮蔽、顔の構造に対応できる強健性を持つ手法を開発すること。

提案手法

  • 事前学習済み顔認識ネットワークの高レベル表現を条件とするフォワード伝搬型のエンコーダデコーダアーキテクチャ。
  • 顔認識ネットワークの特徴量を潜在空間に埋め込むことで、再訓練なしにアイデンティティに依存しない生成をガイドすること。
  • 低レベル・ミドルレベル特徴量(フレームの一貫性のため)と高レベル特徴量(アイデンティティの分離のため)を区別する新規のアトラクタ・リペラー知覚損失。
  • 正確なブレンドと再構成を可能にするために、同時に顔画像とセグメンテーションマスクを出力すること。
  • 再構成損失、エッジ損失、 adversarial 損失に加え、構造的意味を保持するためのセマンティックデータ拡張技術を用いた学習。
  • λ を用いたハイパーパrameter制御により、知覚的一致性を維持しながらアイデンティティ分離の強度を調整可能にすること。

実験結果

リサーチクエスチョン

  • RQ11つの再訓練なしモデルが、リアルタイムの動画処理においてポーズ、表情、照明を保持しつつ、高品質でアイデンティティを破壊した顔を生成できるか?
  • RQ2アイデンティティ非特定化の過程で、フレーム間の知覚的一致性をどのように維持できるか?
  • RQ3事前学習済み顔分類器からの学習された表現を、アイデンティティ破壊生成をガイドするためにどの程度活用できるか?
  • RQ4提案されたアトラクタ・リペラー知覚損失は、視覚的アーティファクトを最小限に抑えつつ、アイデンティティ分離をどのように向上させるか?
  • RQ5微調整なしに、多様なアイデンティティ、ポーズ、照明条件に一般化できるか?

主な発見

  • 本手法は、フレーム間の時間的フレッカーと歪みを最小限に抑え、一貫したポーズ、表情、照明を維持した動画シーケンスを生成する。
  • 最先端の顔認識モデルは非特定化された被験者を同定できず、効果的なアイデンティティ非特定化が確認された。
  • 人間の観察者ですら、延長して観察しても非特定化された顔を同定できないため、強力な知覚的匿名性が示された。
  • 従来の手法でよく歪みが生じる低・ミドルレベル特徴量(例:口の動き、顔のひげ)を、本手法は良好に保持している。
  • 学習されたマスクの使用により、高解像度の顔生成が可能となり、全身生成手法で一般的なアーティファクトを回避できた。
  • アブレーションスタディにより、アトラクタ・リペラー損失やマスク出力を除去すると、顕著なアーティファクトとアイデンティティ分離の低下が生じることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。