Skip to main content
QUICK REVIEW

[論文レビュー] FaceSigns: Semi-Fragile Neural Watermarks for Media Authentication and Countering Deepfakes

Paarth Neekhara, Shehzeen Hussain|arXiv (Cornell University)|Apr 5, 2022
Digital Media Forensic Detection被引用数 8
ひとこと要約

FaceSignsは、メディアの認証およびDeepfakeの検出を目的として、画像に128ビットの秘密メッセージを人間が認識できない形で埋め込む、深層学習ベースの準破壊的ウォーターマーキングシステムを提案する。このシステムは、異なる微分可能変換を用いて訓練されたエンドツーエンドのエンコーダ・デコーダフレームワークを採用しており、有益な編集に対しては耐性を示すが、顔の改ざんに対しては壊れやすく、未学習のDeepfake攻撃を検出する際のAUCが0.996に達する。

ABSTRACT

Deepfakes and manipulated media are becoming a prominent threat due to the recent advances in realistic image and video synthesis techniques. There have been several attempts at combating Deepfakes using machine learning classifiers. However, such classifiers do not generalize well to black-box image synthesis techniques and have been shown to be vulnerable to adversarial examples. To address these challenges, we introduce a deep learning based semi-fragile watermarking technique that allows media authentication by verifying an invisible secret message embedded in the image pixels. Instead of identifying and detecting fake media using visual artifacts, we propose to proactively embed a semi-fragile watermark into a real image so that we can prove its authenticity when needed. Our watermarking framework is designed to be fragile to facial manipulations or tampering while being robust to benign image-processing operations such as image compression, scaling, saturation, contrast adjustments etc. This allows images shared over the internet to retain the verifiable watermark as long as face-swapping or any other Deepfake modification technique is not applied. We demonstrate that FaceSigns can embed a 128 bit secret as an imperceptible image watermark that can be recovered with a high bit recovery accuracy at several compression levels, while being non-recoverable when unseen Deepfake manipulations are applied. For a set of unseen benign and Deepfake manipulations studied in our work, FaceSigns can reliably detect manipulated content with an AUC score of 0.996 which is significantly higher than prior image watermarking and steganography techniques.

研究の動機と目的

  • ブラックボックス合成や敵対的例に対して失敗する既存のDeepfake検出分類器の限界を解消すること。
  • 圧縮によって破壊されてしまうほど過度に壊れやすい、またはDeepfake改ざん後も回復可能なほど過度に頑健すぎる、従来のウォーターマーキング手法の欠点を克服すること。
  • 撮影時に検証可能なデバイス固有の秘密を埋め込む、能動的な認証システムを構築し、メディアの履歴を確立すること。
  • 選択的破壊性を実現すること—有益な処理ではウォーターマークを保持するが、Deepfakeのような悪意ある顔の改ざんでは破壊されること。
  • 模擬的な改ざんを含むエンドツーエンドで微分可能に訓練することで、未学習のDeepfakeおよび有益な変換の信頼性の高い一般化検出を可能にすること。

提案手法

  • 128ビットの秘密メッセージを画像ピクセル内の人間が認識できない摂動として埋め込むエンドツーエンドのエンコーダ・デコーダニューラルネットワークを訓練する。
  • 有益な変換(例:圧縮、スケーリング、色調調整)を模擬するために微分可能データ拡張を用い、耐性を高める。
  • 顔の改ざん(例:顔交換)を模擬するために、微分可能で画像固有の摂動機構を導入し、顔領域における破壊性を強制的に確保する。
  • ウォーターマークは検出された顔にのみ適用され、クロップして256×256にリサイズし、エンコードして元の画像に再挿入することで、グローバルな文脈を保持する。
  • ウォーターマークの復号は、顔領域をクロップ・リサイズし、デコーダーを通過させて復元されたメッセージを信頼できる秘密リストと照合することで行う。
  • デコーダーを安全にホスティングし、二値の認証ラベルのみを出力することで、敵対的クエリ攻撃からのメッセージ回収を防止する。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースのウォーターマーキングシステムは、有益な画像処理に対しては耐性を示しつつも、Deepfakeのような悪意ある顔の改ざんでは破壊されるという選択的破壊性を達成できるか?
  • RQ2ニューラルウォーターマークは、学習時に見られなかった未学習の有益および悪意ある変換に対しても、どれほど一般化できるか?
  • RQ3多様な圧縮レベルや画像編集に対し、人間が認識できない形でウォーターマークを埋め込みつつ、高い回復精度を維持できるか?
  • RQ4メッセージ抽出、摂動の複製、プロキシエンコーダーの学習といった攻撃に対して、どの程度耐性を示せるか?
  • RQ5複数の顔を含む画像に対しても、個々の人物の真偽を保持する形でウォーターマーキングフレームワークを効果的に適用できるか?

主な発見

  • FaceSignsは、2〜6枚の顔を含む画像において、99.50%のビット回復精度(BRA)を達成しており、複雑なシーンでも効果的なウォーターマーク埋め込みと回収が可能であることを示している。
  • 未学習のDeepfake改ざんに対してはAUCスコアが0.996に達し、従来の頑健および準破壊的ウォーターマーキング技術を著しく上回っている。
  • Deepfake攻撃を受けた際、ウォーターマークは回復不能であり、悪意ある顔の改ざんに対する破壊性が確認された。
  • 攻撃者が1枚の画像から摂動を複製して別の画像に適用した場合、ビット回復精度は17.6%に低下し、ウォーターマーク転送攻撃に対して強い耐性があることが示された。
  • 複数の圧縮レベルにおけるJPEG圧縮、スケーリング、コントラスト、彩度調整といった一般的な有益な変換に対しても、システムは頑健である。
  • デコーダーのセキュアなデプロイメント—二値の認証ラベルのみを出力することで—敵対的クエリ攻撃からのメッセージ回収を効果的に防止している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。