Skip to main content
QUICK REVIEW

[論文レビュー] On Detecting GANs and Retouching based Synthetic Alterations

Anubhav Jain, Richa Singh|arXiv (Cornell University)|Jan 26, 2019
Digital Media Forensic Detection参考文献 15被引用数 5
ひとこと要約

本稿では、顔面の加工やGAN生成画像を含む合成画像の改ざんを検出する教師ありCNNベースの手法を提案する。パッチベースの特徴抽出とリプルゼントネットワークを用い、加工済み画像では99.65%、GAN生成画像では99.83%の精度を達成し、先行研究を著しく上回る性能を示す。

ABSTRACT

Digitally retouching images has become a popular trend, with people posting altered images on social media and even magazines posting flawless facial images of celebrities. Further, with advancements in Generative Adversarial Networks (GANs), now changing attributes and retouching have become very easy. Such synthetic alterations have adverse effect on face recognition algorithms. While researchers have proposed to detect image tampering, detecting GANs generated images has still not been explored. This paper proposes a supervised deep learning algorithm using Convolutional Neural Networks (CNNs) to detect synthetically altered images. The algorithm yields an accuracy of 99.65% on detecting retouching on the ND-IIITD dataset. It outperforms the previous state of the art which reported an accuracy of 87% on the database. For distinguishing between real images and images generated using GANs, the proposed algorithm yields an accuracy of 99.83%.

研究の動機と目的

  • 顔画像における改ざん(加工やGAN生成コンテンツを含む)を検出する強力なディーブラーニングフレームワークの開発。
  • 顔認識システムや社会的健全性に悪影響を及げる、視認できない画像改ざんの増加する課題に対処。
  • 局所的特徴の学習を強化するため、パッチベースのCNNとリプルゼント接続を活用することで、既存の検出手法を改善。
  • 実世界の加工済み画像(ND-IIITDデータセット)およびGAN生成画像(StarGAN)に対する性能評価を実施。損傷圧縮下の性能も含む。
  • 過学習を避けるために、圧縮アーティファクトに特化したパターンを学習しないよう、異なる画像ソースおよび圧縮アーティファクトに一般化できるようにする。

提案手法

  • 入力画像から重複のないサイズ (64,64,3) または (128,128,3) のパッチを抽出し、局所的特徴学習を実施。
  • ResNetをインspiredしたリプルゼントCNNアーキテクチャを採用し、階層的な局所的・グローバル特徴を捉えることで、勾配の流れを改善し、性能を向上。
  • 異常を示す兆候(加工やGAN生成の兆候)を検出するため、パッチレベルの分類にしきい値処理またはSVMを適用。
  • 最終意思決定のために、パッチ予測をメジャー投票またはSVMを用いて統合することで、画像レベルの分類を実施。
  • PNGフォーマットの画像でモデルをファインチューニングし、圧縮に特化したアーティファクトを学習しないことを確認。これにより、圧縮形式への一般化性を確保。
  • アブレーションスタディを実施し、リプルゼント接続の必要性を検証。接続を削除すると性能が著しく低下することが判明。

実験結果

リサーチクエスチョン

  • RQ1ND-IIITDデータセットからの画像に対して、深層CNNが顔面加工を高い精度で検出できるか?
  • RQ2本手法は、特にStarGANからのGAN生成画像に対し、どの程度一般化性能を発揮するか?
  • RQ3損傷圧縮(JPEG)下でも、モデルは高い検出精度を維持するか?これは一般的な実世界のシナリオである。
  • RQ4リプルゼント接続は、合成改ざんの検出におけるモデルのロバスト性と性能向上にどの程度寄与するか?
  • RQ5モデルは、画像圧縮アーティファクトに過学習することなく、本物と偽物の画像を区別できるか?

主な発見

  • 提案手法は、ND-IIITDデータセットにおける加工済み顔画像の検出で99.65%の精度を達成し、先行の最良手法(87%)を著しく上回る。
  • StarGANからのGAN生成画像では、しきい値処理を用いると99.83%、SVMを用いると99.73%の精度を達成し、優れた一般化性能を示す。
  • JPEG圧縮画像(品質因子50)では、SVMを用いると96.33%の精度を維持するが、しきい値処理では88.89%に低下し、SVMの優位性が顕著に現れる。
  • アブレーションスタディにより、リプルゼント接続を削除すると、パッチレベルの精度が97.83%、画像レベルの精度が96.80%(しきい値処理)に低下することが確認され、接続の重要性が裏付けられる。
  • PNG画像でのファインチューニングにより、モデルが圧縮に特化したパターンを学習していないことが確認され、圧縮形式でも高い性能が維持される。
  • プローブ間での一般化性が高く、あるプローブで学習し他のプローブでテストした場合、しきい値処理で99.73%、SVMで99.91%のテスト精度を達成し、プローブ間の変動に対してもロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。