Skip to main content
QUICK REVIEW

[論文レビュー] Bilinear Faster RCNN with ELA for Image Tampering Detection

Robin Elizabeth Yancey|arXiv (Cornell University)|Apr 7, 2019
Digital Media Forensic Detection参考文献 28被引用数 7
ひとこと要約

本稿では、エラーレベル分析(ELA)を組み込んだ双線形Faster R-CNNフレームワークを提案し、画像改ざん検出を向上させることを目的としている。オリジナル画像とELAによって生成されたJPEG圧縮レベルマスクを第二の入力ストリームとして融合させることで、従来の手法(ノイズ分析やCFAなど)に比べて、局所化精度を向上させるとともに、深層学習を用いて改ざん手法の事前知識が不要な特徴を自動で学習できる。

ABSTRACT

With technological advances leading to an increase in mechanisms for image tampering, fraud detection methods must continue to be upgraded to match their sophistication. One problem with current methods is that they require prior knowledge of the method of forgery in order to determine which features to extract from the image to localize the region of interest. When a machine learning algorithm is used to learn different types of tampering from a large set of various image types, with a large enough database we can easily classify which images are tampered (by training on the entire image feature map for each image). However, we still are left with the question of which features to train on, and how to localize the manipulation. To solve this, object detection networks such as Faster R-CNN, which combine an RPN (Region Proposal Network) with a CNN, have recently been adapted to fraud detection by utilizing their ability to propose bounding boxes for objects of interest to localize the tampering artifacts. By making use of the computational powers of today's GPUs this method also achieves a fast run-time and higher accuracy than the top current methods such as noise analysis, ELA (Error Level Analysis), or CFA (Color Filter Array). In this work, a multi-linear Faster RCNN network will be applied similarly but with the second stream having an input of the ELA JPEG compression level mask. This is shown to provide even higher accuracy by adding training features from the segmented image map to the network.

研究の動機と目的

  • 改ざん手法の事前知識がなければ関連特徴を抽出できないという、従来の改ざん検出手法の限界を解消すること。
  • 深層学習に基づくオブジェクト検出を用いて、画像内の改ざん領域の局所化精度を向上させること。
  • 生画像とELAベースの圧縮マップの両方を統合的に学習することで、手作業で設計された特徴に依存するのを減らすこと。
  • 従来の手法(ノイズ分析、ELA、CFAなど)に比べて、より高速な推論と高い検出精度を達成すること。
  • オリジナル画像特徴とELA由来の圧縮アーティファクトを組み合わせたマルチストリーム特徴学習の有効性を示すこと。

提案手法

  • バックボーンとしてFaster R-CNNアーキテクチャを採用し、領域提案ネットワーク(RPN)とCNNを組み合わせてオブジェクト検出を実行する。
  • 第二の入力ストリームを導入し、ELAによって生成されたJPEG圧縮レベルマスクをネットワークの並列ブランチに供給する。
  • オリジナル画像とELAマスクからの特徴を、二重畳み込みプーリング(bilinear pooling)によって統合し、マルチモダリティ間の相互作用を捉える。
  • 多様な画像タイプを含む大規模データセット上で、改ざん領域の局所化に特化した判別的特徴を学習するために、エンド・トゥ・エンドでモデルを訓練する。
  • 最新のGPUアクセラレーションを活用することで、高精度を維持しつつ高速な推論を実現する。
  • データから直接最適な表現を学習することで、事前定義された特徴に依存しない。

実験結果

リサーチクエスチョン

  • RQ1オリジナル画像とFaster R-CNNバックボーンにELAマスクを組み合わせることで、画像改ざんアーティファクトの局所化が向上するか?
  • RQ2オリジナル画像とELA特徴の間で二重畳み込み融合を適用することで、単一ストリームモデルに比べて検出精度が向上するか?
  • RQ3ノイズ分析、ELA、CFAなどの既存手法と比較して、本手法の精度と速度はどのように異なるか?
  • RQ4改ざん手法の事前知識がなくても、多様な画像タイプに一般化できる程度はどの程度か?
  • RQ5画像とELA入力ストリームのエンド・トゥ・エンド訓練により、手作業による特徴設計の必要性が排除できるか?

主な発見

  • 提案されたELA入力を備えた双線形Faster R-CNNは、ノイズ分析、ELA、CFAなどの最先端手法に比べて高い精度を達成した。
  • ELAマスクを第二の入力ストリームとして統合することで、改ざん領域の局所化精度が顕著に向上した。
  • 効率的なGPU利用とエンド・トゥ・エンド訓練のおかげで、推論時間が短縮された。
  • オリジナル画像とELAマスクからの特徴を二重畳み込みで統合することで、微細な改ざんアーティファクトの検出が向上した。
  • データから直接特徴を学習することで、改ざん手法の事前知識に依存するのを減らした。
  • 画像と圧縮レベル特徴の補完的情報を活用することで、単一ストリームモデルを上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。