Skip to main content
QUICK REVIEW

[論文レビュー] OCR Graph Features for Manipulation Detection in Documents

Hailey James, Otkrist Gupta|arXiv (Cornell University)|Sep 10, 2020
Digital Media Forensic Detection参考文献 23被引用数 5
ひとこと要約

本稿では、OCRから得られる特徴を用いて文書改ざんを検出するデータ駆動型でグラフベースのアプローチを提案する。文字のバウンディングボックスをグラフのノードとして扱い、ランダムフォレスト分類器を訓練することで、ピクセルレベルの変更、コピーモーブ、スプライシングなどの改ざんの兆候を特定する。この手法は、従来の手続き的モデルを著しく上回り、1–5ピクセルのずれや7%のスケーリングといった微細な改ざんに対しても、高い正確性(0.87)とF1スコア(0.80)を達成する。

ABSTRACT

Detecting manipulations in digital documents is becoming increasingly important for information verification purposes. Due to the proliferation of image editing software, altering key information in documents has become widely accessible. Nearly all approaches in this domain rely on a procedural approach, using carefully generated features and a hand-tuned scoring system, rather than a data-driven and generalizable approach. We frame this issue as a graph comparison problem using the character bounding boxes, and propose a model that leverages graph features using OCR (Optical Character Recognition). Our model relies on a data-driven approach to detect alterations by training a random forest classifier on the graph-based OCR features. We evaluate our algorithm's forgery detection performance on dataset constructed from real business documents with slight forgery imperfections. Our proposed model dramatically outperforms the most closely-related document manipulation detection model on this task.

研究の動機と目的

  • アクセスしやすい画像編集ツールの普及に伴うデジタル文書改ざんの増加に取り組む。
  • 文書における微細な改ざんを検出する際の、手続き的で手動チューニングされた手法の限界を克服する。
  • デジタル文書の構造的性質を活用する汎用的でデータ駆動型のアプローチを開発する。
  • 実際の文書改ざんの兆候(ずれやスケーリング)を模擬する現実的でリアルなデータセットを用いて、性能を評価する。
  • グラフベースのOCR特徴が、既存の手法よりも検出精度を向上させることを示す。

提案手法

  • 本手法は、文書内の各文字をグラフのノードとしてモデル化し、隣接文字との空間的およびタイプグラフィックな関係をエッジで表現する。
  • グラフ特徴はOCRのバウンディングボックスから抽出され、サイズ、距離、整列、および隣接文字に対する相対的位置関係を含む。
  • これらのグラフベースの特徴を用いてランダムフォレスト分類器を訓練し、本物の文字と改ざんされた文字を区別する。
  • 本モデルは、ピクセルレベルの変更、コピーモーブ、スプライシングを含む合成的改ざんが施された、独自に構築した実際のビジネス文書データセットで評価される。
  • データセットは、ずれやスケーリングを模擬することで改ざんの兆候を分離し、テクスチャやピクセルベースのアーチファクトを最小限に抑えるように設計されている。
  • マハラノビス距離のしきい値や対数変換されたヒューモーメントといったハイパーパrameterが、モデル性能の最適化のために調整されている。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型でグラフベースのアプローチは、手続き的モデルに比べて微細な文書改ざんを検出する上で優れているか?
  • RQ2OCRから得られるグラフ特徴は、不整合な整列や一貫性のないスケーリングといった改ざんの兆候を特定するのにどの程度有効か?
  • RQ3文書の構造的レイアウトを活用することで、ピクセルベースやテクスチャベースの手法と比較して検出性能が向上するか?
  • RQ4本モデルは、ずれやスケーリングを含むさまざまな種類の改ざんに対してどの程度一般化できるか?
  • RQ5最小限の変更を検出する際、本モデルは高い正確性と低い誤検出率を維持できるか?

主な発見

  • 本手法は、15–25%にスケーリングされた5%の文字を検出する際、正確性0.8651 ± 0.0134、F1スコア0.8012 ± 0.0181を達成し、ベースラインモデルを著しく上回る。
  • 1–5ピクセルのずれの検出においても、正確性0.8604 ± 0.0101、F1スコア0.7512 ± 0.0121を維持しており、微細な改ざんに対する強力な検出能力を示している。
  • ベースラインモデル(Bertrand et al., 2013)は、同じスケーリングタスクにおいてF1スコア0.4265 ± 0.0170にとどまり、本手法の優位性が顕著に現れている。
  • 15–25%スケーリングタスクにおいて、本モデルは高い精度(0.9857 ± 0.0112)を達成しており、分割間での一般化能力が優れていることが示された。
  • ベースラインでは再現率(0.7862 ± 0.0170)は高いが、正確性(0.2927 ± 0.0144)は著しく低く、誤検出率が高いことが判明した。
  • 結果から、より大きな改ざんは、同じ行上の文字を正しく区別する能力に影響を与える可能性があることが示唆され、空間的関係の変化が要因である可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。