Skip to main content
QUICK REVIEW

[论文解读] OCR Graph Features for Manipulation Detection in Documents

Hailey James, Otkrist Gupta|arXiv (Cornell University)|Sep 10, 2020
Digital Media Forensic Detection参考文献 23被引用 5
一句话总结

本文提出一种基于数据驱动的图模型方法,利用OCR提取的特征检测文档篡改,将字符边界框视为图中的节点,并训练随机森林分类器以识别像素级变化、复制-粘贴或拼接等伪造缺陷。该方法显著优于以往的程序化模型,在轻微篡改(如1–5像素位移或7%缩放)情况下仍能实现高精度(0.87)和F1分数(0.80)。

ABSTRACT

Detecting manipulations in digital documents is becoming increasingly important for information verification purposes. Due to the proliferation of image editing software, altering key information in documents has become widely accessible. Nearly all approaches in this domain rely on a procedural approach, using carefully generated features and a hand-tuned scoring system, rather than a data-driven and generalizable approach. We frame this issue as a graph comparison problem using the character bounding boxes, and propose a model that leverages graph features using OCR (Optical Character Recognition). Our model relies on a data-driven approach to detect alterations by training a random forest classifier on the graph-based OCR features. We evaluate our algorithm's forgery detection performance on dataset constructed from real business documents with slight forgery imperfections. Our proposed model dramatically outperforms the most closely-related document manipulation detection model on this task.

研究动机与目标

  • 为应对使用易访问图像编辑工具导致的数字文档伪造日益严峻的挑战。
  • 克服程序化、人工调优方法在检测文档中细微篡改方面的局限性。
  • 开发一种可泛化的数据驱动方法,利用数字文档的结构特性。
  • 在模拟现实世界伪造缺陷(如位移和缩放)的真实数据集上评估性能。
  • 证明基于图的OCR特征相较于现有方法能提升检测准确率。

提出的方法

  • 该方法将文档中的每个字符建模为图中的一个节点,边表示与邻近字符的空间和字体排版关系。
  • 从OCR边界框中提取图特征,包括尺寸、距离、对齐方式以及与邻近字符的相对位置。
  • 基于这些图特征训练随机森林分类器,以区分真实与篡改的字符。
  • 在自建的真实商业文档数据集上评估模型,其中包含合成的篡改操作,如像素级修改、复制-粘贴和拼接。
  • 数据集通过模拟位移和缩放来隔离伪造缺陷,同时尽量减少纹理或像素级伪影。
  • 对超参数(如马氏距离阈值和对数变换的Hu矩)进行调优,以优化模型性能。

实验结果

研究问题

  • RQ1基于数据驱动的图模型方法是否能在检测细微文档篡改方面优于程序化方法?
  • RQ2OCR提取的图特征在识别如错位或不一致缩放等伪造缺陷方面有多有效?
  • RQ3利用文档的结构化布局是否能提升检测性能,相较于基于像素或纹理的方法?
  • RQ4该模型在不同类型的篡改(包括位移和缩放)上泛化程度如何?
  • RQ5在检测极小改动时,模型能否保持高精度与低误报率?

主要发现

  • 在检测5%字符缩放15–25%的情况下,所提模型的精度为0.8651 ± 0.0134,F1分数为0.8012 ± 0.0181,显著优于基线模型。
  • 对于1–5像素的位移,模型保持精度0.8604 ± 0.0101,F1分数0.7512 ± 0.0121,表明其在极小篡改下具备强大的检测能力。
  • 基线模型(Bertrand et al., 2013)在相同缩放任务下的F1分数仅为0.4265 ± 0.0170,凸显所提方法的优越性。
  • 在15–25%缩放任务中,模型准确率达到0.9857 ± 0.0112,表明其在不同数据划分下具有出色的泛化能力。
  • 尽管基线模型的召回率较高(0.7862 ± 0.0170),但其精度(0.2927 ± 0.0144)极低,表明误报率极高。
  • 结果表明,较大程度的篡改可能破坏模型对同一线段字符的正确区分能力,可能源于空间关系的改变。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。