[论文解读] Recovering Homography from Camera Captured Documents using Convolutional Neural Networks
本文提出一种基于卷积神经网络(CNN)的深度学习方法,可自动从相机拍摄的文档图像中恢复单应性矩阵,实现无需人工输入的透视校正。该方法在大规模合成数据集上端到端训练,使用L1损失回归四个角点,实测在真实世界图像上达到2.56像素的平均距离误差(MDE),性能优于CamScanner和ABBY-Reader等商业工具,处于当前最先进水平。
Removing perspective distortion from hand held camera captured document images is one of the primitive tasks in document analysis, but unfortunately, no such method exists that can reliably remove the perspective distortion from document images automatically. In this paper, we propose a convolutional neural network based method for recovering homography from hand-held camera captured documents. Our proposed method works independent of document's underlying content and is trained end-to-end in a fully automatic way. Specifically, this paper makes following three contributions: Firstly, we introduce a large scale synthetic dataset for recovering homography from documents images captured under different geometric and photometric transformations; secondly, we show that a generic convolutional neural network based architecture can be successfully used for regressing the corners positions of documents captured under wild settings; thirdly, we show that L1 loss can be reliably used for corners regression. Our proposed method gives state-of-the-art performance on the tested datasets, and has potential to become an integral part of document analysis pipeline.
研究动机与目标
- 解决手持相机拍摄的文档图像中缺乏可靠、完全自动化的透视校正方法的问题。
- 开发一种不依赖于文档内容、版式或文本结构(如页边距或平行线)的方法。
- 构建一个大规模的合成数据集,以捕捉多样化的辐射度和几何失真,用于训练鲁棒的单应性估计。
- 评估L1损失和四点单应性参数化在真实世界环境中进行角点回归的效能。
- 在具有挑战性的现实条件下,实现比现有商业和学术方法更高的准确性和鲁棒性。
提出的方法
- 该方法使用自定义的卷积神经网络架构,在端到端训练下从单张输入图像回归文档的四个角点。
- 引入一个大规模的合成数据集,模拟多样化的几何和辐射度变换,如旋转、缩放、光照变化和背景杂波。
- 采用四个角点而非3×3矩阵来参数化单应性,从而实现更稳定的训练过程和更优的性能。
- 使用L1损失训练网络,以最小化预测角点与真实角点之间的欧氏距离。
- 在真实世界测试图像上评估模型,并与CamScanner和ABBY-Reader等商业工具在定性和定量指标上进行比较。
- 该方法效率高,单次前向传播仅需0.04秒(在Tesla K40 GPU上)。
实验结果
研究问题
- RQ1是否可以有效训练一个深度CNN,仅从单张相机拍摄的文档图像中估计单应性,而无需依赖手工设计的特征?
- RQ2在单应性估计任务中,使用L1损失进行角点回归是否比L2损失表现更优?
- RQ3能否通过捕捉真实世界失真真实分布的合成数据集,实现单应性恢复的SOTA性能?
- RQ4在具有挑战性的条件下,该方法与CamScanner和ABBY-Reader等商业应用相比,在准确性和鲁棒性方面表现如何?
- RQ5四点单应性参数化是否相比传统的3×3矩阵表示能带来更稳定和更准确的结果?
主要发现
- 在400张图像的手动标注测试集上,该方法的平均距离误差(MDE)为2.56像素,显著优于CamScanner(21.5像素)和ABBY-Reader(20.6像素)。
- 该方法在强光照伪影、背景杂波、运动模糊和部分遮挡等情况下表现出更优的鲁棒性,而商业工具常在此类情况下失效。
- 在SmartDoc-QA数据集上,该方法在复杂几何和辐射度变化下持续提升OCR性能,优于基线校正方法。
- 使用L1损失进行角点回归相比L2损失具有更好的泛化性和稳定性,尽管性能差异在统计上不显著。
- 四点单应性参数化方法使损失函数更稳定,并在性能上达到SOTA,优于3×3矩阵表示方法。
- 该方法完全自动且与内容无关,无需对文档版式、页边距或文本行平行性做任何假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。