[论文解读] Intrinsic Decomposition of Document Images In-the-Wild
本文提出了一种自监督、物理约束的深度学习框架,用于在复杂、非均匀光照条件下对野外文档图像进行固有分解。该方法引入了两阶段架构——WBNet用于白平衡,SMTNet用于阴影与反射率分离——并使用了一个新型多光源数据集(Doc3DShade),在OCR的字符错误率上实现了26%的提升,表明其在具有挑战性光照和纸张形状的真实文档图像上具有出色的泛化能力。
Automatic document content processing is affected by artifacts caused by the shape of the paper, non-uniform and diverse color of lighting conditions. Fully-supervised methods on real data are impossible due to the large amount of data needed. Hence, the current state of the art deep learning models are trained on fully or partially synthetic images. However, document shadow or shading removal results still suffer because: (a) prior methods rely on uniformity of local color statistics, which limit their application on real-scenarios with complex document shapes and textures and; (b) synthetic or hybrid datasets with non-realistic, simulated lighting conditions are used to train the models. In this paper we tackle these problems with our two main contributions. First, a physically constrained learning-based method that directly estimates document reflectance based on intrinsic image formation which generalizes to challenging illumination conditions. Second, a new dataset that clearly improves previous synthetic ones, by adding a large range of realistic shading and diverse multi-illuminant conditions, uniquely customized to deal with documents in-the-wild. The proposed architecture works in a self-supervised manner where only the synthetic texture is used as a weak training signal (obviating the need for very costly ground truth with disentangled versions of shading and reflectance). The proposed approach leads to a significant generalization of document reflectance estimation in real scenes with challenging illumination. We extensively evaluate on the real benchmark datasets available for intrinsic image decomposition and document shadow removal tasks. Our reflectance estimation scheme, when used as a pre-processing step of an OCR pipeline, shows a 26% improvement of character error rate (CER), thus, proving the practical applicability.
研究动机与目标
- 解决真实世界文档图像中非均匀且多光源光照带来的挑战,此类光照会降低OCR性能和内容处理质量。
- 克服先前方法依赖均匀色彩统计并假设纸面为平坦、均匀光照表面的局限性。
- 开发一种自监督学习方法,通过利用图像形成过程的物理约束,避免对反射率和阴影进行昂贵的真值标注。
- 构建一个大规模、逼真的合成数据集(Doc3DShade),包含多样的光照条件和复杂的文档形状,以提升模型的泛化能力。
- 通过展示在OCR流水线中将反射率估计作为预处理步骤时可显著提升性能,证明方法的实际应用价值。
提出的方法
- 提出两阶段网络:WBNet使用物理约束的学习方法对输入图像进行白平衡,以中和光照颜色。
- 利用SMTNet通过合成纹理作为弱监督信号,实现自监督的阴影与反射率分离,无需依赖真值解耦图像。
- 使用新数据集Doc3DShade进行模型训练,该数据集在公开的Doc3D数据集基础上扩展了逼真的多光源条件和复杂的3D文档形状。
- 将图像形成过程的物理约束(例如,反射率与阴影作为乘法分量)融入损失函数,以确保输出具有物理合理性。
- 以弱监督方式应用该方法,仅使用合成纹理作为监督信号,从而减少对昂贵真实世界标注的依赖。
- 将反射率估计集成到OCR流水线的预处理步骤中,以评估其在真实世界场景中的适用性。
实验结果
研究问题
- RQ1自监督深度学习模型是否能在无需完全标注真值的情况下,实现对复杂、非均匀光照下文档图像的鲁棒固有图像分解?
- RQ2与依赖局部色彩统计或平坦表面假设的方法相比,基于物理约束的学习方法在泛化能力方面有何提升?
- RQ3大规模、逼真的合成数据集(包含多光源条件)在真实世界文档图像分解任务中的性能提升程度如何?
- RQ4该方法是否能在不进行微调的情况下泛化到具有相似材质属性(如纸张类表面)的非文档物体上?
- RQ5将反射率估计作为预处理步骤,在真实世界场景中提升OCR准确性的有效性如何?
主要发现
- 当作为OCR流水线的预处理步骤时,该方法在字符错误率(CER)上实现了26%的相对提升,表明其具有显著的实际影响。
- 如表1所示,在DewarpNet基准数据集上,该方法在OCR错误减少方面实现了21%的性能提升。
- 定性比较显示,该方法在处理软阴影和复杂、扭曲的文档形状方面优于当前最先进的阴影去除方法(例如,Kligler等人提出的方法)。
- 该方法在未微调的情况下,对来自MIT-Intrinsics数据集的非文档类纸张状物体(如茶包)也表现出良好的泛化能力,表明其具有更广泛的应用潜力。
- 该模型在处理硬阴影时表现不佳,特别是在具有锐利、明显阴影边界的场景中,表明其在建模此类情况方面存在局限性。
- 使用多光源数据集(Doc3DShade)使模型能够以高保真度处理多样化的光照条件,包括有色和非均匀光照。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。