[论文解读] Automatic Identification and Data Extraction from 2-Dimensional Plots in Digital Documents
本文提出了一种新颖的机器学习与图像分析框架,用于自动识别数字文档中的2D图表并精确提取数据点,包括重叠的数据点。通过结合小波特征、边缘检测、霍夫变换和模拟退火算法,该系统在2D图表分类中实现了88.25%的准确率,并成功恢复了88.9–91.0%的重叠数据点,精度较高,从而实现了对视觉数据的数据库索引,支持语义搜索。
Most search engines index the textual content of documents in digital libraries. However, scholarly articles frequently report important findings in figures for visual impact and the contents of these figures are not indexed. These contents are often invaluable to the researcher in various fields, for the purposes of direct comparison with their own work. Therefore, searching for figures and extracting figure data are important problems. To the best of our knowledge, there exists no tool to automatically extract data from figures in digital documents. If we can extract data from these images automatically and store them in a database, an end-user can query and combine data from multiple digital documents simultaneously and efficiently. We propose a framework based on image analysis and machine learning to extract information from 2-D plot images and store them in a database. The proposed algorithm identifies a 2-D plot and extracts the axis labels, legend and the data points from the 2-D plot. We also segregate overlapping shapes that correspond to different data points. We demonstrate performance of individual algorithms, using a combination of generated and real-life images.
研究动机与目标
- 为解决数字图书馆系统中未能对嵌入在2D图表中的数据进行索引这一关键问题,这些数据对于科学比较与分析至关重要。
- 开发一种自动化系统,用于识别数字文档中的2D图表,并提取结构化数据,包括坐标轴标签、图例和数据点。
- 解决在2D图表中重叠数据点的消歧问题,这些问题在传统提取方法中通常被视为噪声或丢失。
- 实现从2D图表中端到端的数据提取,以支持学术文档中跨文档的索引与语义查询。
提出的方法
- 使用图像分割(IS)、图注文本(CT)和坐标轴(CA)特征的组合,训练线性SVM分类器,以区分2D图表与其他图类型。
- 图像特征包括小波系数直方图、边缘检测以及霍夫变换,用于检测线条和坐标轴,从而提升图表检测的准确性。
- 连通域分析将图像分割为X轴、Y轴和绘图区域,实现对标签、图例和数据点的局部化处理。
- 通过字符间的空间邻近性和一致间距,利用启发式方法将字符分组为字符串,识别文本组件。
- 利用模拟退火算法对重叠数据点进行消歧,通过优化候选形状的位置,使观测像素模式与重建像素模式之间的误差最小化。
- 模拟退火的代价函数定义为观测图像与重建形状集合之间差值的格朗姆矩阵的迹,以指导形状定位与中心检测。
实验结果
研究问题
- RQ1结合基于图像的特征(小波、边缘、霍夫)与文本特征(图注),能否可靠地对数字文档中的2D图表进行分类?
- RQ2利用随机优化方法,能否高精度地消歧2D图表中的重叠数据点,并恢复其位置与形状?
- RQ3在真实与合成数据集上,所提系统的2D图表检测准确率与数据点恢复召回率表现如何?
- RQ4从2D图表中提取的数据能否有效存储于数据库中,以支持语义查询与跨文档分析?
主要发现
- 使用全部特征(IS、CT、CA)时,系统在2D图表分类上的交叉验证准确率达到88.25%,优于单一或成对特征集的表现。
- 测试集上的混淆矩阵显示,在167个2D图表中正确识别出134个,仅有13个假阴性,表明模型具有良好的泛化能力。
- 对于重叠数据点,模拟退火方法成功恢复了88.9%的菱形点和91.0%的三角形点,参数设置为10,000次迭代与0.4的温度常数。
- 增加迭代次数并减缓退火调度可进一步提升召回率,表明系统在更复杂配置下具备可扩展性。
- 该方法成功分离了原本会丢失的重叠数据点,证明了其在恢复以往不可访问数据方面的可行性。
- 该框架正被整合进一个更大的图表提取系统中,以支持数字图书馆中视觉数据的语义索引。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。