QUICK REVIEW
[论文解读] The DIDI dataset: Digital Ink Diagram data
Philippe Gervais, Thomas Deselaers|arXiv (Cornell University)|Feb 20, 2020
Handwritten Text Recognition Techniques参考文献 12被引用 9
一句话总结
DIDI数据集引入了一个大规模的58,655幅数字墨迹草图图示集合——其中22,287幅带有文本标签,36,368幅不带标签——通过使用安卓设备和Chromebook的提示式数据收集流程获取。该数据集通过支持包含动态笔触和时间戳信息的图示数据驱动建模,促进了交互式图形符号理解的研究,以知识共享许可发布,并提供了用于机器学习框架集成的示例代码。
ABSTRACT
We are releasing a dataset of diagram drawings with dynamic drawing information. The dataset aims to foster research in interactive graphical symbolic understanding. The dataset was obtained using a prompted data collection effort.
研究动机与目标
- 为解决在涉及文本与手绘形状的交互式图示理解模型训练中缺乏大规模、多样化数据集的问题。
- 通过提供包含时间和空间信息的动态数字墨迹数据,促进机器学习与人机交互领域的研究。
- 通过支持对语义相关的手写文本、形状与图示进行数据驱动建模,推动智能图示创建与编辑工具的开发。
- 通过发布一个大规模、多样化且结构良好的数据集,克服现有数据集规模小且不适合深度学习的局限性。
- 通过使用真实用户生成的数据,支持端到端识别与理解复杂多模态图示内容的研究。
提出的方法
- 使用在Chromebook和移动设备上运行的安卓应用程序收集数据,参与者被提示在屏幕上重绘流程图图示。
- 图示通过随机生成的dot文件使用GraphViz生成,节点形状、标签和边结构在161种不同配置中变化。
- 每幅图示以NDJSON格式存储,包含唯一键、label_id、划分(训练/验证/测试)、书写引导(画布尺寸)以及包含x、y和时间戳坐标的笔触嵌套数组。
- 数据集按参与者作者进行划分,以确保训练、验证和测试集互不重叠,其中6/8的数据用于训练,各1/8用于验证和测试。
- 配套文件包括原始dot文件、PNG提示图像以及用于渲染的扩展xdot文件,均以知识共享署名4.0国际许可发布。
- 提供了一个Colab笔记本,包含用于可视化和转换至常见机器学习框架的示例代码。
实验结果
研究问题
- RQ1如何有效收集并组织大规模、动态的数字墨迹数据,以支持图形符号理解的研究?
- RQ2在图示中包含文本标签对用户生成图示的复杂性和多样性有何影响?
- RQ3一个包含时间和空间笔触信息的大规模、多样化用户绘制图示数据集,能否提升图示识别与理解任务的性能?
- RQ4按作者参与者划分数据集对在DIDI数据集上训练的模型泛化能力有何影响?
- RQ5现有机器学习框架在该数据集上用于端到端图示理解任务时,其有效性在多大程度上可被充分发挥?
主要发现
- DIDI数据集包含从364名参与者处收集的58,655幅唯一图示,其中22,287幅包含文本标签,36,368幅不包含。
- 数据集包含6,555个唯一标签ID,每个标签被使用1至169次,中位使用次数为4次。
- 图示笔触数从1到161根不等(中位数14根),点数在2至17,980个之间(中位数1,559个),反映出用户输入的极高变异性。
- 数据集根据互不重叠的作者身份划分为训练集(43,995)、验证集(7,330)和测试集(7,330),以确保评估的稳健性。
- 数据集以知识共享署名4.0国际许可发布,包含完整源代码及用于可视化和机器学习集成的示例笔记本。
- 数据收集过程使用GraphViz生成的dot文件创建多样化、逼真的流程图提示,确保图示在结构和语义上的多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。