[论文解读] nvBench: A Large-Scale Synthesized Dataset for Cross-Domain Natural Language to Visualization Task
本文提出了 nvBench,这是首个大规模合成的跨领域自然语言到可视化(NL2VIS)任务基准,包含跨 750 张表格和 105 个领域的 25,750 组(NL, VIS)配对。该基准利用现有的 NL2SQL 基准自动生成多样化、高质量的(NL, VIS)配对,从而有效训练深度学习模型(如 ncNet),后者在 NL2VIS 翻译任务中实现了类人水平的性能。
NL2VIS - which translates natural language (NL) queries to corresponding visualizations (VIS) - has attracted more and more attention both in commercial visualization vendors and academic researchers. In the last few years, the advanced deep learning-based models have achieved human-like abilities in many natural language processing (NLP) tasks, which clearly tells us that the deep learning-based technique is a good choice to push the field of NL2VIS. However, a big balk is the lack of benchmarks with lots of (NL, VIS) pairs. We present nvBench, the first large-scale NL2VIS benchmark, containing 25,750 (NL, VIS) pairs from 750 tables over 105 domains, synthesized from (NL, SQL) benchmarks to support cross-domain NL2VIS task. The quality of nvBench has been extensively validated by 23 experts and 300+ crowd workers. Deep learning-based models training using nvBench demonstrate that nvBench can push the field of NL2VIS.
研究动机与目标
- 解决跨领域自然语言到可视化(NL2VIS)任务中缺乏大规模、高质量基准的问题。
- 通过提供多样化、真实的(NL, VIS)配对,支持基于深度学习的模型学习稳健的 NL2VIS 翻译能力。
- 支持端到端神经模型的开发,使其能够跨领域和可视化类型实现泛化。
- 通过提供可扩展、可伸缩的基准基础,促进对话式和不完整指定 NL2VIS 的研究。
- 通过专家和众包工作者的评估验证基准质量,确保其在真实场景中的适用性。
提出的方法
- 通过利用现有的 NL2SQL 基准,借助 SQL 与可视化查询之间的语义对齐,合成(NL, VIS)配对。
- 将每个自然语言查询映射到对应的 SQL 查询,然后通过预定义规则将 SQL 转换为兼容 Vega-Lite 的可视化规范(VIS)。
- 应用数据增强技术,为每个 SQL 查询生成多个自然语言变体,以提升多样性与覆盖范围。
- 采用两阶段流程:第一阶段,使用基于模板和改写的方法从 SQL 生成自然语言查询;第二阶段,通过基于规则的可视化生成引擎将每个 NL-SQL 配对映射到 VIS 查询。
- 通过专家评审(23 名专家)和众包(300 多名工作者)对合成配对进行验证与过滤,以确保质量与正确性。
- 在 nvBench 上训练深度学习模型 ncNet,以学习端到端的 NL2VIS 翻译,采用带有注意力机制的序列到序列建模方法。
实验结果
研究问题
- RQ1能否在无需人工标注的情况下,从现有 NL2SQL 基准高效合成大规模、多样化且高质量的(NL, VIS)基准?
- RQ2在 nvBench 上训练的深度学习模型在跨领域 NL2VIS 任务中,能在多大程度上实现类人水平的性能?
- RQ3nvBench 在不同领域、可视化类型和查询复杂度层级上的泛化能力如何?
- RQ4nvBench 是否能够支持高级 NL2VIS 能力,如对话式查询和不完整指定查询的处理?
- RQ5基准的质量与规模对端到端 NL2VIS 模型性能有何影响?
主要发现
- nvBench 包含跨 750 张表格和 105 个多样化领域的 25,750 组(NL, VIS)配对,在规模和跨领域覆盖范围上显著超越以往基准。
- 该基准经 23 名专家和 300 多名众包工作者验证,确认了合成的(NL, VIS)配对具有高质量和语义正确性。
- 在 nvBench 上训练的深度学习模型 ncNet 在 NL2VIS 翻译任务中实现了类人水平性能,证明了该基准在模型训练中的有效性。
- 合成管道能够自动从 SQL 生成多样化自然语言查询,支持可扩展性,并可轻松扩展至新领域和可视化类型。
- nvBench 支持七种常见可视化类型(如折线图、柱状图、散点图),并具备扩展至热力图、箱形图及复杂可视化的能力。
- 该基准为未来对话式 NL2VIS 和不完整指定查询处理的研究提供了基础,支持对部分或模糊查询的建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。