[论文解读] Quda: Natural Language Queries for Visual Data Analytics
本文介绍了 Quda,一个包含 14,035 个自然语言查询的大规模、高质量数据集,这些查询均标注有一个或多个视觉数据分析中的分析任务。作者通过访谈收集专家查询,利用众包方式生成改写版本,并采用基于机器学习的验证方法确保数据质量,从而支持在可视化系统中进行自然语言理解的多标签分类模型的训练与基准测试。
The identification of analytic tasks from free text is critical for visualization-oriented natural language interfaces (V-NLIs) to suggest effective visualizations. However, it is challenging due to the ambiguity and complexity nature of human language. To address this challenge, we present a new dataset, called Quda, that aims to help V-NLIs recognize analytic tasks from free-form natural language by training and evaluating cutting-edge multi-label classification models. Our dataset contains $14,035$ diverse user queries, and each is annotated with one or multiple analytic tasks. We achieve this goal by first gathering seed queries with data analysts and then employing extensive crowd force for paraphrase generation and validation. We demonstrate the usefulness of Quda through three applications. This work is the first attempt to construct a large-scale corpus for recognizing analytic tasks. With the release of Quda, we hope it will boost the research and development of V-NLIs in data analysis and visualization.
研究动机与目标
- 为解决在视觉数据分析中从自由格式自然语言查询中准确识别分析任务的挑战。
- 创建一个大规模、高质量的数据集,以反映现实世界中数据分析师的查询及其语义变体。
- 支持在 V-NLI 系统中对用户查询进行多标签分类的深度学习模型的训练与评估。
- 通过查询理解与推荐,提升可视化推荐系统的鲁棒性与可用性。
- 为未来在数据可视化自然语言接口方面的研究(包括多轮对话与上下文感知查询理解)奠定基础。
提出的方法
- 在 20 名数据分析师中开展实验,收集 920 个代表多样化分析任务的种子查询。
- 利用众包方式为每个种子查询生成平均 14 个改写版本,以提升数据多样性与规模。
- 采用成对比较方法,由众包工作者评估改写版本之间的语义等价性。
- 使用相对属性方法(Parikh 和 Grauman, 2011)计算语义等价性得分,以过滤低质量改写。
- 为所有查询标注 10 种预定义的低层级分析任务中的一个或多个,以支持多标签分类。
- 在最终的 Quda 数据集上训练并评估多标签分类模型,以评估模型性能与实用性。
实验结果
研究问题
- RQ1大规模、专家标注的自然语言查询数据集能否提升可视化系统中分析任务识别的准确性?
- RQ2结合专家输入与众包改写的方式,在创建多样化且高质量训练数据方面有多高效?
- RQ3Quda 数据集在多大程度上支持构建鲁棒的查询理解与推荐系统?
- RQ4Quda 数据集能否用于训练在视觉分析的不同数据表与领域中具有良好泛化能力的模型?
- RQ5如何在大规模下有效验证众包改写的质量,以保持数据集的完整性?
主要发现
- Quda 数据集包含 14,035 个查询,其中 920 个为专家查询,平均每个查询有 14.14 个改写版本,形成一个多样化且丰富的语料库。
- 该数据集对多标签分类具有挑战性,表明在 V-NLI 任务识别的深度学习模型方面仍有改进空间。
- 在 Quda 上训练的模型显著提升了现有 V-NLI 工具包中任务推理的鲁棒性,减少了对严格规则解析的依赖。
- 基于 Quda 构建的查询推荐技术能通过基于部分输入推荐语义相似的相关查询,有效加速用户交互。
- 采用成对比较与语义评分的验证流程能有效过滤低质量改写,确保在高数据量下仍保持数据质量。
- 作者证明,Quda 不仅可用于基准测试,还能支持实际应用,如查询推荐与任务推理,充分体现了其实际价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。