Skip to main content
QUICK REVIEW

[论文解读] VizNet: Towards A Large-Scale Visualization Learning and Benchmarking Repository

Kevin Hu, Neil Gaikwad|arXiv (Cornell University)|May 11, 2019
Data Visualization and Analytics被引用 7
一句话总结

VizNet 引入了一个大规模、公开可用的数据集语料库,包含来自开放存储库和可视化平台的3100万条真实世界数据集,以实现可视化技术的标准化基准测试。通过支持可扩展的众包实验,并展示了用于预测视觉编码有效性的机器学习方法,该研究为可重现的、以数据为驱动的可视化设计研究奠定了基础。

ABSTRACT

Researchers currently rely on ad hoc datasets to train automated visualization tools and evaluate the effectiveness of visualization designs. These exemplars often lack the characteristics of real-world datasets, and their one-off nature makes it difficult to compare different techniques. In this paper, we present VizNet: a large-scale corpus of over 31 million datasets compiled from open data repositories and online visualization galleries. On average, these datasets comprise 17 records over 3 dimensions and across the corpus, we find 51% of the dimensions record categorical data, 44% quantitative, and only 5% temporal. VizNet provides the necessary common baseline for comparing visualization design techniques, and developing benchmark models and algorithms for automating visual analysis. To demonstrate VizNet's utility as a platform for conducting online crowdsourced experiments at scale, we replicate a prior study assessing the influence of user task and data distribution on visual encoding effectiveness, and extend it by considering an additional task: outlier detection. To contend with running such studies at scale, we demonstrate how a metric of perceptual effectiveness can be learned from experimental results, and show its predictive power across test datasets.

研究动机与目标

  • 为解决评估可视化设计技术时缺乏标准化、大规模数据集的问题。
  • 创建一个反映真实世界数据特征的现实、多样化数据集语料库,以提高可视化研究的生态效度。
  • 支持可扩展的在线众包实验,以评估不同任务和数据分布下视觉编码的有效性。
  • 开发能够预测可视化设计感知有效性的机器学习模型,减少对昂贵人工标注的依赖。
  • 提供一个共享基准,用于比较自动化可视化系统,并推动可视化研究中的可重现性。

提出的方法

  • 从开放数据存储库、在线可视化画廊(例如 Tableau Public)和网络爬取(例如 ClueWeb09)聚合了超过3100万条数据集。
  • 对数据集属性进行表征,包括维度(平均3个维度)、数据类型(51%为分类数据,44%为定量数据,5%为时间数据)以及熵和最佳拟合分布等统计特征。
  • 通过在 VizNet 上进行的众包评估,复制并扩展了以往关于图形感知的研究,包括数值估计和异常值检测等任务。
  • 开发了一个机器学习模型,利用众包获取的人工判断标签来预测视觉编码的感知有效性。
  • 应用主动学习策略——自学习和不确定性采样——通过最少的人工标注迭代提升模型性能。
  • 通过 https://viznet.media.mit.edu 公开提供 VizNet 语料库、数据采集脚本和分析工具。

实验结果

研究问题

  • RQ1与以往可视化研究中使用的合成或临时数据集相比,真实世界数据集的结构和数据类型组成有何不同?
  • RQ2任务类型和数据分布在多大程度上影响真实世界数据中视觉编码的有效性?
  • RQ3在众包判断数据上训练的机器学习模型,能否预测未见过的(数据,可视化,任务)三元组中视觉编码的感知有效性?
  • RQ4主动学习策略如何在保持高预测准确性的前提下,降低大规模可视化基准测试中的标注成本?
  • RQ5现有数据语料库中存在哪些关键偏差,影响了可视化研究成果的泛化能力?

主要发现

  • VizNet 语料库包含3100万条数据集,平均每个数据集包含17条记录和3个维度,其分布反映了真实世界数据的特征:51%为分类数据,44%为定量数据,5%为时间数据。
  • 对以往关于视觉编码有效性的研究进行复制后,结果总体一致,但因 VizNet 中真实世界数据集的多样性,揭示了统计上显著的差异。
  • 在任务中增加异常值检测后,揭示了早期研究因数据范围有限而未能捕捉到的关于编码性能的新见解。
  • 在人工判断数据上训练的机器学习模型,在预测未见三元组中视觉编码有效性的表现上达到了非随机水平。
  • 主动学习策略——尤其是不确定性采样和自学习——通过多轮迭代提升了模型准确率,显著减少了对完整人工标注的需求。
  • 该语料库揭示了不同数据源(如 Kaggle、Tableau Public、Rdatasets)之间存在显著偏差,强调了未来研究中需注意采样策略和偏差感知评估的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。