[论文解读] ML-based Visualization Recommendation: Learning to Recommend Visualizations from Data
本文提出了首个基于机器学习的端到端可视化推荐系统,该系统从大规模数据集和可视化样本中学习,能够自动生成、评分并排序针对新数据集的有效可视化。通过使用宽深神经网络架构,该模型从数据中学习细微的视觉设计偏好,超越了基于规则的系统,专家偏好得分显著提高(5.92/7 对比 3.45),并解决了基于规则方法中常见的分数并列问题。
Visualization recommendation seeks to generate, score, and recommend to users useful visualizations automatically, and are fundamentally important for exploring and gaining insights into a new or existing dataset quickly. In this work, we propose the first end-to-end ML-based visualization recommendation system that takes as input a large corpus of datasets and visualizations, learns a model based on this data. Then, given a new unseen dataset from an arbitrary user, the model automatically generates visualizations for that new dataset, derive scores for the visualizations, and output a list of recommended visualizations to the user ordered by effectiveness. We also describe an evaluation framework to quantitatively evaluate visualization recommendation models learned from a large corpus of visualizations and datasets. Through quantitative experiments, a user study, and qualitative analysis, we show that our end-to-end ML-based system recommends more effective and useful visualizations compared to existing state-of-the-art rule-based systems. Finally, we observed a strong preference by the human experts in our user study towards the visualizations recommended by our ML-based system as opposed to the rule-based system (5.92 from a 7-point Likert scale compared to only 3.45).
研究动机与目标
- 为解决基于规则的可视化推荐系统存在的区分度差、评分僵化和维护成本高等局限性。
- 开发一个完全基于数据、自动且可扩展的系统,从真实用户生成的可视化中学习有效的推荐策略。
- 通过深度学习学习连续且有意义的评分,以克服基于规则系统中评分完全相同的根本性问题。
- 构建一个可泛化的推荐模型,可应用于任意新数据集而无需手动重新配置。
- 通过定量评估、用户研究和定性分析验证系统的有效性。
提出的方法
- 将基于机器学习的可视化推荐问题形式化为属性组合与可视化配置的学习任务。
- 设计一种宽深神经网络,结合宽线性特征(如属性类型、布局偏好)与数据及可视化结构的深层表征。
- 在大规模真实数据集及其相关可视化样本上端到端训练模型,以预测可视化有效性的评分。
- 利用学习到的模型,基于训练数据中学到的模式,为新出现的、未见过的数据集生成、评分并排序可视化。
- 通过数据驱动的信号而非硬编码规则,将人类设计偏好(如偏好横向布局而非纵向布局)融入模型。
- 开发一个全面的评估框架,以定量评估未见数据上的排序质量与模型性能。
实验结果
研究问题
- RQ1基于数据驱动的端到端机器学习模型能否推荐出比基于规则系统更有效的可视化?
- RQ2该模型在无需微调或手动配置的情况下,对新出现的、未见过的数据集的泛化能力如何?
- RQ3该模型在多大程度上解决了基于规则系统中常见的并列问题,即大量可视化获得相同的0分?
- RQ4人类专家如何评价基于机器学习的系统与基于规则系统所推荐的可视化质量与实用性?
- RQ5该模型能从数据中学习到哪些现有基于规则系统未编码的设计与布局偏好?
主要发现
- 基于机器学习的系统获得了5.92(满分7分)的平均专家偏好得分,显著高于基于规则系统的3.45分,表明人类专家对其推荐结果有更强偏好。
- 在20位人类专家参与的用户研究中,基于机器学习系统的最高分可视化与专家的首选完全一致,表明其与专家判断高度一致。
- 该模型成功解决了基于规则系统中常见的并列问题,即大量可视化获得相同的0分,通过学习连续且具有区分度的评分实现。
- 宽深架构有效捕捉了复杂的可视化偏好,例如更偏好横向布局而非纵向布局,这与专家实践一致。
- 定性分析表明,该模型从数据中学习到了细微且非显而易见的视觉设计规则,这些规则在基于规则的系统中并不存在。
- 定量评估证实,该模型对可视化排序的效果显著优于基线的基于规则方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。