Skip to main content
QUICK REVIEW

[論文レビュー] VizML: A Machine Learning Approach to Visualization Recommendation

Kevin Hu, Michiel A. Bakker|arXiv (Cornell University)|Aug 14, 2018
Data Visualization and Analytics参考文献 56被引用数 11
ひとこと要約

VizML は、Plotly から収集した 100 万件のデータセット-ビジュアライゼーションペアから、可視化タイプや軸エンコーディングなどのデザイン選択肢を学習することで、効果的なビジュアライゼーションを推薦する機械学習アプローチを提案する。実世界のアナリストの行動に基づいて訓練されたニューラルネットワークモデルは、デザイン選択肢の予測で 70–95% の正確性を達成し、クラウドソーシングベースのベンチマークにおいて人間の合意と同等の性能を示し、従来の ML ベースのシステムを上回る。

ABSTRACT

Data visualization should be accessible for all analysts with data, not just the few with technical expertise. Visualization recommender systems aim to lower the barrier to exploring basic visualizations by automatically generating results for analysts to search and select, rather than manually specify. Here, we demonstrate a novel machine learning-based approach to visualization recommendation that learns visualization design choices from a large corpus of datasets and associated visualizations. First, we identify five key design choices made by analysts while creating visualizations, such as selecting a visualization type and choosing to encode a column along the X- or Y-axis. We train models to predict these design choices using one million dataset-visualization pairs collected from a popular online visualization platform. Neural networks predict these design choices with high accuracy compared to baseline models. We report and interpret feature importances from one of these baseline models. To evaluate the generalizability and uncertainty of our approach, we benchmark with a crowdsourced test set, and show that the performance of our model is comparable to human performance when predicting consensus visualization type, and exceeds that of other ML-based systems.

研究の動機と目的

  • 非エキスパートのアナリストがデータ可視化にアクセスしやすくするために、デザイン意思決定を自動化すること。
  • 手作業で作成されたルールに依存せずに、実世界のデータセット-ビジュアライゼーションペアから直接可視化デザイン選択を学ぶこと。
  • データ駆動型の学習によって、可視化推薦システムの汎用性と解釈可能性を向上させること。
  • クラウドソーシングされたテストセットを用いて、モデルの性能を人間の合意と比較すること。
  • ML ベースの推薦をエンドツーエンドの可視化システムに統合することを可能にすること。

提案手法

  • 著者らは、Plotly Community Feed から 100 万件のユニークなデータセット-ビジュアライゼーションペアのコーパスを収集・クリーニングする。
  • データセットレベルで 841 個の特徴量を抽出し、そのうち 81 個は単一カラム、30 個はペアワイズカラム、16 個は集計に関する特徴量として、データタイプ、分布、関係性を記述する。
  • 各ビジュアライゼーションから、可視化タイプや軸の割り当てといった 7 つの主要なデザイン選択肢を抽出し、予測ターゲットとして用いる。
  • ニューラルネットワークを 60% のデータで訓練し、20% のホールドアウトテストセットで性能を評価する。
  • 機械的タスク(Mechanical Turkers)にバーチャート、ラインチャート、スキャタープロットとしてデータセットを提示し、好まれる可視化タイプに関する合意度を測定することで、クラウドソーシングベースのベンチマークを構築する。
  • ベースラインモデルからの特徴量の重要度分析により、どのデータ特性がデザイン意思決定に最も影響を与えるかを解釈する。

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルは、実世界のデータセット-ビジュアライゼーションペアから、効果的な可視化デザイン選択を学習できるか?
  • RQ2ML ベースの推薦システムの可視化タイプ選択における性能は、人間の合意と比べてどの程度か?
  • RQ3どのデータ特徴量が特定の可視化デザイン選択を最も予測可能にしているか?
  • RQ4モデルは未観測のデータセットに一般化可能で、可視化好みの不確実性に対しても対応できるか?
  • RQ5VizML の性能は、既存のルールベースおよび ML ベースの可視化推薦システムと比べてどの程度か?

主な発見

  • データセット-ビジュアライゼーションコーパスの 60% で訓練されたニューラルネットワークは、20% のテストセットでデザイン選択の予測に 70–95% の正確性を達成した。
  • クラウドソーシングベースのベンチマークにおけるモデルの性能は、人間のアノテーターと同等であり、可視化タイプに関する人間の合意と強い整合性を示している。
  • DeepEye や Data2Vis、Draco-Learn といった他の ML ベースのシステムと比較して、可視化デザイン選択の予測において優れた性能を発揮した。
  • 特徴量の重要度分析から、データタイプ、分布の形状、カラム名の性質が、可視化推薦に顕著に影響を与えていることが明らかになった。
  • モデルは未観測のデータセットに対しても良好に一般化され、予測の信頼性が高く、不確実性が低いことが示された。
  • 特徴量の重要度を通じた解釈可能性が可能であり、エンドツーエンドの推薦パイプラインへの統合を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。