Skip to main content
QUICK REVIEW

[論文レビュー] Effortless Data Exploration with zenvisage: An Expressive and Interactive Visual Analytics System

Tarique Siddiqui, Albert Kim|arXiv (Cornell University)|Apr 12, 2016
Data Visualization and Analytics参考文献 48被引用数 19
ひとこと要約

この論文では、ZQL—視覚的可視化の照会および合成のためのドメイン固有言語—を用いて、次世代の表現的でインタラクティブなビジュアルアナリティクスシステム「ZenVisage」を紹介する。次元ベースの反復処理、関数的プリミティブ T(トレンド分析)および D(類似度測定)、およびプラグイン可能なユーザー定義関数を組み合わせることで、ZenVisage はトレンドフィルタリング、類似度検索、外れ値検出といった複雑な分析タスクを、最適化された SQL ベースの実行と並列処理により高速に実行可能にする。

ABSTRACT

Data visualization is by far the most commonly used mechanism to explore data, especially by novice data analysts and data scientists. And yet, current visual analytics tools are rather limited in their ability to guide data scientists to interesting or desired visualizations: the process of visual data exploration remains cumbersome and time-consuming. We propose zenvisage, a platform for effortlessly visualizing interesting patterns, trends, or insights from large datasets. We describe zenvisage's general purpose visual query language, ZQL ("zee-quel") for specifying the desired visual trend, pattern, or insight - ZQL draws from use-cases in a variety of domains, including biology, mechanical engineering, climate science, and commerce. We formalize the expressiveness of ZQL via a visual exploration algebra, and demonstrate that ZQL is at least as expressive as that algebra. While analysts are free to use ZQL directly, we also expose ZQL via a visual specification interface that we describe in this paper. We then describe our architecture and optimizations, preliminary experiments in supporting and optimizing for ZQL queries in our initial zenvisage prototype, and a user study to evaluate whether data scientists are able to effectively use zenvisage for real applications.

研究の動機と目的

  • コードを書かずに複雑なビジュアルアナリティクスタスクを表現できるようにすることで、インタラクティブでスケーラブルなデータ探索の課題に対処すること。
  • 低レベルのデータ操作を高レベルで合成可能なクエリに抽象化することで、大規模なデータ可視化の探索における認知的・技術的負荷を軽減すること。
  • 次元ベースの反復、トレンドおよび類似度関数、拡張可能なユーザー定義関数といった表現力豊かなクエリ構文を通じて、柔軟でユーザー主導の探索を支援すること。
  • 並列処理と SQL ベースの可視化計算の予測実行を活用した最適化により、クエリの実行パフォーマンスを向上させること。

提案手法

  • ドメイン固有言語 ZQL を用いて、軸変数、可視化コレクション、およびフィルタリングと最適化オペレータを用いたプロセスカラムの処理により、ユーザーが可視化を定義できる。
  • 本システムは、2つのコアな関数的プリミティブを採用している:T(f) は可視化 f の実数値トレンドスコア(例:傾き)を計算し、D(f,f') はユークリッド距離やカルバック・ライブラー発散などのメトリクスを用いて2つの可視化間の類似度を測定する。
  • ZQL は複数の次元(例:製品、場所)にわたる可視化の探索を可能にする次元ベースの反復をサポートしており、可視化コレクションの合成やフィルタリングが可能である。
  • システムは ZQL クエリを最適化された SQL クエリに変換し、データベースでの実行を可能にし、結果を f# タグでラベル付けされた多次元配列にパッケージ化する。
  • 引数の最大値/最小値を求めるような操作のための自動的なループネストが、クエリプランに生成され、ZQL コンパイラはマルチクエリ最適化や予測実行などの最適化を適用してパフォーマンスを向上させる。
  • プラグイン可能な Java ベースの関数により、ユーザーは ZQL にカスタム論理を拡張可能であるが、これらはブラックボックスとして扱われ、コンパイラによる最適化の対象とはならない。

実験結果

リサーチクエスチョン

  • RQ1低レベルのコードを書かずに、大規模な可視化コレクションを効率的に探索するにはどうすればよいか?
  • RQ2トレンド検出、類似度検索、外れ値同定といった一般的なビジュアルアナリティクスタスクをサポートするには、どのような表現力豊かなクエリプリミティブが必要か?
  • RQ3数千の可視化を扱う際、ビジュアルクエリ実行のパフォーマンスをどのように最適化できるか?
  • RQ4高レベルのビジュアルクエリを、効率的なデータベース操作にコンパイルすることはどの程度可能か?

主な発見

  • ZQL は、最小限の表現力豊かなプリミティブを用いて、トレンドフィルタリング、類似度検索、外れ値検出といった幅広いビジュアルアナリティクスタスクをサポートする。
  • 関数的プリミティブ T と D の使用により、ユーザーはカスタムコードを書かずに複雑な可視化的性質や比較を表現できる。
  • 独立した c-node の SQL クエリの並列処理により、マルチクエリ最適化によってディスク I/O を削減し、パフォーマンスが著しく向上する。
  • c-node のスーパーセットクエリの予測実行により、相互に依存するクエリプランにおけるレイテンシが低減され、必要なデータを事前にフェッチする。
  • ZQL を最適化された SQL プランに変換できるという本システムの能力により、複雑なビジュアルアナリティクスワークフローの効率的実行が可能になる。
  • プラグイン可能な関数により ZQL の機能が拡張可能であるが、これらは自動最適化の対象とならず、表現力とパフォーマンスのトレードオフが顕在化している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。