Skip to main content
QUICK REVIEW

[論文レビュー] Interactive Visual Data Exploration with Subjective Feedback: An Information-Theoretic Approach

Kai Puolamäki, Emilia Oikarinen|arXiv (Cornell University)|Oct 23, 2017
Data Visualization and Analytics参考文献 48被引用数 5
ひとこと要約

本論文は、主観的なユーザーのフィードバックを用いて動的にデータプロジェクション選択をガイドする、インタラクティブで情報理論的な枠組みを提案する。ユーザーが特定したパターンを制約として用い、最大エントロピー分布を計算することで、データと背景分布との差が最も大きいプロジェクションを強調表示し、従来の視覚化では見えない新しい構造を明らかにする。この手法は、合成データおよび実世界のデータにおいて、プロトタイプシステムを用いて効果的に検証された。

ABSTRACT

Visual exploration of high-dimensional real-valued datasets is a fundamental task in exploratory data analysis (EDA). Existing methods use predefined criteria to choose the representation of data. There is a lack of methods that (i) elicit from the user what she has learned from the data and (ii) show patterns that she does not know yet. We construct a theoretical model where identified patterns can be input as knowledge to the system. The knowledge syntax here is intuitive, such as "this set of points forms a cluster", and requires no knowledge of maths. This background knowledge is used to find a Maximum Entropy distribution of the data, after which the system provides the user data projections in which the data and the Maximum Entropy distribution differ the most, hence showing the user aspects of the data that are maximally informative given the user's current knowledge. We provide an open source EDA system with tailored interactive visualizations to demonstrate these concepts. We study the performance of the system and present use cases on both synthetic and real data. We find that the model and the prototype system allow the user to learn information efficiently from various data sources and the system works sufficiently fast in practice. We conclude that the information theoretic approach to exploratory data analysis where patterns observed by a user are formalized as constraints provides a principled, intuitive, and efficient basis for constructing an EDA system.

研究の動機と目的

  • 次元削減手法における静的で事前に定義された基準の限界を是正すること。これは、ユーザー関連のパターンを見逃す可能性がある。
  • ユーザーが直感的で数学的な知識を要しない方法で、観察した知識(例:クラスタ)を表現できるようにすること。
  • 最大エントロピー原理を用いて、システムの信念状態を動的に更新し、次に最も情報量の多い可視化をガイドすること。
  • ユーザーの理解に適応するインタラクティブなEDAシステムを構築すること。これにより、分散が最も高いなどの固定ヒューリスティクスに依存しない。

提案手法

  • システムは、ユーザーが特定したパターン(例:「この点の集合はクラスタです」)を制約として用い、ユーザーの現在の知識を最大エントロピー分布としてモデル化する。
  • プロジェクションプルーフィングを用いて、データと背景分布との間のカルバック・ライブラーレンス・ダイバージェンスが最大になる2次元プロジェクションを特定する。
  • ユーザーは可視化されたプロジェクション上で繰り返しパターンをマークし、それらが背景分布の更新に向けた制約として形式化される。
  • データと背景分布が類似するようになるまでプロセスを繰り返す。これにより、さらに新しい構造は見えなくなると示される。
  • この手法は情報理論に根ざしており、計算が容易な指数型分布族(特に多変量正規分布)を用いる。
  • システムは、高次元データとのリアルタイムインタラクションを可能にするオープンソースツール「SIDER」として実装されている。

実験結果

リサーチクエスチョン

  • RQ1観察されたパターンに関する主観的なユーザーのフィードバックを、データ可視化をガイドする計算モデルに形式化する方法は何か?
  • RQ2最大エントロピーを用いた情報理論的フレームワークは、最も新しい情報量の多い構造を露わにするプロジェクションを効果的に優先できるか?
  • RQ3ユーザーの知識を統合することで、標準的な自動化手法と比較して、探索的データ解析の効率性と関連性はどのように向上するか?
  • RQ4本システムは、インタラクティブなパフォーマンスを維持しながら、現実世界の高次元データセットにスケーリング可能か?
  • RQ5ユーザーの知識に動的に適応する本システムの特性は、PCAのような静的可視化基準と比較してどう異なるか?

主な発見

  • 本システムは、3次元空間における重なった小さなクラスタなど、標準的なPCAプロジェクションでは見えない隠れたクラスタを合成データで効果的に特定した。
  • プロトタイプシステムであるSIDERは実用的なパフォーマンスを示し、数万行のデータセット、特に実際のフローサイトメトリーのデータにも対応している。
  • ユーザーは繰り返し構造をマークすることで、効率的に新しいパターンを発見でき、システムは情報理論的基準に基づき一貫して情報量の多いプロジェクションを選択した。
  • 本アプローチは、分散が最も高い成分に注目するだけの静的手法(例:PCA)を上回り、ユーザー関連で目立たない構造に焦点を当てることで優位性を示した。
  • 直感的なパターンマークによるユーザーのフィードバック統合は、探索プロセスの関連性と効率性を顕著に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。