Skip to main content
QUICK REVIEW

[論文レビュー] Sketching, Embedding, and Dimensionality Reduction for Information Spaces

Amirali Abdullah, Ravi Kumar|arXiv (Cornell University)|Mar 17, 2015
Face and Expression Recognition参考文献 30被引用数 7
ひとこと要約

本稿では、高次元確率空間におけるジャナイン=シャノン、ヘルンバーガー、χ²発散などの情報発散度に対して、効率的なスケッチ、埋め込み、次元削減手法を提示する。発散度が集約ストリームモデルにおいてサブリニア空間でスケッチ可能であり、乗法的歪みを伴う低次元ユークリッド空間に埋め込み可能であり、確率分布の単体構造を保持したまま次元削減が可能であることを示した。これにより、情報幾何的距離のスケーラブルで証明可能な正確性を有する解析が可能になる。

ABSTRACT

Information distances like the Hellinger distance and the Jensen-Shannon divergence have deep roots in information theory and machine learning. They are used extensively in data analysis especially when the objects being compared are high dimensional empirical probability distributions built from data. However, we lack common tools needed to actually use information distances in applications efficiently and at scale with any kind of provable guarantees. We can't sketch these distances easily, or embed them in better behaved spaces, or even reduce the dimensionality of the space while maintaining the probability structure of the data. In this paper, we build these tools for information distances---both for the Hellinger distance and Jensen--Shannon divergence, as well as related measures, like the $χ^2$ divergence. We first show that they can be sketched efficiently (i.e. up to multiplicative error in sublinear space) in the aggregate streaming model. This result is exponentially stronger than known upper bounds for sketching these distances in the strict turnstile streaming model. Second, we show a finite dimensionality embedding result for the Jensen-Shannon and $χ^2$ divergences that preserves pair wise distances. Finally we prove a dimensionality reduction result for the Hellinger, Jensen--Shannon, and $χ^2$ divergences that preserves the information geometry of the distributions (specifically, by retaining the simplex structure of the space). While our second result above already implies that these divergences can be explicitly embedded in Euclidean space, retaining the simplex structure is important because it allows us to continue doing inference in the reduced space. In essence, we preserve not just the distance structure but the underlying geometry of the space.

研究の動機と目的

  • 高次元データ解析におけるジャナイン=シャノンやχ²発散度といった情報発散度のためのスケーラブルで、証明可能な正確性を有するアルゴリズム的ツールの不足に対処すること。
  • 厳密なターンスタイルモデルではこれらの発散度のスケッチが不可能であることが知られているが、集約ストリームモデルにおいてはその可能性を示すこと。
  • 確率分布の下位の単体幾何構造を保持する低次元埋め込みを可能にすること。
  • 次元削減を実現し、分布の情報幾何的構造を維持することにより、低次元空間でも推論を継続可能にすること。
  • 既存のℓ₁およびℓ₂ノルムのためのツールを情報的発散度へと拡張し、機械学習およびデータ解析分野における適用範囲を広げること。

提案手法

  • JSまたはχ²発散度の下で点の決定的埋め込みをℓ²空間に実施し、O(d²/ε log(d/ε))次元およびεの加法的誤差を達成する。
  • AMSスケッチとジョンソン=リンデンストラウス補題を組み合わせ、集約ストリームモデルにおいて(1+ε)-乗法的近似をO(1/ε² log(1/ε) log d)次元で達成する。
  • 2段階の埋め込みを実施:まず、∑xᵢ = 0を満たす超平面L ⊂ ℝᵏ⁺¹に埋め込み、次にスケーリングと平行移動により確率単体Δₖ₊₁に収める。
  • テイラー展開により、良好に定義されたf-発散度は単体中心付近でほぼユークリッド的であることを示し、rが小さいときD_f(p,q) ≈ t·‖p−q‖₂²となる。
  • 任意のε > 0に対して、半径rおよびスケーリング係数tが存在し、単体中心の半径rの球内では(1−ε)‖p−q‖₂² ≤ t·D_f(p,q) ≤ (1+ε)‖p−q‖₂²が成り立つことを証明する。
  • ℓ²への埋め込み、JL補題、単体射影を組み合わせることで、良好に定義されたf-発散度に対して(1+ε)の歪みをO(log n / ε²)次元で達成する。

実験結果

リサーチクエスチョン

  • RQ1厳密なターンスタイルモデルでは不可能であることが知られているが、集約ストリームモデルにおいてジャナイン=シャノンやχ²発散度を効率的にスケッチできるか?
  • RQ2これらの発散度を低次元ユークリッド空間に埋め込む際に、対象間の距離を保持できるか?
  • RQ3確率単体の幾何的構造を損なわずに、これらの発散度に対して次元削減が可能か?
  • RQ4単体内に、f-発散度が二乗ユークリッド距離に類似する局所領域が存在するか?これにより低歪み埋め込みが可能か?
  • RQ5核が無限次元であるような発散度(例:JSやχ²)に対しても、このような埋め込みが明示的に計算可能か?

主な発見

  • 本稿では、集約ストリームモデルにおいてJSおよびχ²発散度がサブリニア空間でスケッチ可能であり、O(1/ε² log(1/ε) log d)次元で(1+ε)-乗法的近似を達成することを確立した。
  • JSおよびχ²発散度の有限次元ℓ²空間への埋め込みが、O(d²/ε log(d/ε))次元およびεの加法的誤差で達成された。
  • 次元削減の結果、良好に定義されたf-発散度に対して(1+ε)の歪みをO(log n / ε²)次元で達成し、確率分布の単体構造を保持した。
  • 単体中心付近では、任意の良好に定義されたf-発散度はほぼ二乗ユークリッド距離と同等であり、十分に小さいrに対して歪みが(1±ε)で有界である。
  • 核が無限次元であるような発散度(例:JSやχ²)に対しても、核が乗法的誤差内で有限次元に近似可能であれば、埋め込みは明示的に計算可能である。
  • 埋め込み、JL補題、単体射影からなる全体のパイプラインの歪みは(1+ε)で有界であり、(1+ε/4)³ ≤ 1+εを満たす誤差の合成により達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。