Skip to main content
QUICK REVIEW

[論文レビュー] Fast and Robust Comparison of Probability Measures in Heterogeneous Spaces

Ryoma Sato, Marco Cuturi|arXiv (Cornell University)|Feb 5, 2020
Gaussian Processes and Bayesian Inference参考文献 48被引用数 10
ひとこと要約

本稿では、各点をその対比較距離の1次元分布(アンカーフィーチャー)として表現することにより、異種空間における確率測度の高速かつロバストな比較のためのアンカーエネルギー(AE)およびアンカーワッサーシュタイン(AW)距離を提案する。スイープラインアルゴリズムを用いてAEをO(n² log n)時間で正確に計算する手法を導入し、Gromov-Wasserstein近似と比較して優れた速度と安定性を示す。ランクベースのバリエーションによりノイズ耐性が向上する。

ABSTRACT

Comparing two probability measures supported on heterogeneous spaces is an increasingly important problem in machine learning. Such problems arise when comparing for instance two populations of biological cells, each described with its own set of features, or when looking at families of word embeddings trained across different corpora/languages. For such settings, the Gromov Wasserstein (GW) distance is often presented as the gold standard. GW is intuitive, as it quantifies whether one measure can be isomorphically mapped to the other. However, its exact computation is intractable, and most algorithms that claim to approximate it remain expensive. Building on \cite{memoli-2011}, who proposed to represent each point in each distribution as the 1D distribution of its distances to all other points, we introduce in this paper the Anchor Energy (AE) and Anchor Wasserstein (AW) distances, which are respectively the energy and Wasserstein distances instantiated on such representations. Our main contribution is to propose a sweep line algorithm to compute AE \emph{exactly} in log-quadratic time, where a naive implementation would be cubic. This is quasi-linear w.r.t. the description of the problem itself. Our second contribution is the proposal of robust variants of AE and AW that uses rank statistics rather than the original distances. We show that AE and AW perform well in various experimental settings at a fraction of the computational cost of popular GW approximations. Code is available at \url{https://github.com/joisino/anchor-energy}.

研究の動機と目的

  • 生物学的・言語的・グラフデータにおいて一般的に見られる、異なる異種メトリック空間にサポートされる確率測度の比較という課題に取り組む。
  • 理論的には妥当だが計算が高コストであるGromov-Wasserstein(GW)距離の計算の非実行可能性を克服する。
  • 計算コストを低減しつつ解釈可能性とロバスト性を維持するGWの効率的代替手法を開発する。
  • グラフ、ワード埋め込み、シングルセルオミクスデータなどの複雑なデータタイプのスケーラブルかつ安定した比較を可能にする。
  • 実世界のデータにおけるノイズや外れ値に対して耐性を高めるために、ランク統計を用いてアンカーフィーチャーの距離を置き換えるバリエーションを導入する。

提案手法

  • 測度付きメトリック空間(MMS)内の各点を、他のすべての点までの距離の1次元経験的分布として表現する(「アンカーフィーチャー」と呼称)。
  • P(R)における負定値カーネルとしての1-Wasserstein距離を用いて、アンカーフィーチャー間のエネルギー距離(AE)を計算する。
  • AEの正確な計算をO(n² log n)時間で行うスイープラインアルゴリズムを提案し、通常のO(n³)の複雑さを低減する。
  • より良い微分可能性と安定性を実現するため、アンカーフィーチャー間のエントロピー正則化ワッサーシュタイン距離としてのアンカーワッサーシュタイン(AW)を導入する。
  • 平均化された輸送計画を用いたAEP(アンカーエネルギー・プロクラステアン)マッピングを考案し、グラフ内のノードマッチングに応用する。
  • アンカーフィーチャーの原始的距離を置き換えるためにランク統計を導入し、ノイズや外れ値に対するロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1Gromov-Wassersteinの計算的負担を抱えず、異種空間における確率測度の比較を高速かつ安定的に行うことは可能か?
  • RQ2アンカーフィーチャーに基づく距離尺度を設計することで、正確かつ効率的な計算が可能になりつつ、意味のある幾何的構造を保つことは可能か?
  • RQ3提案されたスイープラインアルゴリズムは、アンカーフィーチャーにおけるエネルギー距離計算の時間計算量をどのように改善するか?
  • RQ4AEおよびAWのランクベースのバリエーションは、実世界のデータにおけるノイズに対してどの程度ロバスト性を向上させるか?
  • RQ5AEおよびAWは、グラフマッチングや生成モデル評価のタスクにおいて、GWに基づく手法を上回るか同等の性能を示せるか?

主な発見

  • 提案されたスイープラインアルゴリズムにより、アンカーエネルギー(AE)距離がO(n² log n)時間で計算可能となり、入力サイズ(n²のコスト行列)に対して準線形の複雑さを達成した。
  • AEおよびAW距離は、最先端のGW近似手法と比較して著しく高速であり、計算コストが既存手法の僅か一部にまで低減された。
  • AEおよびAWのランクベースのバリエーションはノイズに対する耐性が向上し、合成BAグラフにおけるノードマッピングタスクでGWおよびAWを上回った。
  • グラフマッチングにおいて、AEP(アンカーエネルギー・プロクラステアン)はGW、AW、および中心性に基づく手法と比較して、マッチドノード順序の相関が高かった。これは、役割の保存性が優れていることを示している。
  • グラフ生成モデルの評価において、本手法はGraphRNNが実データと統計的に区別できない(p > 0.05)と正しく同定した。一方、ERおよびBAベースラインは除外された。
  • 本手法により、s個のサンプルに対してO(sn log(sn))時間で正確なエネルギー距離計算が可能となり、大規模なモデル評価が可能かつ効率的になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。