Skip to main content
QUICK REVIEW

[論文レビュー] Data-driven regularization of Wasserstein barycenters with an application to multivariate density registration

Jérémie Bigot, Elsa Cazelles|arXiv (Cornell University)|Apr 24, 2018
Point processes and geometric inequalities参考文献 28被引用数 7
ひとこと要約

本稿では、ノイズが強く、ずれが生じた密度データからの多次元点群を同時に整列・平滑化するためのデータ駆動型正則化フレームワークを、Wasserstein重心に提案する。エントロピー正則化(Sinkhorn重心)と関数的ペナルティアプローチの両方における正則化パラメータの選択にGoldenshluger-Lepskiの原則を適用することで、密度登録におけるロバスト性と精度が向上し、シミュレーテッドなガウス混合分布および実際のフローサイトメトリー・データでその有効性が示された。

ABSTRACT

We present a framework to simultaneously align and smooth data in the form of multiple point clouds sampled from unknown densities with support in a d-dimensional Euclidean space. This work is motivated by applications in bioinformatics where researchers aim to automatically homogenize large datasets to compare and analyze characteristics within a same cell population. Inconveniently, the information acquired is most certainly noisy due to mis-alignment caused by technical variations of the environment. To overcome this problem, we propose to register multiple point clouds by using the notion of regularized barycenters (or Fr\\'{e}chet mean) of a set of probability measures with respect to the Wasserstein metric. A first approach consists in penalizing a Wasserstein barycenter with a convex functional as recently proposed in Bigot and al. (2018). A second strategy is to transform the Wasserstein metric itself into an entropy regularized transportation cost between probability measures as introduced in Cuturi (2013). The main contribution of this work is to propose data-driven choices for the regularization parameters involved in each approach using the Goldenshluger-Lepski's principle. Simulated data sampled from Gaussian mixtures are used to illustrate each method, and an application to the analysis of flow cytometry data is finally proposed. This way of choosing of the regularization parameter for the Sinkhorn barycenter is also analyzed through the prism of an oracle inequality that relates the error made by such data-driven estimators to the one of an ideal estimator.

研究の動機と目的

  • データ収集時の技術的ずれによって生じる多次元密度データの位相可変性に対処すること。特に高次元の生物学的データセットにおいて。
  • 未知の確率密度から抽出された$\mathbb{R}^d$上の複数の点群を同時に登録・平滑化する統一フレームワークの開発。
  • ユークリッド平均では形状を保持できないため、Wasserstein重心を幾何的平均として用いることで、ずれの影響を受ける形状を保存する。
  • 基礎的な密度構造の知識が得られない状況でも最適な性能を達成するため、Goldenshluger-Lepskiの原則を用いて正則化パラメータをデータ駆動的に選択する。
  • 合成データ(ガウス混合)および実際のフローサイトメトリー・データを用いて手法の有効性を検証し、バイオインフォマティクス分野における実用的意義を示す。

提案手法

  • Wasserstein重心を$W_2$距離に基づく確率測度空間におけるフレシェ平均として定式化することで、ずれのある点群の整列と平滑化を可能にする。
  • 2つの正則化戦略を適用する:(1) サンクホルン発散を用いたエントロピー正則化により、Wasserstein距離の計算を実行可能にする。また、(2) 関数的ペナルティ(例:TV、チホノフ)を用いて重心の滑らかさを強制する。
  • 推定リスクを最小化するため、Goldenshluger-Lepskiの原則を用いて正則化パラメータ$\varepsilon$および$\gamma$をデータ駆動的に最適選択する。
  • 双対最適化を、双対変数の再パラメータライゼーション($\psi_i = \phi_i + K^T\phi_0/n$)を用いて実装することで、収束の安定化と計算複雑度の低減を図る。
  • 輸送写像の安定な部分勾配を計算するため、$K=10$個の近隣点を用い、勾配降下法(滑らかでないペナルティにはFISTA、滑らかなペナルティにはL-BFGSを用いる)。
  • 最近接点から導かれる確率的輸送行列$S_i$を用いて、最適な双対変数から重心を再構築する。式は$f_i^k = \sum_j \nu_i^j S_i^{jk}$で表される。

実験結果

リサーチクエスチョン

  • RQ1複数のずれが生じた多次元点群を同時に整列・平滑化し、代表的かつ形状を保持する重心を回復するには、どのような手法が有効か?
  • RQ2Wasserstein重心を正則化する最適な方法は何か?データへの忠実性と得られる密度の滑らかさのバランスを取る。
  • RQ3エントロピー正則化および関数的正則化の文脈において、Goldenshluger-Lepskiの原則を正則化パラメータのデータ駆動的選択に効果的に適用できるか?
  • RQ4最適パラメータが既知のオракル推定量と比較して、データ駆動型正則化の性能はどの程度向上するか?
  • RQ5本手法は、フローサイトメトリーのような実世界の生物学的データセットにおける登録精度をどの程度向上させるか?

主な発見

  • Goldenshluger-Lepskiの原則によるデータ駆動的正則化パラメータ選択により、オラクル推定量と同等の性能を示す重心が得られ、理想の推定量との誤差を関連付けるオラクル不等式によってその有効性が裏付けられた。
  • シミュレーテッドなガウス混合分布において、データ駆動的$\varepsilon=1.6$を用いたサインクホルン重心は、ユークリッド平均が示す誤ったモードを避けて、真の密度形状を的確に回復した。
  • 多変量密度データにおける位相可変性が効果的に低減された。被験者間の二峰性および多峰性分布の整列が明確に示された。
  • 部分勾配計算に$K=10$個の近隣点を用いることで、単一の近隣点選択と比較して、数値的安定性が著しく向上した。
  • 実際のフローサイトメトリー・データにおいて、正確な登録と平滑化が達成され、複数のサンプル間での細胞集団の信頼性の高い比較が可能になった。
  • 理論的分析により、わずかな正則性仮定のもとで、提案手法の推定量が最適収束速度を達成することが確認され、誤差がオラクルリスクの定数倍で抑えられていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。