Skip to main content
QUICK REVIEW

[論文レビュー] Co-clustering through Optimal Transport

Charlotte Laclau, Ievgen Redko|arXiv (Cornell University)|May 17, 2017
Domain Adaptation and Few-Shot Learning参考文献 31被引用数 7
ひとこと要約

本稿では、エントロピー正則化最適輸送を用いて、データインスタンスと特徴量の確率的結合をモデル化することで、同時にインスタンスと特徴量をクラスタリングする、新たな非教師あり手法 Co-clustering through Optimal Transport (CCOT) を提案する。この手法は、行クラスタと列クラスタの数を自動で特定し、実世界のデータセット(9×15のブロック構造を示すMovieLensを含む)を用いた検証で最先端の精度と高速性を達成する。

ABSTRACT

In this paper, we present a novel method for co-clustering, an unsupervised learning approach that aims at discovering homogeneous groups of data instances and features by grouping them simultaneously. The proposed method uses the entropy regularized optimal transport between empirical measures defined on data instances and features in order to obtain an estimated joint probability density function represented by the optimal coupling matrix. This matrix is further factorized to obtain the induced row and columns partitions using multiscale representations approach. To justify our method theoretically, we show how the solution of the regularized optimal transport can be seen from the variational inference perspective thus motivating its use for co-clustering. The algorithm derived for the proposed method and its kernelized version based on the notion of Gromov-Wasserstein distance are fast, accurate and can determine automatically the number of both row and column clusters. These features are vividly demonstrated through extensive experimental evaluations.

研究の動機と目的

  • 既存の共通クラスタリング手法の限界、特に事前にクラスタ数を指定する必要がある点を是正すること。
  • 同時にデータインスタンスと特徴量をグループ化できるスケーラブルで高精度な共通クラスタリング手法を開発すること。
  • 事前の知識なしに、行クラスタと列クラスタの両方の数を自動で検出できること。
  • 逆Kullback-Leibler発散の最小化を通じて最適輸送と変分推論を結びつける理論的裏付けを提供すること。

提案手法

  • 本手法は、データインスタンスと特徴量上に定義された経験的測度間の最適輸送問題として共通クラスタリング問題をモデル化する。
  • 計算効率と結合行列の滑らかさを確保するため、エントロピー正則化を用いることで、高速で並列化可能な最適化を可能にする。
  • 最適輸送の解は、二重確率的結合行列として得られ、インスタンスと特徴量の上での結合確率分布として解釈できる。
  • この結合行列は、マルチスケール表現を用いて因子分解され、共通クラスタに対応する行と列のパーティションが抽出される。
  • カーネル化されたバージョンでは、類似度行列上で動作する Gromov-Wasserstein 距離を用いることで、非ユークリッド空間のデータ構造に対しても対応可能である。
  • 最適輸送による密度推定が、逆KL発散の最小化による変分推論に対応することを理論的に示す。

実験結果

リサーチクエスチョン

  • RQ1最適輸送を、クラスタ数を自動で検出可能な原理的枠組みとして再利用できるか?
  • RQ2最適輸送にエントロピー正則化を適用することで、従来のメトリクス的または確率的手法と比較して、スケーラビリティと精度がどのように向上するか?
  • RQ3最適輸送から得られる結合行列が、行と列のパーティションを導出する意味のある結合分布を提供する程度はどの程度か?
  • RQ4類似度行列上で Gromov-Wasserstein 距離を用いたカーネル化された設定にも本手法を一般化できるか?
  • RQ5最適輸送の解が逆KL発散の最小化による変分推論として解釈できることにより、統計的学習の観点から共通クラスタリングへの適用が正当化されるか?

主な発見

  • CCOT-GW は MovieLens データセット上で 9×15 の共通クラスタ構造を自動で検出し、実行間で非常に一貫したパーティション(正規化相互情報量 >0.8)を達成した。
  • 本手法は、正確で解釈可能な共通クラスタを生成した:M1 には『スターウォーズ』(1977年)のような高評価のヒット映画が含まれ、M15 には『アミティビル:ニュー・ジェネレーション』(1993年)のような評価が低い映画が含まれていた。
  • ユーザークラスタは明確なレーティング行動の違いを示し、最後の2つのクラスタは平均より常に低いレーティングを示しており、体系的なユーザーの好みが裏付けられた。
  • 結合行列はデータ行列を効果的に要約しており、ブロックの平均値が共通クラスタ内での均一なレーティングパターンを明確に示していた。
  • アルゴリズムは高い計算効率とスケーラビリティを示し、エントロピー正則化と並列化のおかげで高速な収束を達成した。
  • 逆KL発散の最小化による変分推論との理論的リンクは、本手法の設計に強い統計的基盤を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。