Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Deep Unsupervised Clustering with Concrete GMVAEs

Mark Collier, Hector Urdiales|arXiv (Cornell University)|Sep 18, 2019
Gaussian Processes and Bayesian Inference参考文献 11被引用数 5
ひとこと要約

本稿では、Gaussian Mixture VAEにおける離散的クラスタ割り当てを、Concrete(Gumbel-Softmax)分布を用いた連続的リラクゼーションに置き換えることで、スケーラブルな深層教師なしクラスタリング手法であるConcrete GMVAEを提案する。再パラメータライゼーショントリックを用いた微分可能なサンプリングにより、訓練時間の計算量がクラスタ数に線形に依存するのをやめ、定数に低下し、20個のクラスタを用いたCIFAR-100では75–80%の高速化を達成しながら、同等のクラスタリング性能を維持する。

ABSTRACT

Discrete random variables are natural components of probabilistic clustering models. A number of VAE variants with discrete latent variables have been developed. Training such methods requires marginalizing over the discrete latent variables, causing training time complexity to be linear in the number clusters. By applying a continuous relaxation to the discrete variables in these methods we can achieve a reduction in the training time complexity to be constant in the number of clusters used. We demonstrate that in practice for one such method, the Gaussian Mixture VAE, the use of a continuous relaxation has no negative effect on the quality of the clustering but provides a substantial reduction in training time, reducing training time on CIFAR-100 with 20 clusters from 47 hours to less than 6 hours.

研究の動機と目的

  • 標準GMVAEの訓練時間の計算量がクラスタ数に線形に依存する問題を解決すること。これは、離散的クラスタ割り当ての周辺化に起因する。
  • 現在の計算コストの高さにより実行が困難であるが、大規模なクラスタ数を有する深層クラスタリングモデルのエンドツーエンド訓練を可能にすること。
  • 離散的潜在変数の連続的リラクゼーションにより、訓練時間を著しく短縮しながらも、クラスタリング性能を維持すること。
  • クラスタ割り当て変数の連続的リラクゼーションが、対数尤度やクラスタリング能力という観点でモデル品質を劣化させないことの実証。

提案手法

  • GMVAEにおける離散的カテゴリカル分布 $ q(\mathbf{y} \mid \mathbf{x}) $ を、微分可能なサンプリングを可能にする連続的Concrete分布に置き換える。
  • Concrete分布に再パラメータライゼーショントリックを適用し、すべてのクラスタインデックスの和集合を取らずに、勾配のバックプロパゲーションをクラスタ割り当てを介して行えるようにする。
  • ELBOの1サンプルモンテカルロ推定を用いることで、$ \mathbf{y} $ の和集合を必要としなくなり、訓練時間の計算量が $ O(K) $ から $ O(1) $ に低下する。ここで $ K $ はクラスタ数を表す。
  • KLダイバージェンス項 $ D_{KL}(q(\mathbf{y} \mid \mathbf{x}) \parallel p(\mathbf{y})) $ に対して、初期は0から始まり1に増加する温度のアニーリングスケジュールを導入し、後方分布の崩壊を防ぎ、意味のあるクラスタ使用を促進する。
  • 効率的かつ微分可能な訓練を可能にするために、緩和された後方分布から $ \mathbf{y} $ と $ \mathbf{z} $ を祖先サンプリングにより生成する。
  • 推論時においては、$ q(\mathbf{y} \mid \mathbf{x}) $ のargmaxをone-hotエンコーディングすることで $ \mathbf{y} $ を離散化し、元の離散的クラスタ割り当てを回復する。

実験結果

リサーチクエスチョン

  • RQ1GMVAEにおける離散的クラスタ割り当ての連続的リラクゼーションが、クラスタリング性能に悪影響を及げることなく、訓練時間の計算量を低減できるか?
  • RQ2Concrete分布が、深層クラスタリングモデルにおける離散的潜在変数を介した効果的なバックプロパゲーションを可能にするか?
  • RQ3標準GMVAEと比較して、クラスタ数の増加に伴うConcrete GMVAEの訓練時間のスケーリング特性はいかほどか?
  • RQ4KLアニーリングが、意味のあるクラスタ割り当てを学習する能力に与える影響は何か?
  • RQ5Concrete GMVAEは、標準GMVAEと同等の対数尤度およびクラスタリング品質を達成しながら、著しく高速化できるか?

主な発見

  • CIFAR-100(20クラスタ)において、Concrete GMVAEは1回の訓練で47.24時間から5.73時間にまで訓練時間を75%削減した。
  • MNIST(10クラスタ)では、訓練時間が15.73時間から3.55時間にまで短縮され、77%の高速化を達成した。
  • テストセットの対数尤度は、標準GMVAEとConcrete GMVAEでほぼ同一である:MNISTでは -46.96 ± 0.81 対 -46.61 ± 0.79、CIFAR-100では -1725.87 ± 2.12 対 -1725.47 ± 2.20 であった。
  • KLアニーリングを実施しない場合、KLダイバージェンスが0に収束し、クラスタ割り当ての学習に失敗することが確認され、アニーリングスケジュールの必要性が裏付けられた。
  • 訓練時間の計算量は、クラスタ数に依存しなくなり、実質的に定数に近づいた。これにより、従来のGMVAEでは実行が困難であった大規模クラスタリング問題へのスケーラビリティが可能になった。
  • 本手法は、モデル品質を維持しつつ、大規模なクラスタ数を有する深層クラスタリングモデルの効率的かつエンドツーエンドの訓練を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。