Skip to main content
QUICK REVIEW

[論文レビュー] Shared Generative Latent Representation Learning for Multi-view Clustering

Ming Yin, Weitian Huang|arXiv (Cornell University)|Jul 23, 2019
Video Surveillance and Tracking Methods参考文献 39被引用数 5
ひとこと要約

本稿では、混合ガウス事前分布を用いた変分オートエンコーダーを用いて共有の生成的潜在表現を学習する、深層マルチビュークラスタリング手法DMVCVAEを提案する。視覚固有のオートエンコーダー、非負の融合重み、共有潜在空間を同時に最適化することで、小規模および大規模なマルチビューデータセットにおいて、既存の深層および浅層クラスタリング手法を著しく上回る性能を達成し、正確性、NMI、ARIの観点で最先端の性能を発揮する。

ABSTRACT

Clustering multi-view data has been a fundamental research topic in the computer vision community. It has been shown that a better accuracy can be achieved by integrating information of all the views than just using one view individually. However, the existing methods often struggle with the issues of dealing with the large-scale datasets and the poor performance in reconstructing samples. This paper proposes a novel multi-view clustering method by learning a shared generative latent representation that obeys a mixture of Gaussian distributions. The motivation is based on the fact that the multi-view data share a common latent embedding despite the diversity among the views. Specifically, benefited from the success of the deep generative learning, the proposed model not only can extract the nonlinear features from the views, but render a powerful ability in capturing the correlations among all the views. The extensive experimental results, on several datasets with different scales, demonstrate that the proposed method outperforms the state-of-the-art methods under a range of performance criteria.

研究の動機と目的

  • 大規模データの処理における既存のマルチビュークラスタリング手法の限界、特に劣悪なサンプル再構成性能を是正すること。
  • 複数の視覚から共通の潜在変数に条件付けられるという仮定の下、共通の潜在空間を学習することで、マルチビュー・データの生成プロセスをモデル化し、視覚間の共通情報と補完的情報を捉えること。
  • 統一されたVAEフレームワークの下で、深層オートエンコーダー、視覚固有の融合重み、共有潜在分布を同時に最適化することで、クラスタリング性能を向上させること。
  • 優れたスケーラビリティと再構成能力を備えた、マルチビュー・データに対する効果的な表現学習とクラスタリングを可能にすること。

提案手法

  • 本モデルは、複数の視覚にまたがる共有潜在表現を学習するため、変分オートエンコーダー(VAE)フレームワークを採用しており、すべての視覚が共通の潜在変数に条件付きで依存すると仮定している。
  • 共有潜在空間の事前分布として、混合ガウス(MoG)分布を用いることで、複雑なデータ分布とクラスタ構造を捉えることが可能になる。
  • 非負の融合重みを導入し、異なる視覚からの特徴を適応的に統合する。これらの重みはオートエンコーダーと同時にエンドツーエンドで学習され、情報量の多い視覚を強調する。
  • 本モデルは変分推論を用いて訓練され、観測されたマルチビュー・データの対数尤度の下界を最小化することで最適化される。
  • 最終的なクラスタリング割り当ては、共有潜在変数上の事後分布から直接導出され、エンドツーエンドのクラスタリングを可能にする。
  • 本フレームワークは小規模および大規模なデータセットをサポートしており、NUS-WIDE-Objectを用いたスケーラビリティの有効性が実証されている。

実験結果

リサーチクエスチョン

  • RQ1共有の生成的潜在表現は、異種の複数の視覚においてクラスタリング性能を向上させ得るか?
  • RQ2深層オートエンコーダーと視覚固有の融合重みを同時に最適化することで、マルチビュークラスタリングにおける表現学習をどのように向上させられるか?
  • RQ3混合ガウスを用いたデータ生成プロセスのモデル化は、判別的または非生成的アプローチに比べ、より優れたクラスタリングおよび再構成性能をもたらすか?
  • RQ4既存の手法が計算複雑性のため失敗する大規模なマルチビュー・データセットに対しても、本手法は効果的にスケーリング可能か?

主な発見

  • UCI digits、Caltech-7、ORLのデータセットにおいて、DMVCVAEは95.70%の正確性、91.66%のNMI、91.07%のARIを達成し、すべての浅層および深層ベースラインを上回った。
  • Caltech-7において、本手法は80.14%の正確性、85.38%のNMI、70.48%のARIを達成し、DCCAE(84.62%の正確性)およびVCCAP(83.72%の正確性)を著しく上回った。
  • 大規模なNUS-WIDE-Objectデータセットにおいて、DMVCVAEは19.09%の正確性、21.29%のNMI、31.68%の純度を達成し、すべての指標でLSMVSCおよびBMVCを上回った。
  • t-SNE可視化の結果、訓練エポックにわたるDMVCVAEが学習する潜在空間は、DCCAEおよびVCCAPと比較して、より優れたクラスタ分離性と構造を示した。
  • アブレーションスタディの結果、融合重みと共有潜在空間の共同学習がクラスタリング性能を著しく向上させることを確認し、モデル設計の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。