Skip to main content
QUICK REVIEW

[論文レビュー] Online Multi-view Clustering with Incomplete Views

Weixiang Shao, Lifang He|arXiv (Cornell University)|Nov 2, 2016
Advanced Computing and Algorithms被引用数 6
ひとこと要約

本論文では、欠損のあるビューを伴う大規模データを対象とした、最初のオンラインマルチビュークラスタリング手法であるOMVCを提案する。クラスタリングをチャンク単位で処理する連合重み付き非負値行列分解問題としてモデル化することで、メモリ使用量を削減し、欠損インスタンスを動的に低重み化し、Lasso正則化によりロバスト性を向上させ、実世界のデータセットにおいて最先端の性能を達成する。

ABSTRACT

In the era of big data, it is common to have data with multiple modalities or coming from multiple sources, known as "multi-view data". Multi-view clustering provides a natural way to generate clusters from such data. Since different views share some consistency and complementary information, previous works on multi-view clustering mainly focus on how to combine various numbers of views to improve clustering performance. However, in reality, each view may be incomplete, i.e., instances missing in the view. Furthermore, the size of data could be extremely huge. It is unrealistic to apply multi-view clustering in large real-world applications without considering the incompleteness of views and the memory requirement. None of previous works have addressed all these challenges simultaneously. In this paper, we propose an online multi-view clustering algorithm, OMVC, which deals with large-scale incomplete views. We model the multi-view clustering problem as a joint weighted nonnegative matrix factorization problem and process the multi-view data chunk by chunk to reduce the memory requirement. OMVC learns the latent feature matrices for all the views and pushes them towards a consensus. We further increase the robustness of the learned latent feature matrices in OMVC via lasso regularization. To minimize the influence of incompleteness, dynamic weight setting is introduced to give lower weights to the incoming missing instances in different views. More importantly, to reduce the computational time, we incorporate a faster projected gradient descent by utilizing the Hessian matrices in OMVC. Extensive experiments conducted on four real data demonstrate the effectiveness of the proposed OMVC method.

研究の動機と目的

  • メモリに収まらない大規模なマルチビューデータにおいて、ビューが欠損している場合のクラスタリングの課題に対処すること。
  • 完全なビューとメモリにすべてのデータを保持する必要がある従来のマルチビュークラスタリング手法の制限を克服すること。
  • メモリ消費量を低減しながらクラスタリング精度を維持するため、データを段階的に処理するオンラインアルゴリズムを開発すること。
  • 異なるビューにおける欠損インスタンスの影響を動的重み調整により最小限に抑えること。
  • 潜在的特徴学習プロセスにLasso正則化を組み込むことで、ノイズや外れ値に対するロバスト性を向上させること。

提案手法

  • OMVCは、複数のビューにおける潜在的特徴行列を学習するために、マルチビュークラスタリングを連合重み付き非負値行列分解(NMF)問題としてモデル化する。
  • すべてのデータをメモリに保持するのではなく、データをチャンク単位で処理することで、大規模データセットへのスケーラビリティを実現する。
  • 動的重み設定により、各ビューにおける欠損インスタンスに低い重みを割り当て、学習プロセスへの影響を低減する。
  • コンSENSUS行列を学習し、それを用いて複数のビュー間の潜在的特徴行列を共通正則化することで、一貫性を促進する。
  • 潜在的特徴行列にLasso(ℓ1)正則化を適用することで、ノイズや外れ値に対するロバスト性を向上させる。
  • 収束を高速化するために、ヘッセ行列を活用した高速化された投影勾配降下法を用いる。

実験結果

リサーチクエスチョン

  • RQ1メモリに収まらない大規模な欠損ビューを伴うデータセットに対して、オンラインマルチビュークラスタリングを効果的に適用できるか?
  • RQ2異なるビューにおける欠損インスタンスをどのように動的に低重み化することで、クラスタリングへの悪影響を軽減できるか?
  • RQ3欠損のあるマルチビュークラスタリングにおいて、共通正則化の強さとビュー固有の学習の最適なバランスは何か?
  • RQ4Lasso正則化は、ノイズや外れ値が存在する状況で、学習された潜在的特徴行列のロバスト性をどのように向上させるか?
  • RQ5投影勾配降下法にヘッセ行列を用いることで、オンラインマルチビュークラスタリングにおける計算時間を著しく短縮できるか?

主な発見

  • OMVCは、4つの実世界データセットにおいて最先端のクラスタリング性能を達成し、NMIおよび調整ランダムインデックスの観点で従来手法を上回った。
  • アルゴリズムは安定した収束を示し、目的関数の損失が反復回数を増やすにつれて減少し、最終的に安定した。
  • 最適なパラメータ設定は α ≈ 10⁻² および β ≈ 10⁻⁷ であることが判明した。ここで α はコンセンサスの影響を制御し、β はLasso正則化によるスパarsityを制御する。
  • 感度分析により、α と β の両方が性能に顕著な影響を及ぼすことが確認され、非最適な値は性能の低下を引き起こした。
  • 欠損インスタンスに対する動的重み付けの使用は、その悪影響を効果的に低減し、クラスタリングのロバスト性を向上させた。
  • 最適化プロセスにヘッセ行列を組み込むことで、収束が著しく高速化され、計算時間が大幅に短縮された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。