Skip to main content
QUICK REVIEW

[論文レビュー] Document Clustering Based On Max-Correntropy Non-Negative Matrix Factorization

Le Li, Jianjun Yang|arXiv (Cornell University)|Oct 3, 2014
Face and Expression Recognition参考文献 26被引用数 8
ひとこと要約

本稿では、非線形で高次元なデータに対して性能を向上させるために、元のドキュメント行列とその低ランク近似との間の相関微分(correntropy)を最大化する新しいドキュメントクラスタリング手法、Max-Correntropy Non-negative Matrix Factorization (MCC-NMF) を提案する。MCC-NMF は、$l_2$ や KL 散発の従来の NMF 変種よりも優れた性能を示し、トピック数が増加する際でも、Reuters21578 および TDT2 データセットで優れた正確性と頑健性を示している。

ABSTRACT

Nonnegative matrix factorization (NMF) has been successfully applied to many areas for classification and clustering. Commonly-used NMF algorithms mainly target on minimizing the $l_2$ distance or Kullback-Leibler (KL) divergence, which may not be suitable for nonlinear case. In this paper, we propose a new decomposition method by maximizing the correntropy between the original and the product of two low-rank matrices for document clustering. This method also allows us to learn the new basis vectors of the semantic feature space from the data. To our knowledge, we haven't seen any work has been done by maximizing correntropy in NMF to cluster high dimensional document data. Our experiment results show the supremacy of our proposed method over other variants of NMF algorithm on Reuters21578 and TDT2 databasets.

研究の動機と目的

  • 標準の NMF アルゴリズムが $l_2$ や KL 散発に依存するが、非線形で高次元なドキュメントデータでは性能が劣ることがあるという限界を解決すること。
  • 非線形ドキュメントクラスタリングのための NMF における相関微分最大化の可能性を検討すること。
  • トピック数の増加および高次元データにおける、提案手法の頑健性とスケーラビリティを評価すること。
  • 実世界のドキュメントクラスタリングタスクにおいて、相関微分に基づく NMF が従来の NMF 変種を上回ることを示すこと。

提案手法

  • ドキュメントクラスタリングを非負値行列分解問題として定式化し、ドキュメント-語行列 $X$ を二つの低ランク非負行列 $W$ と $H$ に分解する。$X \approx WH$ となるようにする。
  • $l_2$ や KL 散発の最小化ではなく、$X$ と $WH$ 間の相関微分を最大化するという、コアとなる革新点を導入する。これにより、外れ値に対して頑健になり、非線形関係を捉える能力が向上する。
  • 非負性制約を維持しながら、相関微分目的関数に対する勾配上昇法を用いた反復的最適化アルゴリズムを実装する。
  • 自己学習によるカーネルベースの表現を適応的に学習可能であり、複雑な非線形データ分布においても関連特徴を自動で学習し、クラスタリング性能を向上させる。
  • 非負性を最適化中に維持するため、射影勾配法を用いてアルゴリズムを実装する。
  • 最終的なクラスタラベルは、予測クラスタと真値トピックを一致させるために Kuhn-Munkres アルゴリズムを用いて割り当てる。

実験結果

リサーチクエスチョン

  • RQ1高次元で非線形なデータにおいて、標準の $l_2$ や KL 散発に基づく NMF 手法と比較して、NMF における相関微分最大化がドキュメントクラスタリング性能を向上させることができるか?
  • RQ2トピック数が増加する際、特に精度の低下と頑健性の観点から、提案された MCC-NMF 手法の性能はいかがなものか?
  • RQ3相関微分に基づく目的関数は、ドキュメントクラスタリングの潜在的意味空間におけるより良い特徴学習と表現を可能にするか?
  • RQ4複数のデータセットにおいて、GS-CLS や PG-NMF などの他の先進的 NMF 変種と比較して、MCC-NMF のクラスタリング精度はどの程度か?

主な発見

  • Reuters21578 データセットでは、$K=2$ 時に MCC-NMF は 0.911 のクラスタリング正確度を達成し、$l_2$ (0.839)、KL (0.871)、GS-CLS (0.894)、PG (0.838) 変種を顕著に上回った。
  • TDT2 データセットでは、$K=2$ 時に MCC-NMF は 0.927 の正確度を達成し、$l_2$ (0.824)、KL (0.845)、GS-CLS (0.881)、PG (0.863) 手法を上回った。
  • クラスタ数が $K=10$ に増加した際、Reuters21578 において MCC-NMF は 0.736 の高い正確度を維持したのに対し、$l_2$ (0.403)、KL (0.457)、GS-CLS (0.719)、PG (0.415) は著しく低下した。
  • MCC-NMF は、$K$ の増加に伴う精度の低下が最も遅く、トピック数の増加に対して最も頑健な性能を示した。
  • MCC-NMF は、Reuters21578 および TDT2 データセットの両方で、すべてのベースライン手法を一貫して上回った。特に、マルチトピックおよび高次元設定において顕著な優位性を示した。
  • 結果から、相関微分最大化が、従来の損失関数よりもドキュメントクラスタリングにおける非線形特徴表現とクラスタリング性能を向上させることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。