Skip to main content
QUICK REVIEW

[論文レビュー] Do logarithmic proximity measures outperform plain ones in graph clustering?

Vladimir Ivashkin, Pavel Chebotarev|arXiv (Cornell University)|May 3, 2016
Advanced Clustering Algorithms Research被引用数 4
ひとこと要約

本稿では、グラフの近接度測定値の対数変換が、単純な測定値と比較してクラスタリング性能を向上させるかを調査している。ほとんどの場合——特に同質的なクラスを有するランダムグラフにおいて——Communicability や Commute Time などの近接度測定値の対数版は、クラスタリングアルゴリズムの加法的性質と根本的に整合するため、単純な対応する測定値を上回る。対数変換により、乗法的カーネル特性が加法的距離構造に変換され、クラスタ分離性が向上する。

ABSTRACT

We consider a number of graph kernels and proximity measures including commute time kernel, regularized Laplacian kernel, heat kernel, exponential diffusion kernel (also called "communicability"), etc., and the corresponding distances as applied to clustering nodes in random graphs and several well-known datasets. The model of generating random graphs involves edge probabilities for the pairs of nodes that belong to the same class or different predefined classes of nodes. It turns out that in most cases, logarithmic measures (i.e., measures resulting after taking logarithm of the proximities) perform better while distinguishing underlying classes than the "plain" measures. A comparison in terms of reject curves of inter-class and intra-class distances confirms this conclusion. A similar conclusion can be made for several well-known datasets. A possible origin of this effect is that most kernels have a multiplicative nature, while the nature of distances used in cluster algorithms is an additive one (cf. the triangle inequality). The logarithmic transformation is a tool to transform the first nature to the second one. Moreover, some distances corresponding to the logarithmic measures possess a meaningful cutpoint additivity property. In our experiments, the leader is usually the logarithmic Communicability measure. However, we indicate some more complicated cases in which other measures, typically, Communicability and plain Walk, can be the winners.

研究の動機と目的

  • 対数変換を施したグラフ近接度測定値が、単純な測定値と比較してクラスタリング性能を向上させるかどうかを評価すること。
  • 対数測定値がクラスタリングタスクで単純な測定値を上回る背後にある理由を調査すること。
  • ヒートカーネル、Communicability、ウォーク、および commute time カーネルを含む、広範な近接度測定値の組み合わせを、単純および対数変換形の両方で比較すること。
  • ランダムグラフにおけるクラスサイズの変動や実世界のデータセットを含む、多様なグラフ構造において性能を評価すること。
  • 対数測定値の優位性が、異なるクラスタリングアルゴリズムやパrameter設定においても成立するかどうかを特定すること。

提案手法

  • 研究では、事前に定義されたクラスとクラス内・クラス間接続確率を有するランダムグラフモデル $G(N, m, p_{\text{in}}, p_{\text{out}})$ を使用している。
  • 13の近接度測定ファミリー(Communicability, Walk, Heat, Forest, Commute Time カーネルの単純および対数変換形を含む)を評価している。
  • 性能は、各設定で生成された50個のグラフに対して、最適パラメータおよび90番目・80番目のパーセンタイルパラメータを用いて、ペアワイズトーナメントにおけるコペランドスコアを用いて評価されている。
  • クラスタリングアルゴリズムに依存しない分離性の評価のため、クラス間・クラス内距離を拒否曲線およびROC曲線で比較している。
  • 理論的分析では、近接度測定値と距離の二重性に注目し、特に三角不等式と対数変換が乗法的カーネルを加法的距離構造に適合させる役割を調査している。
  • 研究は、フットボール、ポリブック、Zachary などの実世界データセットにも拡張され、合成グラフを超えた結果の妥当性を検証している。

実験結果

リサーチクエスチョン

  • RQ1対数変換された近接度測定値は、グラフクラスタリングタスクにおいて一貫して単純な測定値を上回るか?
  • RQ2観察された性能向上の背後にある理由は何か?
  • RQ3特にクラスサイズが不均一な場合を含め、多様なグラフ構造において、異なる近接度測定値(特に対数変換形)はどのように性能を発揮するか?
  • RQ4特定のネットワークタイプや構成では、単純な測定値が対数変換形を上回る場合があるか?
  • RQ5対数変換は、グラフカーネルの乗法的性質とクラスタリングアルゴリズムの加法的性質を効果的に調和させることができるか?

主な発見

  • ほとんどの場合——特に同質的なクラスを有するランダムグラフにおいて——対数変換された近接度測定値は、単純な測定値を上回るクラスタリング性能を示し、特に log-Communicability が最も優れた性能を示す。
  • 対数変換により、グラフカーネルの乗法的性質が、クラスタリングアルゴリズムで使用される三角不等式と整合する加法的距離構造に変換され、性能が向上する。
  • ランダムグラフにおける最適パラメータトーナメントでは、log-Communicability が最高のコペランドスコア(62)を記録し、次いで Sigmoid-Corrected Commute Time (SCCT) が 62、log-Forest が 59 を記録した。
  • フットボールやポリブックなどの実世界データセットでは、最適パラメータトーナメントにおいても log-Communicability がそれぞれ 61 および 59 のスコアを記録し、トップを記録した。
  • 対数測定値の性能は、最適でないパラメータではやや不安定である:例えば、logHeat と RSP は 80番目のパーセンタイルパラメータを使用した場合に順位が著しく低下し、ロバスト性が低いことが示された。
  • 複雑で不均一なネットワーク——特にクラスサイズが不均一または多数のクラスを有するネットワーク——では、単純な測定値(例:Comm や pWalk)が対数変換形を上回る場合があり、性能は文脈依存的であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。