[論文レビュー] Unsupervised Meta-path Reduction on Heterogeneous Information Networks
本稿では、メタパス間の遷移確率類似度を最適化することで意味情報を保持する、非教師付きメタパス削減手法SPMRを提案する。実世界のデータセット(BlogCatalogやDBLP)において、完全なメタパス集合やランダム選択と比較して、より少ないメタパスで優れたクラスタリング性能を達成している。
Heterogeneous Information Network (HIN) has attracted much attention due to its wide applicability in a variety of data mining tasks, especially for tasks with multi-typed objects. A potentially large number of meta-paths can be extracted from the heterogeneous networks, providing abundant semantic knowledge. Though a variety of meta-paths can be defined, too many meta-paths are redundant. Reduction on the number of meta-paths can enhance the effectiveness since some redundant meta-paths provide interferential linkage to the task. Moreover, the reduced meta-paths can reflect the characteristic of the heterogeneous network. Previous endeavors try to reduce the number of meta-paths under the guidance of supervision information. Nevertheless, supervised information is expensive and may not always be available. In this paper, we propose a novel algorithm, SPMR (Semantic Preserving Meta-path Reduction), to reduce a set of pre-defined meta-paths in an unsupervised setting. The proposed method is able to evaluate a set of meta-paths to maximally preserve the semantics of original meta-paths after reduction. Experimental results show that SPMR can select a succinct subset of meta-paths which can achieve comparable or even better performance with fewer meta-paths.
研究の動機と目的
- 異種情報ネットワーク(HIN)における冗長的でノイズの多いメタパスが下流タスクの性能を低下させることの課題に対処すること。
- 高価な教師付き学習に依存せず、元のHINの意味的構造を保持する非教師付きのメタパス削減手法を開発すること。
- 完全なセットに含まれる本質的な接続性と意味的関係を維持する、要約されたメタパスのサブセットを特定すること。
- 削減されたメタパス集合を通じて、ネットワークの内在的特性を明らかにし、HIN構造のヒトによる解釈を支援すること。
提案手法
- SPMRは、メタパス間のノードペア間遷移確率の類似度を保持する最適化問題としてメタパス削減を定式化する。
- ランダムウォークに基づくHIN上の遷移確率行列を用いて、メタパス間の意味的類似度をモデル化する。
- 投影準ニュートン最適化手法を用いて、元の遷移確率分布を最もよく保持する最小のメタパスサブセットを選択する。
- 目的関数は意味的保持とメタパス集合のサイズのバランスをとる。これにより、コンactかつ情報量の多いサブセットが優先される。
- アプローチは非教師付きであり、外部ラベルやフィードバックに依存せず、ネットワーク構造のみに依存する。
- 意味的保持の質を検証するために、削減されたメタパス集合の品質を下流のクラスタリングタスクを通じて評価する。
実験結果
リサーチクエスチョン
- RQ1非教師付き手法により、意味的意味を保持しつつ、異種情報ネットワークにおけるメタパス数を効果的に削減できるか?
- RQ2すべてのメタパスと比較して、削減されたメタパス集合を用いた場合、クラスタリングなどの下流タスクの性能はどのように変化するか?
- RQ3最小で情報量の多いメタパスサブセットの選択を通じて、ネットワークのどのような特性が明らかにできるか?
- RQ4少数のメタパスで、すべてのメタパスを使用した場合と同等またはそれ以上の性能を達成できるか、その程度はどの程度か?
主な発見
- BlogCatalogデータセットでは、SPMRが選択した3つのメタパスを用いることで、全15個のメタパスを使用した場合と比較してクラスタリング精度が42.4%向上した。
- BlogCatalogにおいて、SPMRは3つのメタパスを用いてNMI 0.3777を達成し、全パスを使用した際のベースライン0.1861を上回った。
- DBLPデータセットでは、3つのメタパスを用いたSPMRが、全セットと比較してNMIを17.0%向上し、ランダム選択と比較して77.3%向上した。
- DBLPにおける上位ランクのメタパス「Author - Paper - Author - Paper - Term - Paper - Author」が、最も意味的情報を保持しており、より長い冗長なバージョンを上回った。
- BlogCatalogでは、ユーザーとタグの関係を含むメタパスが優先的に選択されたことから、ネットワーク構造においてそれらの関係が中心的であることが示唆された。
- 「Blog - User - User - User - Blog」メタパスの排除は、BlogCatalogにおいて友達の友達関係が疎で情報量が少ないことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。