Skip to main content
QUICK REVIEW

[論文レビュー] AspEm: Embedding Learning by Aspects in Heterogeneous Information Networks

Yu Shi, Huan Gui|arXiv (Cornell University)|Mar 5, 2018
Advanced Graph Neural Networks参考文献 28被引用数 15
ひとこと要約

AspEmは、映画ネットワークにおけるジャンルや監督といった複数の意味的側面を、それぞれ別々の低次元表現として学習することにより、意味的不適合性を軽減する、異種情報ネットワーク(HIN)埋め込みのための新規フレームワークを提案する。非教師ありのデータセット全体の統計を用いて代表的な側面を選択することで、統一された埋め込み空間を用いる手法を上回り、リンク予測および分類タスクで最先端の性能を達成する。

ABSTRACT

Heterogeneous information networks (HINs) are ubiquitous in real-world applications. Due to the heterogeneity in HINs, the typed edges may not fully align with each other. In order to capture the semantic subtlety, we propose the concept of aspects with each aspect being a unit representing one underlying semantic facet. Meanwhile, network embedding has emerged as a powerful method for learning network representation, where the learned embedding can be used as features in various downstream applications. Therefore, we are motivated to propose a novel embedding learning framework---AspEm---to preserve the semantic information in HINs based on multiple aspects. Instead of preserving information of the network in one semantic space, AspEm encapsulates information regarding each aspect individually. In order to select aspects for embedding purpose, we further devise a solution for AspEm based on dataset-wide statistics. To corroborate the efficacy of AspEm, we conducted experiments on two real-words datasets with two types of applications---classification and link prediction. Experiment results demonstrate that AspEm can outperform baseline network embedding learning methods by considering multiple aspects, where the aspects can be selected from the given HIN in an unsupervised manner.

研究の動機と目的

  • 異種情報ネットワーク(HIN)における意味的不適合性の課題に対処すること。具体的には、ジャンルや監督といった異なる種類の関係(例:ジャンル対監督)が単一の埋め込み空間ではうまく一致しないこと。
  • HINの側面ベースの分解により、洗練された意味的側面を捉えることで、ネットワーク表現学習を向上させること。
  • タスク固有のラベルや教師信号を必要とせず、データセット全体の統計に基づく非教師あり手法を用いて、任意のHINから代表的な側面の集合を同定すること。
  • 各側面を独立して埋め込みすることで、統一空間埋め込み手法よりも優れた下流タスク性能を達成できることを示すこと。

提案手法

  • HINにおける異なる意味的側面(例:ジャンル、監督)を表す「側面(aspects)」という概念を導入する。
  • 各選択された側面に対して、別々の低次元空間でノード埋め込みを独立して学習するAspEmというフレームワークを提案する。
  • ノードタイプの共起と不一致スコアに基づく統計的手法を用いて、非教師ありでHINから代表的な側面を同定・選択する。
  • 各側面固有の埋め込み空間において、局所的なネットワーク構造と意味的関係を保持するため、スイップグラムに類似した目的関数を採用する。
  • 各側面が寄与するより洗練された表現を得るために、側面固有の埋め込みを組み合わせることで、リンク予測およびノード分類を両方サポートする。
  • 側面ごとの分解を介して、既存のネットワーク埋め込み手法と統合可能な拡張性を備える。

実験結果

リサーチクエスチョン

  • RQ1別々の埋め込み空間で複数の意味的側面をモデル化することで、異種情報ネットワークにおける表現学習が向上するか?
  • RQ2教師なしで、データセット全体の統計のみを用いてHINから代表的な側面の集合を自動的に選択できるか?
  • RQ3提案された非教師あり側面選択手法は、代替の組み合わせと比較してより質の高い側面を生成するか?
  • RQ4埋め込み次元数およびトレーニングに使用するエッジ数の変化に伴い、AspEmの性能はどのように変化するか?
  • RQ5側面ベースの埋め込み学習は、リンク予測や分類といった下流タスクにおいて、統一空間埋め込み手法を上回る性能を示せるか?

主な発見

  • AspEmは、実世界の2つのHIN(DBLPおよびIMDb)において、リンク予測およびノード分類タスクの両方でベースライン手法を上回った。
  • 提案された非教師あり手法で選択された側面集合(DBLPでは{APRTV, APY})が最高の性能を達成し、P@1が0.7724、R@10が0.8810を記録。他のすべての2側面組み合わせを上回った。
  • 不一致スコアの閾値が、低品質な側面集合を効果的にフィルタリングしたことが実証された。不一致スコアがより高い他のすべての組み合わせと比較して、選択された集合の性能が優れていた。
  • 埋め込み次元数とサンプリングされたエッジ数の増加に伴い、モデル性能が向上し、約100次元および10億エッジのサンプリングで安定化した。これは先行研究と整合的であった。
  • フレームワークは柔軟であり、既存の埋め込み手法を各側面ごとに別々に適用することで、統合が可能である。
  • 結果から、側面ベースの分解が意味的不適合性を軽減し、複雑で多様なノード関係をより正確に表現可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。