Skip to main content
QUICK REVIEW

[論文レビュー] Network Classification and Categorization

James P. Canning, Emma E. Ingram|arXiv (Cornell University)|Sep 13, 2017
Complex Network Analysis Techniques参考文献 4被引用数 4
ひとこと要約

本稿では、15の構造的特徴に基づいてネットワークをカテゴリに分類する機械学習的手法を提案し、ランダムフォレスト分類器を用いて94.2%の正確性を達成した。実世界のネットワーク(社会的、生物学的、Webグラフなど)は、異なるドメインから来ているにもかかわらず、固有の構造的シグネチャを示すことが明らかになった。一方、合成ネットワーク(ERおよびBA)は、実世界のネットワークと容易に区別可能であることが示された。

ABSTRACT

To the best of our knowledge, this paper presents the first large-scale study that tests whether network categories (e.g., social networks vs. web graphs) are distinguishable from one another (using both categories of real-world networks and synthetic graphs). A classification accuracy of $94.2\%$ was achieved using a random forest classifier with both real and synthetic networks. This work makes two important findings. First, real-world networks from various domains have distinct structural properties that allow us to predict with high accuracy the category of an arbitrary network. Second, classifying synthetic networks is trivial as our models can easily distinguish between synthetic graphs and the real-world networks they are supposed to model.

研究の動機と目的

  • 異なるドメインからの実世界ネットワークが、構造的に特徴的な差を示すかどうかを特定すること。
  • 単純で計算可能な特徴量を用いて、ネットワークカテゴリを信頼性高く分類できるかどうかを評価すること。
  • 合成ネットワークモデル(ERおよびBA)が実世界のネットワークと比較して、どの程度の識別力を持つかを評価すること。
  • 構造的類似性に基づいて、ネットワークカテゴリ間に重複や曖昧さが存在するかどうかを特定すること。
  • 分類モデルの有用性が、分野を越えてネットワーク構造の異常や特異な構造的性質を明らかにするのを支援するかを検討すること。

提案手法

  • 低インスタンス数や非静的カテゴリを除外した後、8つのカテゴリ(実世界および合成グラフを含む)から合計529のネットワークを収集した。
  • 各ネットワークから、次数分布、クラスタ係数、相関性、三角形関連メトリクスを含む15の標準的構造的特徴を抽出した。
  • 視覚的な次元削減とクラスタ分析のため、t分布型確率的近傍埋め込み(t-SNE)を適用した。
  • 未観測のグラフのカテゴリを予測するために、15次元の特徴ベクトル上でランダムフォレスト分類器を訓練した。
  • t-SNE埋め込みにk-meansクラスタリングを適用し、視覚的なクラスタリングパターンの妥当性を検証した。
  • 誤分類されたネットワークのエラー解析を実施し、構造的類似性およびドメイン固有の異常を特定した。

実験結果

リサーチクエスチョン

  • RQ1異なるドメインからの実世界ネットワークを、構造的特徴のみに基づいて正確に分類できるか?
  • RQ2標準的な構造的特徴を用いて、合成ネットワーク(ERおよびBA)が実世界のネットワークとどの程度区別可能か?
  • RQ3『Web』および『Social』などのネットワークカテゴリが、構造的性質においてどの程度重複しているか?
  • RQ4人間と非人間の脳ネットワークの間には、識別可能な構造的差異が存在するか?
  • RQ5分類モデルは、分野を越えてネットワーク構造に関する新たな知見を明らかにできるか?

主な発見

  • ランダムフォレスト分類器は、15の構造的特徴のみを用いて、未観測のネットワークのカテゴリを94.2%の正確性で予測した。
  • 合成ネットワーク(ERおよびBA)は容易に分類可能であり、実世界のネットワークと混同されなかった。これは、それらが構造的に明確に異なることを示している。
  • Webおよび技術的ネットワーク、および脳ネットワークと生物学的ネットワークの間には、顕著な構造的類似性が認められ、カテゴリの重複の可能性を示唆している。
  • 実際にリツイートネットワークと類似した構造的特徴を示した、『リツイート』ネットワークと誤分類された複数のネットワークが存在し、これはドメインを越えた構造的パターンの可能性を示している。
  • 全5件の誤分類された非ヒト脳ネットワークがすべてヒトと誤認された。これは、ヒトと非ヒトの脳ネットワーク間に構造的差異が存在するか、またはネットワーク構築プロセスにおける一貫性の欠如が原因である可能性を示唆している。
  • モデルはカテゴリ内での外れ値を同定し、今後の調査を要する可能性のある異常や特異な構造的性質を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。