Skip to main content
QUICK REVIEW

[論文レビュー] Feature-Based Classification of Networks

Ian Barnett, Nishant Malik|arXiv (Cornell University)|Oct 19, 2016
Complex Network Analysis Techniques参考文献 17被引用数 11
ひとこと要約

本論文は、次数相関係数、クラスタリング係数、中心性測度などの手動で選択されたネットワーク特徴量と、ランダムフォレストなどの自動機械学習分類器を組み合わせたハイブリッドネットワーク分類手法を提案する。この手法は、完全に手動または完全に自動化された手法に比べ、高い分類精度、解釈可能性、高速な計算を達成しており、週の曜日別に分類するソーシャルネットワークや、がんタイプ別に分類する生物学的ネットワークにおいて優れた性能を示している。

ABSTRACT

Network representations of systems from various scientific and societal domains are neither completely random nor fully regular, but instead appear to contain recurring structural building blocks. These features tend to be shared by networks belonging to the same broad class, such as the class of social networks or the class of biological networks. At a finer scale of classification within each such class, networks describing more similar systems tend to have more similar features. This occurs presumably because networks representing similar purposes or constructions would be expected to be generated by a shared set of domain specific mechanisms, and it should therefore be possible to classify these networks into categories based on their features at various structural levels. Here we describe and demonstrate a new, hybrid approach that combines manual selection of features of potential interest with existing automated classification methods. In particular, selecting well-known and well-studied features that have been used throughout social network analysis and network science and then classifying with methods such as random forests that are of special utility in the presence of feature collinearity, we find that we achieve higher accuracy, in shorter computation time, with greater interpretability of the network classification results.

研究の動機と目的

  • 完全に手動または完全に自動化されたネットワーク分類手法の限界、すなわち低精度や解釈不能性を是正すること。
  • ドメイン固有の知識を特徴選択に活用しつつ、自動分類の利点を享受できるスケーラブルで解釈可能な手法を開発すること。
  • 意味のある構造的特徴量と強固な機械学習モデルを組み合わせることで、実世界のネットワークデータセットにおける分類精度を向上させること。
  • ソーシャルコミュニケーションネットワークや生物学的制御ネットワークを含む多様な分野において、本手法の有効性を実証すること。
  • ネットワーク特徴量に共通する相関(特徴量の共線形性)が、ランダムフォレストのような分類器を用いることで効果的に管理可能であることを示すこと。

提案手法

  • ソーシャルネットワーク分析およびネットワーク科学分野で広く用いられる、次数、媒介性中心性、モチーフ数、クラスタリング係数などの、well-establishedなネットワーク特徴量の手動選択。
  • ソーシャルネットワークにおけるノード属性(性別、年齢、地理的近接性(例:郵便番号))を追加特徴量として統合。
  • 特徴量の共線形性に強く、特徴量の重要度順位付けが可能なため、分類エンジンとしてランダムフォレストを採用。
  • 次数分布やクラスタリング分布のような相関が高い特徴量の次元削減のため、主成分分析(PCA)を適用。
  • 分類器の安定性および一般化性能を評価するため、スノーボール法や郵便番号ベースのサブサンプリング戦略を用いる。
  • 分類性能のベースライン比較として、特徴量ベクトル(例:次数分布、局所的クラスタリング)を用いたk-meansクラスタリングを適用。

実験結果

リサーチクエスチョン

  • RQ1手動による特徴選択と自動分類を組み合わせたハイブリッド手法が、完全に手動または完全に自動化された手法を上回る性能を示せるか?
  • RQ2性別、年齢、場所などのノード属性の追加が、ソーシャルネットワークにおける分類精度にどの程度寄与するか?
  • RQ3高い共線形性を示すネットワーク特徴量を、性能の低下を伴わず機械学習分類器に効果的に組み込めるか?
  • RQ4実世界の通信データにおいて、時間的パターン(平日 vs. 週末)に応じたネットワーク分類において、本手法はどの程度の精度を達成するか?
  • RQ5制御ネットワーク特徴量を用いて、腫瘍タイプごとに生物学的ネットワークを正確に区別できるか?

主な発見

  • COLLABデータセットでは、ランダムフォレストを用いたハイブリッド手法が76.5%の分類精度を達成し、KNN(72.69%)や他の分類器を上回った。
  • IMDB-BINARYデータセットでは、標準誤差4.69%を伴う72.4%の精度を達成し、異種ネットワークデータに対して優れた性能を示した。
  • REDDIT-BINARYデータセットでは、88.7%の精度を達成し、KNN(87.63%)や他のモデルを顕著に上回った。
  • 週の曜日別にソーシャルネットワークを分類する際、表5の特徴量(例:次数分布、クラスタリング)を用いた手法は高い精度を示し、特徴量の豊富さが増すにつれて誤分類率が低下した。
  • 次数分布およびクラスタリング分布の主成分を用いることで、重複を低減し、特にサブサンプリングされたネットワークにおいてモデルの安定性が向上した。
  • サブサンプリングされたネットワークに基づくランダムフォレスト分類器は一貫した性能を示し、滑らかな回帰フィットが観察されたことから、ネットワークサイズの変動に対しても一般化性能が信頼できることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。