Skip to main content
QUICK REVIEW

[論文レビュー] On Evaluation Metrics for Graph Generative Models

Rylee Thompson, B. A. Knyazev|arXiv (Cornell University)|Jan 24, 2022
Advanced Graph Neural Networks被引用数 9
ひとこと要約

本稿では、トレーニングされていないランダムなグラフニューラルネットワーク(GNN)を用いてグラフ表現を抽出することで、スカラ値、ドメインに依存しない、計算的に効率的なグラフ生成モデル(GGM)の評価指標を提案する。著者らは、ランダムGNNに基づく指標を導入し、忠実度と多様性の測定において従来手法を上回ることを示した。サンプルサイズに応じて2つの推奨指標を提示することで、さまざまなドメインにおいて一貫したモデルランク付けが可能になる。

ABSTRACT

In image generation, generative models can be evaluated naturally by visually inspecting model outputs. However, this is not always the case for graph generative models (GGMs), making their evaluation challenging. Currently, the standard process for evaluating GGMs suffers from three critical limitations: i) it does not produce a single score which makes model selection challenging, ii) in many cases it fails to consider underlying edge and node features, and iii) it is prohibitively slow to perform. In this work, we mitigate these issues by searching for scalar, domain-agnostic, and scalable metrics for evaluating and ranking GGMs. To this end, we study existing GGM metrics and neural-network-based metrics emerging from generative models of images that use embeddings extracted from a task-specific network. Motivated by the power of certain Graph Neural Networks (GNNs) to extract meaningful graph representations without any training, we introduce several metrics based on the features extracted by an untrained random GNN. We design experiments to thoroughly test metrics on their ability to measure the diversity and fidelity of generated graphs, as well as their sample and computational efficiency. Depending on the quantity of samples, we recommend one of two random-GNN-based metrics that we show to be more expressive than pre-existing metrics. While we focus on applying these metrics to GGM evaluation, in practice this enables the ability to easily compute the dissimilarity between any two sets of graphs regardless of domain. Our code is released at: https://github.com/uoguelph-mlrg/GGM-metrics.

研究の動機と目的

  • グラフ生成モデル(GGM)の評価に用いられる一貫性があり、スケーラブルな指標が不足している現状を是正すること。現在の評価は複数の統計量に依存しており、統一されていない。
  • 従来の指標に見られる限界、例えば特徴の統合が不十分であること、計算コストが高くなること、特定のグラフ統計量に依存することを克服すること。
  • 特にノードおよびエッジ特徴を含む分野(例:分子グラフ)においても適用可能な、統一的でスカラ値の評価フレームワークを構築すること。
  • 忠実度、多様性、サンプル効率、計算効率の観点から、幅広い指標を客観的に評価・ランク付けすること。
  • トレーニングされていないランダムGNNが、GGMの評価に意味のある表現を抽出できることを示し、ドメインに依存しないグラフ集合の比較を可能にすること。

提案手法

  • ランダムに初期化されたGNNからの特徴活性化に基づく評価指標のファミリーを提案。トレーニングを経ずに意味のある表現を抽出できる能力を活用する。
  • GNN埋め込み特徴に対してRBFカーネルを用いた最大平均差分(MMD)を用い、実際のグラフ集合と生成されたグラフ集合の間のスカラ距離を計算する。
  • さまざまなデータセット(例:Grid, MOL, PROTEINS)とGGM(例:GraphRNN, GRAN)を用いた包括的なベンチマークを実施し、トレーニングの各段階で指標を評価する。
  • 2つの主要な指標を導入:1つは最終層のGNN特徴に基づくもの、もう1つは全層のグローバル平均プーリングを用いるもの。サンプルサイズに応じて推奨される。
  • 忠実度(F1 PR)、多様性(MMD)、効率(計算時間とサンプル数)を用いた客観的スコアリングにより、指標をランク付けする。
  • 再現可能性と広範な採用を促進するため、コードを https://github.com/uoguelph-mlrg/GGM-metrics に公開する。

実験結果

リサーチクエスチョン

  • RQ1トレーニングされていないランダムGNNは、ドメインに依存しない形で、グラフ生成モデルの評価に有効な特徴抽出器として機能できるか?
  • RQ2ランダムGNN特徴に基づくスカラ指標の中で、忠実度、多様性、計算効率のバランスを最も良くとるものは何か?
  • RQ3ランダムGNNに基づく指標は、表現力とデータセット間の一貫性において、従来のGGM評価指標と比べて優れているか?
  • RQ4ランダムGNNに基づく指標の性能は、生成されたグラフの数に依存するか?もしそうならば、その場合に適切な指標の選択方法は何か?
  • RQ5これらの指標は、一般化能力に起因して、ドメインを問わず任意の2つのグラフ集合を比較するために使用可能か?

主な発見

  • 提案されたランダムGNNに基づく指標は、客観的スコアリングにより、生成されたグラフの忠実度と多様性の両方において、従来の指標を顕著に上回っている。
  • 小規模なサンプルサイズ(100未満)では、全GNN層のグローバル平均プーリングを用いた指標が、忠実度と多様性のバランスが最も優れており、GridデータセットでF1 PRスコア0.995を達成した。
  • 大規模なサンプルサイズ(100以上)では、最終層特徴に基づく指標が優れた性能を示し、GridデータセットでF1 PRスコア1.0を達成し、他のベンチマークでも一貫した高いスコアを記録した。
  • ランダムGNNに基づく指標は計算的に効率的であり、100個のグラフに対して評価時間を1秒未満に抑えることができ、反復的なモデルトレーニングにスケーラブルである。
  • 指標はドメインに強く依存せず、分子(MOL)、タンパク質(PROTEINS)、および合成的(Grid)のデータセットで良好に動作し、ドメインに依存しない適用可能性を示した。
  • 本研究では、グラフ構造(例:次数、クラスタリング係数)にのみ依存する指標や、事前学習を要する指標(例:Fréchet ChemNet Distance)は、提案手法に比べて表現力が低く、スケーラビリティに劣ることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。