Skip to main content
QUICK REVIEW

[論文レビュー] Understanding Isomorphism Bias in Graph Data Sets

Sergei Ivanov, Sergei Sviridov|arXiv (Cornell University)|Oct 26, 2019
Advanced Graph Neural Networks参考文献 49被引用数 16
ひとこと要約

本論文は、54の広く使われているグラフ分類データセットにおいて同型性バイアス(isomorphism bias)を特定した。同型性バイアスとは、繰り返し現れる同型グラフが、ラベルの記憶(memorization)を可能にすることで、モデルの精度を不正に高めるものである。著者らは、同型グラフを検出・除去する手法を提案し、同型性バイアスのないクリーンなデータセットを公開した。また、モデルが一般化ではなく記憶によって、最大5%の精度向上を達成していることを示した。

ABSTRACT

In recent years there has been a rapid increase in classification methods on graph structured data. Both in graph kernels and graph neural networks, one of the implicit assumptions of successful state-of-the-art models was that incorporating graph isomorphism features into the architecture leads to better empirical performance. However, as we discover in this work, commonly used data sets for graph classification have repeating instances which cause the problem of isomorphism bias, i.e. artificially increasing the accuracy of the models by memorizing target information from the training set. This prevents fair competition of the algorithms and raises a question of the validity of the obtained results. We analyze 54 data sets, previously extensively used for graph-related tasks, on the existence of isomorphism bias, give a set of recommendations to machine learning practitioners to properly set up their models, and open source new data sets for the future experiments.

研究の動機と目的

  • 一般的に使われているグラフ分類データセットにおける同型グラフの広がりを調査すること。
  • 同型グラフがラベルの記憶によってもたらす不正な性能優位性がどのように生じるかを明らかにすること。
  • ノードおよびエッジの特徴を活用したグラフ同型性検出手法を考案・公開すること。
  • 同型性のないクリーンなデータセットを提供し、グラフ分類モデルの公正な評価を可能にすること。
  • 今後のグラフ学習実験において同型性バイアスを回避するための実用的アドバイスを提示すること。

提案手法

  • ノードおよびエッジラベル、数値属性、グラフトポロジを活用して同型グラフを同定するためのグラフ同型性検出パイプラインを提案した。
  • 軌道(orbit)ベースのクラスタリングを用いて同型グラフをグループ化し、ラベルが一貫している場合を除き重複を削除した。
  • ラベルが一貫している同型インスタンスに対してはヒューリスティック(多数決)を用いてラベルを割り当て、矛盾するラベルを持つ軌道は破棄した。
  • 元のテストセットとクリーンアップ済みテストセットの両方でモデル性能を評価し、同型性バイアスの影響を分離した。
  • 同型性検出のためのコードを実装・オープンソース化し、https://github.com/nd7141/iso_bias で公開した。
  • クリーンアップ済みデータセットを https://github.com/nd7141/graph_datasets で公開し、PyTorch-Geometricとの統合を実現し、広範な利用を可能にした。

実験結果

リサーチクエスチョン

  • RQ1広く使われているグラフ分類データセットにおいて、同型グラフはどれほど広がっているか?
  • RQ2同型性バイアスがグラフ分類タスクにおけるモデル精度をどれほど不正に高めているか?
  • RQ3グラフデータセットに同型グラフが存在する原因は何か? そして、信頼性の高い検出方法は何か?
  • RQ4同型インスタンスを削除することで、より公平で一般化性の高いモデル評価が可能になるか?
  • RQ5今後のグラフ学習実験において、同型性バイアスを回避するための実用的アドバイスは何か?

主な発見

  • 分析した54のグラフデータセットにおいて、最大100%のグラフが同型であり、一部のデータセットでは唯一の固有グラフが20%未満にとどまっていた。
  • 多くの同型グラフにラベルの不一致が見られ、これらは学習や評価に適さないことが判明した。
  • モデルは、バイアスがあるデータセットでは一般化ではなく記憶によって、最大5%の精度向上を達成していた。
  • GNN やグラフカーネルといった強力なモデルですら、同型インスタンスに対して100%の精度を達成できず、一般化能力の限界を示唆した。
  • 提案されたクリーニング手法は、ラベルが矛盾する同型インスタンスを削除し、ラベルが一貫している各軌道から1つの代表例のみを保持した。
  • PyTorch-Geometric互換性を備えた新規クリーンデータセットは、同型性バイアスを排除し、より公正なモデル比較を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。