Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Isomorphism Bias in Graph Data Sets

Sergei Ivanov, Sergei Sviridov|arXiv (Cornell University)|2019. 10. 26.
Advanced Graph Neural Networks참고 문헌 49인용 수 16
한 줄 요약

이 논문은 54개의 널리 사용되는 그래프 분류 데이터셋에서 동형성 편향(isomorphism bias)을 규명한다. 동일한 그래프가 반복되어 나타나면서 모델의 정확도가 인위적으로 높아지며, 이는 레이블을 암기하는 방식으로 발생한다. 저자들은 동형성 인스턴스를 탐지하고 제거하는 방법을 제안하며, 동형성 편향이 없는 청소된 데이터셋을 공개하고, 모델이 일반화보다는 암기 덕분에 최대 5% 높은 정확도를 달성할 수 있음을 입증한다.

ABSTRACT

In recent years there has been a rapid increase in classification methods on graph structured data. Both in graph kernels and graph neural networks, one of the implicit assumptions of successful state-of-the-art models was that incorporating graph isomorphism features into the architecture leads to better empirical performance. However, as we discover in this work, commonly used data sets for graph classification have repeating instances which cause the problem of isomorphism bias, i.e. artificially increasing the accuracy of the models by memorizing target information from the training set. This prevents fair competition of the algorithms and raises a question of the validity of the obtained results. We analyze 54 data sets, previously extensively used for graph-related tasks, on the existence of isomorphism bias, give a set of recommendations to machine learning practitioners to properly set up their models, and open source new data sets for the future experiments.

연구 동기 및 목표

  • 일반적으로 사용되는 그래프 분류 데이터셋에서 동형 그래프의 보편성을 조사하기 위해.
  • 동형 인스턴스가 레이블 암기로 인해 불공정한 성능 우위를 제공하는 방식을 드러내기 위해.
  • 노드 및 에지 특징을 활용하여 그래프 데이터셋 내 동형 그래프를 탐지하는 방법론을 개발하고 공개하기 위해.
  • 공정한 그래프 분류 모델 평가를 보장하기 위해 동형성 없이 청소된 데이터셋을 제공하기 위해.
  • 미래의 그래프 학습 실험에서 동형성 편향을 피하기 위한 실용적 권고 사항을 제공하기 위해.

제안 방법

  • 노드 및 에지 레이블, 수치적 특성, 그래프 구조를 활용하여 동형 그래프를 식별하는 그래프 동형성 탐지 파이프라인을 제안하였다.
  • 오비트 기반 클러스터링을 적용하여 동형 그래프를 그룹화하고, 레이블이 일관하지 않은 경우를 제외한 나머지 중복 항목을 제거하였다.
  • 레이블이 일관한 동형 인스턴스에 대해 주로 투표 방식(다数 투표)을 사용하여 레이블을 할당하였으며, 레이블이 충돌하는 오비트는 기각하였다.
  • 원본 및 청소된 테스트 세트에서 모델 성능을 평가하여 동형성 편향의 영향을 분리하였다.
  • https://github.com/nd7141/iso_bias 에서 동형성 탐지 코드를 구현하고 오픈소스로 공개하였다.
  • https://github.com/nd7141/graph_datasets 에서 청소된 데이터셋을 공개하였으며, PyTorch-Geometric와 통합되어 보다 넓은 사용성을 확보하였다.

실험 결과

연구 질문

  • RQ1널리 사용되는 그래프 분류 데이터셋에서 동형 그래프는 얼마나 보편적인가?
  • RQ2동형성 편향이 그래프 분류 작업에서 모델 정확도를 얼마나 인위적으로 높이는가?
  • RQ3왜 그래프 데이터셋에 동형 그래프가 존재하는가? 그리고 이를 신뢰성 있게 탐지할 수 있는 방법은 무엇인가?
  • RQ4동형 인스턴스를 제거하면 더 공정하고 일반화 능력이 뛰어난 모델 평가가 가능해지는가?
  • RQ5미래의 그래프 학습 실험에서 동형성 편향을 피하기 위한 실용적 권고 사항은 무엇인가?

주요 결과

  • 분석한 54개의 그래프 데이터셋에서 최대 100%의 그래프가 동형이었으며, 일부 데이터셋은 유일한 그래프 비율이 20%에 불과했다.
  • 많은 수의 동형 그래프에서 레이블이 일관하지 않아 학습이나 평가에 부적합한 상태였다.
  • 모델은 동형성 편향이 있는 데이터셋에서 일반화보다는 암기 덕분에 최대 5% 높은 정확도를 달성하였다.
  • 강력한 모델들인 GNN 및 그래프 커널 조차도 동형 인스턴스에서 100% 정확도를 달성하지 못했으며, 이는 일반화 능력에 내재된 한계를 시사한다.
  • 제안된 청소 방법은 레이블이 충돌하는 동형 인스턴스를 제거하고, 레이블이 일관한 오비트에 대해 하나의 대표 그래프만 유지하였다.
  • PyTorch-Geometric 호환성과 함께 공개된 새로운 청소된 데이터셋은 동형성 편향을 제거하여 더 공정한 모델 비교를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.