Skip to main content
QUICK REVIEW

[논문 리뷰] Explainability in Graph Neural Networks: An Experimental Survey

Peibo Li, Yixing Yang|arXiv (Cornell University)|2022. 03. 17.
Explainable Artificial Intelligence (XAI)인용 수 16
한 줄 요약

이 논문은 그래프 신경망(GNN) 설명 가능성 방법에 대한 종합적인 실험적 조사 결과를 제시하며, 인간의 참여 없이도 객관적으로 방법을 평가할 수 있도록 새로운 평가 지표인 '설명 신뢰도'를 제안한다. 이는 실제 데이터셋에서의 성능을 비교하기 위한 기준이 된다. 연구 결과, GraphMASK가 GNNExplainer와 PGExplainer보다 우수한 성능을 보이며, 특히 높은 신뢰도 수준에서 두드러진다. 이는 GraphMASK가 계층별 중요도를 모델링할 수 있기 때문이다. 반면 GNNExplainer는 GCNII와 같은 깊은 모델에서 성능 저하를 보인다.

ABSTRACT

Graph neural networks (GNNs) have been extensively developed for graph representation learning in various application domains. However, similar to all other neural networks models, GNNs suffer from the black-box problem as people cannot understand the mechanism underlying them. To solve this problem, several GNN explainability methods have been proposed to explain the decisions made by GNNs. In this survey, we give an overview of the state-of-the-art GNN explainability methods and how they are evaluated. Furthermore, we propose a new evaluation metric and conduct thorough experiments to compare GNN explainability methods on real world datasets. We also suggest future directions for GNN explainability.

연구 동기 및 목표

  • 실제 데이터셋에서 GNN 설명 가능성 방법에 대한 종합적이고 객관적인 평가가 부족한 문제를 해결하기 위해.
  • 인간이 제공한 기준 데이터가 필요 없이도 정량적이고 확장 가능한 비교가 가능한 인간 참여가 없는 평가 지표인 '설명 신뢰도'를 제안하기 위해.
  • 실제 인용 네트워크에서 최신 GNN 설명 가능성 방법(GNNExplainer, PGExplainer, GraphMASK)을 다양한 GNN 아키텍처(GCN, GAT, GCNII)를 사용해 평가하기 위해.
  • 깊은 모델인 GCNII를 포함한 다양한 GNN 아키텍처에서 설명 가능성 방법의 성능를 조사하기 위해. 이는 이전 연구에서 다루지 않은 분야이다.
  • 기존 설명 가능성 방법의 한계를 분석하고 GNN 설명 가능성 분야의 향후 연구 방향을 제안하기 위해.

제안 방법

  • 다양한 신뢰도 수준에서 설명의 희소성(스파arsity)을 측정할 수 있도록 하는 새로운 평가 지표인 '설명 신뢰도'를 제안하여 객관적이고 인간 참여가 없는 비교를 가능하게 한다.
  • 다중 수준 평가 전략을 적용: 각 모델과 데이터셋에 대해 0.50에서 0.95까지의 다양한 신뢰도 수준에서 설명의 희소성을 계산하고 평균값을 산출한다.
  • 평가를 위한 벤치마크 데이터셋으로 세 개인용 인용 네트워크인 Cora, Citeseer, Pubmed를 사용한다.
  • 깊이가 다른 GCN, GAT, GCNII 모델(2층에서 최대 64층까지)을 훈련하고, 테스트 세트에서의 예측을 설명하기 위해 GNNExplainer, PGExplainer, GraphMASK를 적용한다.
  • GraphMASK와 PGExplainer에 대해 단일 인스턴스 학습 및 모델 수준 학습을 모두 적용하여 학습 전략의 영향을 평가한다.
  • 교차 검증을 위해 표준적인 충실도 및 반대 충실도 지표를 사용하지만, 주요 기준으로는 새로운 설명 신뢰도 지표를 강조한다.

실험 결과

연구 질문

  • RQ1합성 데이터나 소분자 데이터가 아닌 다양한 실제 데이터셋에서 기존 GNN 설명 가능성 방법의 성능는 어떠한가?
  • RQ2얕은 모델(GCN, GAT)과 깊은 모델(GCNII) 간의 GNN 아키텍처 차이에 따라 설명 가능성 방법의 성능는 어떻게 달라지는가?
  • RQ3인간이 제공한 기준 데이터가 없는 평가 지표를 효과적으로 사용하여 GNN 설명 가능성 방법을 확장 가능하고 객관적으로 비교할 수 있는가?
  • RQ4GNNExplainer와 같은 기존 설명 가능성 방법은 더 많은 파라미터를 가진 깊은 GNN에 적용했을 때 어떤 한계를 보이는가?
  • RQ5다른 학습 전략(단일 인스턴스 학습 대비 모델 수준 학습)은 GraphMASK와 PGExplainer가 생성하는 설명의 품질에 어떤 영향을 미치는가?

주요 결과

  • GraphMASK는 모든 데이터셋과 GNN 아키텍처에서 GNNExplainer와 PGExplainer를 일관되게 능가하며, 특히 높은 설명 신뢰도 수준(예: 0.90–0.95)에서 두드러진다. 이는 더 정확하고 안정적인 설명을 제공함을 시사한다.
  • GNNExplainer는 GCNII와 같은 깊은 모델에 적용되었을 때 성능 저하가 심각하게 나타나, 아키텍처의 복잡성에 대한 확장성과 내구성에 한계가 있음을 보여준다.
  • PGExplainer는 얕은 모델(GCN, GAT)에서는 성능이 열악하지만 GCNII에서는 향상되어, 모델 깊이 및 아키텍처에 민감할 수 있음을 시사한다.
  • 제안된 설명 신뢰도 지표를 통해 인간 기반 기준 데이터 없이도 신뢰할 수 있고 확장 가능하며 객관적인 비교가 가능해졌다.
  • 단일 인스턴스 수준 학습이 모델 수준 학습보다 GraphMASK에서 더 높은 성능을 보였고, PGExplainer의 성능는 두 학습 전략 간 유사하게 유지되었다.
  • 충실도 및 반대 충실도 지표는 GraphMASK의 열등함을 확인했지만, GAT에서 Cora에서는 GNNExplainer가 더 높은 충실도를 보였고, GCNII에서 Pubmed에서는 더 높은 반대 충실도를 기록하여 지표 간 일관성의 부족함을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.