[논문 리뷰] Extract the Knowledge of Graph Neural Networks and Go Beyond it: An Effective Knowledge Distillation Framework
이 논문은 임의의 미리 훈련된 그래프 신경망(GNN) 교사 모델에서 구조적 및 특징 기반의 인덕티브 바이어스를 포함하는 경량이고 해석 가능한 학습 가능한 레이블 전파와 특징 변환 모듈로 구성된 학생 모델로 지식을 이전하는 지식 정련 프레임워크를 제안한다. 학생 모델은 다섯 개인 기준 데이터셋에서 일곱 개의 GNN 아키텍처에서 교사 모델을 초월하며, 구조적 및 특징 기반의 인덕티브 바이어스를 함께 활용함으로써 일관된 정확도 향상(1.4%에서 4.7%까지)을 달성한다.
Semi-supervised learning on graphs is an important problem in the machine learning area. In recent years, state-of-the-art classification methods based on graph neural networks (GNNs) have shown their superiority over traditional ones such as label propagation. However, the sophisticated architectures of these neural models will lead to a complex prediction mechanism, which could not make full use of valuable prior knowledge lying in the data, e.g., structurally correlated nodes tend to have the same class. In this paper, we propose a framework based on knowledge distillation to address the above issues. Our framework extracts the knowledge of an arbitrary learned GNN model (teacher model), and injects it into a well-designed student model. The student model is built with two simple prediction mechanisms, i.e., label propagation and feature transformation, which naturally preserves structure-based and feature-based prior knowledge, respectively. In specific, we design the student model as a trainable combination of parameterized label propagation and feature transformation modules. As a result, the learned student can benefit from both prior knowledge and the knowledge in GNN teachers for more effective predictions. Moreover, the learned student model has a more interpretable prediction process than GNNs. We conduct experiments on five public benchmark datasets and employ seven GNN models including GCN, GAT, APPNP, SAGE, SGC, GCNII and GLP as the teacher models. Experimental results show that the learned student model can consistently outperform its corresponding teacher model by 1.4% - 4.7% on average. Code and data are available at https://github.com/BUPT-GAMMA/CPF
연구 동기 및 목표
- 복잡한 GNN 모델에서 구조적 및 특징 기반의 인덕티브 바이어스가 제한적으로 활용되고 있는 문제를 해결하기 위해.
- 모든 미리 훈련된 GNN 교사 모델과 호환되는 일반화 가능한 지식 정련 프레임워크를 개발하기 위해.
- 기존 지식과 정련된 GNN 지식을 융합하여 최신 기술 수준을 초월하는 반감독 학습 노드 분류 정확도를 향상시키기 위해.
- 투명하고 모듈화된 구성 요소를 가진 학생 모델을 설계함으로써 모델의 해석 가능성 향상하기 위해.
- 낮은 레이블 레지임에서도 성능을 유지함으로써 효과적인 소수의 샘플 학습(피셔 샘플 학습)을 가능하게 하기 위해.
제안 방법
- 학습 가능한 레이블 전파(LP)와 특징 변환(FT)을 위한 두 층의 다층퍼셉트론(MLP)으로 구성된 학생 모델은 각각 구조 기반 및 특징 기반의 사전 지식을 인코딩한다.
- 지식 정련은 GNN 교사 모델이 예측한 소프트 레이블을 학생 모델의 출력에 대해 교차 엔트로피 손실을 사용하여 일치시킴으로써 수행된다.
- 노드별로 학습 가능한 어텐션 유사 파ameter α_v를 통해 LP와 FT 구성 요소 간의 균형을 제어함으로써, 구조적 및 특징 정보의 적응적 융합이 가능하다.
- 노드 신뢰도 점수 c_v는 레이블 전파 동안 각 노드의 영향력을 가중치로 설정하여, 노이즈가 있거나 다양한 이웃을 가진 경우에도 강건성을 향상시킨다.
- 지식 정련과 표준 교차 엔트로피 감독을 융합한 하이브리드 손실을 사용하여 학생 모델을 엔드 투 엔드로 훈련시킨다.
- 프레임워크는 다섯 개인 공개 데이터셋에서 일곱 개의 GNN(GCN, GAT, SAGE, APPNP, SGC, GCNII, GLP)을 교사로 사용하여 평가된다.

실험 결과
연구 질문
- RQ1구조 기반 및 특징 기반의 인덕티브 바이어스를 명시적으로 인코딩한 학생 모델이 반감독 학습 노드 분류에서 GNN 교사 모델을 초월할 수 있는가?
- RQ2다양한 GNN 아키텍처에서 유일하고 해석 가능한 학생 모델로 지식 정련을 얼마나 효과적으로 전달할 수 있는가?
- RQ3제안된 프레임워크는 낮은 레이블 설정(소수의 샘플 학습)에서 얼마나 성능을 향상시키는가?
- RQ4학습된 균형 파ameter α_v와 신뢰도 점수 c_v는 모델의 해석 가능성과 의사결정 과정을 어떻게 반영하는가?
- RQ5다양한 GNN 교사 모델과 데이터셋 간에 일반화되면서도 일관된 성능 향상을 유지할 수 있는가?
주요 결과
- 제안된 학생 모델은 다섯 개의 기준 데이터셋에서 일곱 개의 GNN 교사 모델을 항상 초월하며, 평균 정확도 향상이 1.4%에서 4.7%까지 이루어진다.
- 낮은 레이블 레지임에서도 뚜렷한 향상이 이루어지며, 클래스당 5, 10, 20, 50개의 레이블이 있는 경우 각각 4.9%, 4.5%, 3.2%, 2.1%의 성능 향상이 이루어진다.
- 사례 연구 결과, α_v 값이 높은 노드는 예측 레이블이 같은 이웃을 가진 경향이 있으며, 레이블 전파에 강하게 의존하고 있음을 시사한다.
- 신뢰도 점수 c_v가 높은 노드는 이웃 수가 적고 예측 레이블이 일관되므로, 이웃의 다양성에 대해 강건함을 나타낸다.
- α_v 또는 c_v 값이 낮은 노드는 다양하거나 모순된 이웃 레이블을 가지며, 이는 모델이 이웃의 균일성에 민감함을 확인한다.
- 이 프레임워크는 다양한 GNN 아키텍처와 데이터셋 유형 간에 강건성과 일반화 능력을 입증하며, 보편적인 정련 프레임워크로서의 효과성을 검증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.