[논문 리뷰] Learning Graph Augmentations to Learn Graph Representations
LG2AR는 확률적 정책과 보정 헤드를 사용하여 다양한 보정 공간에서 적응적으로 샘플링하는 엔드 투 엔드 프레임워크로, 그래프 대비 학습을 위한 최적의 그래프 보정 및 뷰 선택 정책을 자동으로 학습한다. 선형 및 준지도 학습 프로토콜 하에서 20개의 노드 수준 및 그래프 수준 벤치마크 중 18개에서 최신 기술 성능을 달성한다.
Devising augmentations for graph contrastive learning is challenging due to their irregular structure, drastic distribution shifts, and nonequivalent feature spaces across datasets. We introduce LG2AR, Learning Graph Augmentations to Learn Graph Representations, which is an end-to-end automatic graph augmentation framework that helps encoders learn generalizable representations on both node and graph levels. LG2AR consists of a probabilistic policy that learns a distribution over augmentations and a set of probabilistic augmentation heads that learn distributions over augmentation parameters. We show that LG2AR achieves state-of-the-art results on 18 out of 20 graph-level and node-level benchmarks compared to previous unsupervised models under both linear and semi-supervised evaluation protocols. The source code will be released here: https://github.com/kavehhassani/lg2ar
연구 동기 및 목표
- 비정규적인 그래프 구조와 분포 이동으로 인해 대비 학습을 위한 효과적이고 데이터세트 특화된 그래프 보정을 설계하는 데 도전하는 것.
- 외부 최적화 없이 엔드 투 엔드로 보정 분포를 학습하여 수동 하이퍼파라미터 조정과 시행착오 기반 보정 선택을 제거하는 것.
- 적응형 보정 정책과 파라미터 분포를 통해 노드 수준 및 그래프 수준 작업 전반에서 그래프 표현의 일반화를 향상시키는 것.
- 보정 정책과 파라미터를 동시에 학습하는 것이 고정 또는 무작위로 샘플링된 보정보다 뛰어난 성능을 내는지 확인하는 것.
제안 방법
- LG2AR는 입력 그래프 데이터세트에 조건부로 보정 유형의 분포를 학습하는 확률적 정책 네트워크를 사용한다.
- 각각 특정 보정 유형(예: 엣지 흐트림, 특성 마스킹, 부분그래프 샘플링)에 대한 파라미터 분포를 모델링하는 확률적 보정 헤드를 도입한다.
- 외부 루프 최적화 없이 인코더, 보정 정책, 보정 헤드를 동시에 엔드 투 엔드로 훈련한다.
- 상호정보 추정기(예: NT-Xent 또는 JSD)와 분류기(예: MLP 기반)를 사용하여 증강된 뷰 간의 일치도를 최대화하는 대비 학습을 수행한다.
- 강화 학습을 통해 대비 손실을 최대화하는 보정을 샘플링하도록 정책을 훈련함으로써 데이터세트 적응형 보정 선택을 가능하게 한다.
- 이 방법은 유전적 및 비유전적 학습 설정을 모두 지원하여 노드 수준 및 그래프 수준 분류 작업에 적용 가능하다.
실험 결과
연구 질문
- RQ1엔드 투 엔드 프레임워크가 수동 설계 또는 하이퍼파라미터 조정 없이 효과적인 그래프 보정을 자동으로 학습할 수 있는가?
- RQ2보정 유형과 파라미터에 대한 분포를 학습하는 것이 고정 또는 균일하게 샘플링된 보정보다 성능을 향상시키는가?
- RQ3다양한 구조적 및 특성 분포를 가진 다양한 그래프 데이터세트에 대해 학습된 정책이 어떻게 적응하는가?
- RQ4전반적인 성능에 대해 보정 정책 학습과 보정 파라미터 학습 중 어느 것이 더 큰 기여를 하는가?
- RQ5노드 수준 및 그래프 수준 작업 전반에서 일반화되며 최신 기술 성능을 달성할 수 있는가?
주요 결과
- LG2AR는 선형 및 준지도 학습 평가 프로토콜 하에서 20개의 벤치마크 중 18개에서 최신 기술 성능을 달성하였으며, 그래프 분류 작업 8개 중 8개, 노드 분류 작업 7개 중 6개에서 모두 성능을 확보하였다.
- GRU 기반 정책은 15개의 벤치마크 중 12개에서 무작위 및 고정 정책보다 우수한 성능을 보이며 효과적인 데이터세트 특화 적응을 입증하였다.
- 정책은 각 데이터세트에 대해 별개의 보정 분포를 학습하며, 부분그래프 샘플링과 엣지 흐트림이 가장 자주 선택되는 보정으로 나타났다.
- 확률적 헤드를 통한 보정 파라미터 학습은 무작위 정책을 사용하더라도 GraphCL 대비 Reddit-Binary에서 2.7%p의 절대 정확도 향상을 이끌어냈다.
- 구조적 보정(예: 엣지 흐트림, 부분그래프 샘플링)이 특성 공간 보정보다 더 큰 기여를 하지만, 모든 보정 유형이 최종 성능 향상에 기여한다.
- JSD와 NT-Xent 추정기는 NCE와 DV보다 상호정보 추정에서 우수하며, MLP 기반 분류기는 모든 데이터세트에서 최고의 성능을 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.