Skip to main content
QUICK REVIEW

[논문 리뷰] Supervised Learning on Relational Databases with Graph Neural Networks

Milan Cvitkovic|arXiv (Cornell University)|2020. 02. 06.
Advanced Graph Neural Networks참고 문헌 25인용 수 12
한 줄 요약

이 논문은 관계형 데이터베이스를 평탄화하거나 수작업 특성 공학을 거치지 않고도 직접적으로 지도 학습을 수행할 수 있는 그래프 신경망(GNN) 기반 방법을 제안한다. 테이블과 외래 키 관계를 이질적 그래프로 모델링함으로써 관계 구조를 유지하고, 세 가지 기준 데이터셋 중 두 개에서 최신 자동 특성 공학 기법을 능가한다. 이는 GNN이 기계 학습에서 관계 데이터를 효과적으로 활용할 수 있음을 보여준다.

ABSTRACT

The majority of data scientists and machine learning practitioners use relational data in their work [State of ML and Data Science 2017, Kaggle, Inc.]. But training machine learning models on data stored in relational databases requires significant data extraction and feature engineering efforts. These efforts are not only costly, but they also destroy potentially important relational structure in the data. We introduce a method that uses Graph Neural Networks to overcome these challenges. Our proposed method outperforms state-of-the-art automatic feature engineering methods on two out of three datasets.

연구 동기 및 목표

  • 기계 학습 모델을 관계형 데이터베이스에 훈련시킬 때 전통적인 특성 공학의 높은 비용과 구조 손실 문제를 해결하기 위해.
  • 데이터 평탄화 없이 정규화된 관계형 데이터베이스(RDB) 스키마에서 직접 엔드 투 엔드 학습을 가능하게 하기 위해.
  • GNN이 RDB 내의 관계 구조를 효과적으로 활용하여 표준 특성 공학 기법 대비 예측 성능 향상을 이룰 수 있는지 평가하기 위해.
  • 테이블 수와 외래 키 수 등 관계 복잡도가 GNN 성능에 미치는 영향을 탐색하기 위해.

제안 방법

  • RDB 스키마에서 이질적 그래프를 구성하며, 테이블은 노드 유형으로, 외래 키 관계는 테이블 간의 유定向 간선으로 표현된다.
  • 테이블 내 각 행은 그래프의 노드로 표현되며, 컬럼 값에서 파생된 특징을 가지며, 외래 키 참조는 테이블 간의 노드를 연결하는 간선으로 모델링된다.
  • GNN 모델(GCN, GIN, GAT 또는 그 엔티티-관계 변형)이 그래프를 따라 메시지 전파를 수행하여 맥락화된 노드 표현을 학습한다.
  • 최종 예측은 대상 테이블의 노드에 읽기 읽기 레이어를 적용하여 이루어지며, 교차 엔트로피 손실을 사용한 경험적 리스크 최소화 기반으로 모델이 훈련된다.
  • 과적합을 완화하고 성능을 향상시키기 위해 GNN 사전 출력값과 표준 표본 특징을 GBDT를 통해 결합하는 스태킹 전략을 포함한다.
  • 세 가지 실제 관계형 데이터베이스인 Acquire Valued Shoppers, Home Credit Default Risk, KDD Cup 2014를 대상으로 평가하며, 주요 평가 지표로 AUROC를 사용한다.

실험 결과

연구 질문

  • RQ1GNN은 평탄화나 수작업 특성 공학 없이도 관계형 데이터베이스에서 효과적으로 학습할 수 있으며, 최신 특성 공학 기법과의 성능 비교는 어떻게 되는가?
  • RQ2데이터베이스의 관계 복잡도(테이블 수 및 외래 키 관계 수)는 GNN 기반 모델의 성능 향상과 상관관계가 있는가?
  • RQ3GNN에서 엔티티-관계 메시지 전파 방식이 표준 GNN에 비해 상당한 이점을 제공하는가?
  • RQ4전통적인 표본 모델과 GNN 출력값을 결합하는 스태킹 전략이 관계 학습 작업의 성능 향상에 기여하는가?
  • RQ5KDD Cup 2014 데이터셋에서는 GNN이 다른 두 데이터셋과는 달리 성능이 열 劣하므로, 이는 데이터의 관계 구조에 대해 어떤 함의를 갖는가?

주요 결과

  • Acquire Valued Shoppers 챌린지 데이터셋에서 최고의 GNN 변종(ERGCN)은 AUROC 0.040 ± 0.002를 기록했으며, 최고의 베이스라인인 DFS + GBDT의 0.027 ± 0.002보다 유의미하게 높았다.
  • Home Credit Default Risk 데이터셋에서 ERGCN 모델은 AUROC 0.030 ± 0.002를 기록했으며, 최고의 베이스라인인 DFS + GBDT의 0.029 ± 0.002를 초월했다.
  • KDD Cup 2014 데이터셋에서는 어떤 GNN 변종도 최고의 베이스라인을 능가하지 못했으며, 모든 모델이 AUROC 값 0.013~0.015 수준을 기록해 관계 신호가 제한적임을 시사했다.
  • GNN 성능은 관계 복잡도와 강하게 상관된다: 더 많은 테이블과 외래 키 관계를 가진 데이터셋(예: Acquire 및 Home Credit)에서는 더 큰 성능 향상을 보였고, 관계성이 낮은 KDD Cup 2014 데이터셋은 성능 향상이 없었다.
  • GNN 예측값을 GBDT와 결합하는 스태킹 전략은 일부 데이터셋에서 성능 향상을 이끌었지만 일관된 성능 향상은 보이지 않았으며, 모든 데이터셋에서 동일한 GNN 아키텍처가 항상 최고 성능을 내는 것은 아니었다.
  • 연구 결과에 따르면 GNN은 관계 구조가 풍부하고 정보가 풍부할 경우 가장 효과적으로 작동하며, 텍스트 기반 RDB에는 사전 학습된 텍스트 임베딩을 활용한 전이 학습이 성능 향상에 추가로 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.