Skip to main content
QUICK REVIEW

[논문 리뷰] AutoSF: Searching Scoring Functions for Knowledge Graph Embedding

Yongqi Zhang, Quanming Yao|arXiv (Cornell University)|2019. 04. 26.
Advanced Graph Neural Networks참고 문헌 60인용 수 8
한 줄 요약

AutoSF는 지식 그래프 임bedding(KGE)에서 최적의 스코링 함수(SF)를 탐색하기 위한 자동화된 기계학습(AutoML) 프레임워크를 제안한다. 이는 이차형 모델의 통합 표현과 필터 및 예측기로 강화된 점진적 탐욕적 탐색을 사용한다. 이 방법은 링크 예측 및 삼중체 분류 벤치마크에서 인간이 설계한 최신 기술보다 뛰어난, 지식 그래프에 특화된 새로운 SF를 발견한다.

ABSTRACT

Scoring functions (SFs), which measure the plausibility of triplets in knowledge graph (KG), have become the crux of KG embedding. Lots of SFs, which target at capturing different kinds of relations in KGs, have been designed by humans in recent years. However, as relations can exhibit complex patterns that are hard to infer before training, none of them can consistently perform better than others on existing benchmark data sets. In this paper, inspired by the recent success of automated machine learning (AutoML), we propose to automatically design SFs (AutoSF) for distinct KGs by the AutoML techniques. However, it is non-trivial to explore domain-specific information here to make AutoSF efficient and effective. We firstly identify a unified representation over popularly used SFs, which helps to set up a search space for AutoSF. Then, we propose a greedy algorithm to search in such a space efficiently. The algorithm is further sped up by a filter and a predictor, which can avoid repeatedly training SFs with same expressive ability and help removing bad candidates during the search before model training. Finally, we perform extensive experiments on benchmark data sets. Results on link prediction and triplets classification show that the searched SFs by AutoSF, are KG dependent, new to the literature, and outperform the state-of-the-art SFs designed by humans.

연구 동기 및 목표

  • 다양한 관계 패턴을 가진 지식 그래프(KG) 간에 일반화 능력이 떨어지는 수동적인 스코링 함수(SF) 설계 과제를 해결하기 위해.
  • AutoML 기법을 통해 데이터 의존적인 최적의 SF를 자동으로 탐색함으로써 인간의 노력 감소를 위해.
  • 모든 후보를 완전히 훈련하지 않고도 높은 성능을 내는 SF를 식별할 수 있는 효율적인 탐색 프레임워크를 개발하기 위해.
  • 특정 도메인의 관계적 성질(예: 대칭성, 역전)을 탐색 과정에 통합하여 효과성과 일반화 능력을 향상시키기 위해.
  • 기존 인간이 설계한 SF를 뛰어넘기 위해 특정 KG에 맞게 최적화된, 이전에 탐색되지 않은 새로운 스코링 함수를 발견하기 위해.

제안 방법

  • 기존의 이차형 모델 기반 SF를 위한 통합 표현을 제안하여, 알려진 SF와 새로운 SF를 모두 포함하는 일반적이고 표현력 있는 탐색 공간을 구축한다.
  • 성능 예측 근거로 유망한 SF 후보를 반복적으로 선택하는 점진적 탐욕적 탐색 알고리즘을 제안한다.
  • 동일한 표현력을 가진 중복된 SF를 제거하기 위해 필터를 도입하여 불필요한 훈련을 방지한다.
  • 모델 전체 훈련 이전에 성능을 예측하기 위해 SRF(구조적 관계 특징) 표현에 기반한 예측 모델을 활용한다.
  • 구조적 관계 특징(SRF)을 사용해 관계 패턴(예: 대칭성, 역전)을 인코딩하고, 도메인 특화된 인덕티브 바이어스를 통해 탐색을 안내한다.
  • 두 단계로 구성된 파이프라인을 활용한다: 먼저 저차원 SF(d=64)에 대해 탐색하고, 이후 고차원(d∈{256,512,1024,2048})에서 초모수를 보정한다.

실험 결과

연구 질문

  • RQ1자동화된 탐색 프레임워크는 인간이 설계한 SF보다 지식 그래프 임베딩에서 더 우수한 성능을 내는 SF를 탐색할 수 있는가?
  • RQ2기존 이차형 SF의 통합 표현은 효과적이고 일반적인 탐색 공간을 구성하는 데 어떤 역할을 하는가?
  • RQ3특정 도메인의 관계적 성질(예: 대칭성, 역전)은 효율적인 SF 탐색을 안내하는 데 어떤 역할을 하는가?
  • RQ4필터와 예측기는 성능을 저하시키지 않고 탐색 비용을 줄이는 데 얼마나 효과적인가?
  • RQ5제안된 AutoSF 프레임워크는 대규모 지식 그래프에 대해 효율적으로 확장되며 높은 정확도를 유지할 수 있는가?

주요 결과

  • AutoSF는 문헌에 존재하지 않으며 지식 그래프에 종속적인 새로운 스코링 함수를 발견하여, 탐색 공간의 미개척 영역을 탐색할 수 있는 능력을 입증한다.
  • 탐색된 SF는 WN18, FB15K, WN18RR, FB15k237, YAGO3-10를 포함한 여러 벤치마크 데이터셋에서 링크 예측 및 삼중체 분류 과제에서 최고 성능을 달성한다.
  • 필터와 예측기의 통합으로 탐색 효율성이 크게 향상되어, 탐욕적 또는 무작위 탐색 대비 전체 모델 훈련 횟수를 줄였다.
  • 전체 탐색 과정은 8개의 GPU에서 몇 시간 내에 완료되며, YAGO3-10의 경우 하루 미만으로 처리된다—이전 방법들(강화 학습: 500개 GPU에서 4일, 유전적 프로그래밍: 1개 GPU에서 17일)보다 훨씬 빠르다.
  • 탐색 비용은 고차원 임베딩의 보정 비용과 유사하여, 탐색이 계산적으로 타당하고 실세계 적용에 실용적임을 시사한다.
  • 제거 실험 결과, 필터나 예측기 중 하나를 제거하면 효율성이 떨어지므로, 이들이 중복되거나 성능이 열 劣한 후보를 잘 잘라내는 데 핵심적인 역할을 한다는 것이 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.