Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Speed Up Query Planning in Graph Databases

Mohammad Hossein Namaki, F A Rezaur Rahman Chowdhury|arXiv (Cornell University)|2018. 01. 21.
Graph Theory and Algorithms인용 수 5
한 줄 요약

이 논문은 DBpedia, YAGO, Freebase 지식 그래프에서 정확도 손실을 최소화하면서 스타일 기반 쿼리 리ason링 속도를 크게 향상시키기 위해 암시 학습을 통해 탐욕적 탐색 정책을 학습하는 학습을 위한 계획(L2P) 프레임워크를 제안한다.

ABSTRACT

Querying graph structured data is a fundamental operation that enables important applications including knowledge graph search, social network analysis, and cyber-network security. However, the growing size of real-world data graphs poses severe challenges for graph databases to meet the response-time requirements of the applications. Planning the computational steps of query processing - Query Planning - is central to address these challenges. In this paper, we study the problem of learning to speedup query planning in graph databases towards the goal of improving the computational-efficiency of query processing via training queries.We present a Learning to Plan (L2P) framework that is applicable to a large class of query reasoners that follow the Threshold Algorithm (TA) approach. First, we define a generic search space over candidate query plans, and identify target search trajectories (query plans) corresponding to the training queries by performing an expensive search. Subsequently, we learn greedy search control knowledge to imitate the search behavior of the target query plans. We provide a concrete instantiation of our L2P framework for STAR, a state-of-the-art graph query reasoner. Our experiments on benchmark knowledge graphs including DBpedia, YAGO, and Freebase show that using the query plans generated by the learned search control knowledge, we can significantly improve the speed of STAR with negligible loss in accuracy.

연구 동기 및 목표

  • 비효율적인 쿼리 계획으로 인한 대규모 그래프 데이터베이스 쿼리의 느린 응답 시간 문제를 해결한다.
  • 학습 쿼리로부터 학습을 통해 그래프 데이터베이스의 쿼리 처리의 계산 효율성을 향상시킨다.
  • 상한값이 너무 보수적이거나 정책이 정적인 등의 한계를 가진 임계값 알고리즘(TA) 프레임워크의 문제를 해결한다.
  • 다양한 TA 기반 쿼리 리ason링 도구에 적용 가능한 일반화 가능한 프레임워크를 개발한다.
  • 학습된 탐색 제어 정책을 통해 쿼리 처리의 빠른 속도 향상을 달성하면서도 높은 정확도를 유지한다.

제안 방법

  • TA 기반 계획을 탐욕적 탐색 경로로 간주하면서, 후보 쿼리 계획에 대한 일반적인 탐색 공간을 정의한다.
  • 학습용 쿼리의 최적 타겟 쿼리 계획을 식별하기 위해 비용이 많이 드는 히우리스틱 기반 빔 탐색을 수행한다.
  • 이를 통해 타겟 경로의 행동을 모방하는 탐욕적 정책을 암시 학습을 통해 학습시킨다.
  • 일반화 가능한 특징을 사용하여 탐색 상태에서 행동으로 매핑하는 정책을 수식화한다.
  • 최첨단 그래프 쿼리 리ason링 도구인 STAR에 대해 L2P 프레임워크를 구현하여 엔드 투 엔드 학습 및 추론을 가능하게 한다.
  • 일반화성과 강건성을 평가하기 위해 학습되지 않은 쿼리와 데이터 그래프에서 학습된 정책을 평가한다.

실험 결과

연구 질문

  • RQ1기계 학습 기반의 탐색 제어는 그래프 데이터베이스의 쿼리 계획 처리의 계산 효율성을 향상시킬 수 있는가?
  • RQ2학습된 정책은 다양한 지식 그래프와 쿼리 분포에 대해 얼마나 잘 일반화되는가?
  • RQ3데이터 그래프의 변화가 학습된 쿼리 계획 정책의 안정성과 성능에 어떤 영향을 미치는가?
  • RQ4기본 TA 기반 계획자보다는 상당한 속도 향상을 달성하면서도 정확도를 얼마나 잘 유지할 수 있는가?
  • RQ5학습을 다시 시작하지 않고도 새로운 데이터 그래프에 효과적으로 프레임워크를 이식할 수 있는가?

주요 결과

  • L2P-STAR는 원래의 STAR와 비교해 정확도 손실이 0.96%에 불과한 상태에서 Freebase에서 최대 55.84배의 속도 향상을 달성했다.
  • DBpedia에서는 96%의 정확도를 유지하면서 47.71배의 속도 향상을 기록해 대규모 지식 그래프에서 뛰어난 성능을 보였다.
  • 전이 학습 결과, 한 데이터셋에서 학습된 정책가 다른 데이터셋으로도 합리적으로 일반화되었으며, 특히 동일한 데이터셋에서 학습 및 테스트할 경우 최고의 정확도를 기록했다.
  • 통합 데이터셋에서 학습한 정책는 Freebase에서 최고의 성능을 기록했으며, 이는 교차 데이터셋 지식 전이의 잠재력을 보여주었다.
  • 10%의 데이터 그래프 변화(포레스트 파이어 샘플링을 통한)가 발생한 상황에서도 L2P-STAR는 93% 이상의 정확도를 유지했고, 속도 향상도 증가했으며, 데이터 변화에 대한 강건성을 입증했다.
  • 더 크고 더 조밀한 그래프일수록 속도 향상이 더 커졌으며, 이는 본 방법이 대규모이고 변화가 많은 데이터 환경에서 특히 유용함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.