Skip to main content
QUICK REVIEW

[논문 리뷰] Scheduling Refresh Queries for Keeping Results from a SPARQL Endpoint Up-to-Date (Extended Version)

Magnus Knuth, Olaf Hartig|arXiv (Cornell University)|2016. 08. 29.
Data Quality and Management참고 문헌 8인용 수 3
한 줄 요약

이 논문은 동적 RDF 데이터셋에서 SPARQL 쿼리 결과를 새로 고치는 데 있어 SPARQL 엔드포인트 과부하를 방지하기 위해 미들웨어 기반 스케줄링 전략을 제안한다. DBpedia Live에서 3개월 간의 실세계 쿼리 동적 특성을 분석하여, 이력 변경 빈도와 적응형 결과 수명 주기를 기반으로 한 스케줄링 전략을 평가하였으며, 동적이고 이력 인지 기반의 스케줄링이 최적의 자원 사용으로 인해 놓친 변경 사항을 최소화하고 결과 업데이트 탐지 시간을 단축함을 확인하였다.

ABSTRACT

Many datasets change over time. As a consequence, long-running applications that cache and repeatedly use query results obtained from a SPARQL endpoint may resubmit the queries regularly to ensure up-to-dateness of the results. While this approach may be feasible if the number of such regular refresh queries is manageable, with an increasing number of applications adopting this approach, the SPARQL endpoint may become overloaded with such refresh queries. A more scalable approach would be to use a middle-ware component at which the applications register their queries and get notified with updated query results once the results have changed. Then, this middle-ware can schedule the repeated execution of the refresh queries without overloading the endpoint. In this paper, we study the problem of scheduling refresh queries for a large number of registered queries by assuming an overload-avoiding upper bound on the length of a regular time slot available for testing refresh queries. We investigate a variety of scheduling strategies and compare them experimentally in terms of time slots needed before they recognize changes and number of changes that they miss.

연구 동기 및 목표

  • 공개 엔드포인트의 과부하를 유발할 수 있는 빈번한 SPARQL 쿼리 새로 고침의 확장성 문제를 해결하기 위해.
  • SPARQL 엔드포인트를 과부하시키지 않도록 쿼리 재평가를 스케줄링하는 미들웨어 시스템을 설계하기 위해.
  • 엔드포인트 과부하를 피하기 위해 하드 타임슬롯 제약 조건 하에서 스케줄링 전략을 평가하기 위해.
  • 실세계 SPARQL 쿼리의 이력 변경 패턴을 기반으로 가장 효과적인 스케줄링 히وري스틱을 규명하기 위해.
  • 동적 RDF 데이터셋에서 변경 사항을 놓치지 않고 결과 업데이트 탐지 시간을 최소화하기 위해.

제안 방법

  • 응용 프로그램이 SPARQL 쿼리를 등록하고 결과 변경 시 알림을 수신할 수 있는 미들웨어 컴пон트를 사용한다.
  • 엔드포인트 과부하를 방지하기 위해 총 스케줄링 주기당 사용 가능한 총 시간을 제한하는 타임슬롯 제약 조건을 적용한다.
  • 스케줄링 전략은 이력 변경 빈도(다이나믹스)와 적응형 결과 수명 주기를 기반으로 평가된다.
  • 예상 변경 시간이 가용 타임슬롯을 초과할 경우에만 쿼리가 재실행되며, 이는 고다이나믹 쿼리 우선 순위를 부여한다.
  • 실제 변경 사항을 탐지하기 위해 결과의 이sovomorphism 및 ORDER BY 쿼리의 바인딩 순서를 추적한다.
  • 실험은 3개월 간 DBpedia Live에서 수집한 10,000개의 실세계 SPARQL 쿼리를 사용하며, 각 리비전 당 런타임 및 변경 탐지 메트릭스를 수집한다.

실험 결과

연구 질문

  • RQ1고정된 타임슬롯 예산 하에서 SPARQL 쿼리 결과의 변경 사항을 탐지하는 데 소요되는 시간을 최소화하는 스케줄링 전략은 무엇인가?
  • RQ2쿼리 결과의 이력 변경 빈도(다이나믹스)는 스케줄링 성능에 어떤 영향을 미치는가?
  • RQ3적응형 결과 수명 주기 할당이 탐지 정확도 향상과 놓친 변경 사항 감소에 기여하는가?
  • RQ4쿼리 유형(예: SELECT, ASK)과 런타임은 스케줄링 효율성에 어떤 영향을 미치는가?
  • RQ5높은 데이터 업데이트 빈도가 발생하는 기간은 결과 변경 사항 탐지 가능성에 어떤 영향을 미치는가?

주요 결과

  • 쿼리 결과의 변경 이력은 스케줄링 효과성 결정에 가장 영향을 미치는 요소이다.
  • 이전에 인식된 변경 빈도(다이나믹스)를 기반으로 한 스케줄링 전략이 최소한의 놓친 변경 사항으로 최고의 탐지 성능을 달성하였다.
  • 개별 쿼리 결과에 대해 적응적으로 할당된 최대 수명 주기는 탐지 속도 향상과 거짓 음성 감소에 크게 기여하였다.
  • 모든 리비전 동안 총 10,000개의 쿼리 중 352개만 변경되었으며, 리비전당 최대 32건의 변경이 발생하여 전체적으로 낮은 업데이트 빈도를 보였다.
  • 모든 쿼리의 평균 런타임은 리비전 당 440~870초 사이였으며, 영향을 받은 쿼리는 총 시간의 최대 8.9%를 소비하였다.
  • 높은 데이터 업데이트 빈도가 발생한 기간(예: 2015년 8월 말)은 변경된 쿼리 결과의 수가 증가하는 데 강한 상관관계를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.