[논문 리뷰] BigCQ: A large-scale synthetic dataset of competency question patterns formalized into SPARQL-OWL query templates
이 논문은 빈번하게 나타나는 OWL 축약형에서 자동으로 생성된 77,575개의 능력 질문(CQ) 템플릿과 549개의 SPARQL-OWL 쿼리 템플릿을 포함하는 대규모 합성 데이터셋인 BigCQ를 소개한다. 이 데이터셋은 자동화된 CQ-쿼리 번역 및 용어집 추출을 가능하게 하며, 실제 세계의 CQ의 63.89%와 기존 데이터베이스에서 유래한 SPARQL-OWL 쿼리의 45.74%를 커버한다. 재사용 가능한 스크립트를 함께 배포하여 확장성을 확보하였다.
Competency Questions (CQs) are used in many ontology engineering methodologies to collect requirements and track the completeness and correctness of an ontology being constructed. Although they are frequently suggested by ontology engineering methodologies, the publicly available datasets of CQs and their formalizations in ontology query languages are very scarce. Since first efforts to automate processes utilizing CQs are being made, it is of high importance to provide large and diverse datasets to fuel these solutions. In this paper, we present BigCQ, the biggest dataset of CQ templates with their formalizations into SPARQL-OWL query templates. BigCQ is created automatically from a dataset of frequently used axiom shapes. These pairs of CQ templates and query templates can be then materialized as actual CQs and SPARQL-OWL queries if filled with resource labels and IRIs from a given ontology. We describe the dataset in detail, provide a description of the process leading to the creation of the dataset and analyze how well the dataset covers real-world examples. We also publish the dataset as well as scripts transforming axiom shapes into pairs of CQ patterns and SPARQL-OWL templates, to make engineers able to adapt the process to their particular needs.
연구 동기 및 목표
- 온톨로지 공학 분야에서 자연어로 된 능력 질문(CQ)과 공식적인 SPARQL-OWL 쿼리 간의 연결을 맺는 공개된 대규모 데이터셋의 부족 문제를 해결하기 위해.
- 기계 학습을 활용하여 CQ 기반 작업(예: 용어집 추출 및 CQ-쿼리 번역)의 자동화를 가능하게 하기 위해.
- 빈번히 발생하는 OWL 축약형에서 유사한 템플릿 쌍을 기반으로 확장 가능하고 유연한 CQ 및 SPARQL-OWL 템플릿 데이터셋을 생성하기 위해.
- NLP 및 지식 표현 시스템의 훈련 및 평가에 활용 가능한 CQ-쿼리 매핑의 커버리지와 품질을 향상시키기 위해.
제안 방법
- 규칙 기반 언어화 패턴을 사용하여 빈번히 발생하는 OWL 축약형 집합에서 CQ 템플릿을 자동 생성하기 위해.
- 형식화된 문법적 및 의미적 규칙을 사용하여 각 CQ 템플릿을 해당하는 SPARQL-OWL 쿼리 템플릿에 매핑하기 위해.
- 동의어 및 어휘적 변형 데이터베이스를 활용하여 CQ 템플릿을 풍부화하고 언어 다양성을 증가시키기 위해.
- 온톨로지 전용 레이블과 IRI를 템플릿에 치환하여 전체 CQ-SPARQL-OWL 쌍을 실체화하기 위해.
- 실제 데이터셋(CQ2SPARQL-OWL 및 CORAL)과의 비교를 통해 커버리지 검증을 수행하기 위해.
- 재현 가능성과 확장성을 확보하기 위해 GitHub 및 Zenodo를 통해 데이터셋과 변환 스크립트를 배포하기 위해.
실험 결과
연구 질문
- RQ1빈번하게 나타나는 OWL 축약형 패턴에서 CQ 템플릿과 그 SPARQL-OWL 쿼리 대응 템플릿을 체계적으로 대규모로 합성 데이터셋으로 생성할 수 있는가?
- RQ2생성된 데이터셋이 기존 데이터베이스에서 유래한 실제 세계의 능력 질문과 SPARQL-OWL 쿼리의 어느 정도를 커버하는가?
- RQ3현재 템플릿 생성 과정이 복잡하거나 희귀한 쿼리 패턴을 다룰 때의 한계는 무엇인가?
- RQ4이 데이터셋이 자동화된 CQ-쿼리 번역 및 용어집 추출 시스템의 효과적인 훈련 데이터로 활용될 수 있는가?
주요 결과
- BigCQ는 77,575개의 고유한 CQ 템플릿과 549개의 고유한 SPARQL-OWL 쿼리 템플릿을 포함하며, 평균적으로 각 쿼리 템플릿당 171.68개의 CQ 템플릿이 할당되어 있다.
- 이 데이터셋은 CORAL 데이터베이스의 CQ의 63.89%와 CQ2SPARQL-OWL 데이터셋의 SPARQL-OWL 쿼리의 45.74%를 커버한다.
- 쿼리 템플릿에서 가장 빈번하게 나타나는 구성 요소는 owl:Restriction (504/549), owl:onProperty (504/549), 그리고 owl:intersectionOf (319/549)이다.
- 두 가지 주요 커버되지 않은 쿼리 패턴은 중첩된 속성 체인과 owl:disjointWith를 포함하는 쿼리로, 이는 지원되지 않는 케이스의 약 25%를 차지한다.
- 이 데이터셋은 확장 가능하다: 저자들은 새로운 축약형, 언어화 규칙, 동의어 데이터베이스에 대응하기 위해 파ip라인을 조정할 수 있는 오픈소스 스크립트를 제공한다.
- 이 데이터셋은 영구적인 DOI를 부여받아 GitHub에 배포되어 있으며, 자연어 처리 및 온톨로지 공학 파이프라인에 재사용, 확장, 통합이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.