Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Integration & Single-Site Opening of Multiple Governmental Data Sources.

Konstantinos Kotis, Iraklis I. Athanasakis|arXiv (Cornell University)|2014. 07. 02.
Semantic Web and Ontologies참고 문헌 14인용 수 3
한 줄 요약

이 논문은 D2RQ와 Fuseki를 사용하여 단일 사이트에서 분산된 정부 데이터 소스를 통합된 온톨로지 기반 쿼리로 접근할 수 있도록 하는 S3-AI라는 의미적 애플리케이션 통합 방법을 제안한다. 이 방법은 데이터 소유권과 자율성을 유지하면서도 실시간으로 변화하는 데이터에 대한 피어드레이티드 SPARQL 쿼리를 지원하며, 중앙집중화 없이도 기존 시스템을 재설계하지 않고도 작동한다. e-Government IT 헬프데스크 사용 사례에서 낮은 비용과 높은 맞춤형 설정 가능성을 바탕으로 효과성을 입증하였다.

ABSTRACT

In many cases, government data is still "locked" in several "data silos", even within the boundaries of a single (inter-)national public organization with disparate and distributed organizational units and departments spread across multiple sites. Opening data and enabling its unified querying from a single site in an efficient and effective way is a semantic application integration and open government data challenge. This paper describes how NARA is using Semantic Web technology to implement an application integration approach within the boundaries of its organization via opening and querying multiple governmental data sources from a single site. The generic approach proposed, namely S3-AI, provides support to answering unified, ontology-mediated, federated queries to data produced and exploited by disparate applications, while these are being located in different organizational sites. S3-AI preserves ownership, autonomy and independency of applications and data. The paper extensively demonstrates S3-AI, using the D2RQ and Fuseki technologies, for addressing the needs of a governmental "IT helpdesk support" case.

연구 동기 및 목표

  • 한 개의 공공 행정 기관 내에서 서로 다른 분산 정부 데이터 소스를 통합하는 데 도전하는 것.
  • 기존 시스템을 중앙집중화하거나 재설계하지 않고도 실시간으로 변화하는 데이터를 다수의 자율적 데이터 소스에서 통합된 방식으로 쿼리할 수 있도록 하는 것.
  • 데이터 소유권과 자율성을 유지하면서도 개방적이고 경량적인 의미 웹 기술을 사용하여 의미적 애플리케이션 통합을 지원하는 것.
  • 실제 e-Government IT 헬프데스크 사용 사례에서 이 방법의 타당성과 이점을 입증하는 것.
  • 공공 부문의 데이터 통합에 의미 웹 기술을 도입할 때의 최선의 실천 방법과 교훈을 도출하는 것.

제안 방법

  • 관계형 데이터베이스를 가상 RDF 그래프로 매핑하여 기존의 관계형 데이터 소스에 의미적 접근을 가능하게 하는 D2RQ 사용.
  • 다중 가상 RDF 소스를 통해 피어드레이티드 쿼리를 실행하기 위해 SPARQL 1.1 엔드포인트로 Fuseki 활용.
  • 다양한 데이터 스키마 간의 쿼리 매핑을 위해 도메인 특화 참조 온톨로지 개발 및 활용.
  • 반자동화된 방법을 사용하여 애플리케이션 전용 스키마와 참조 온톨로지 간의 의미 매핑을 수립하고 수동 검증을 수행.
  • 분산된 데이터를 위한 피어드레이티드 쿼리에 대한 통합된 SPARQL 엔드포인트를 노출하는 단일 사이트 액세스 포인트 구현.
  • 초기 배포 시 데이터 보안과 개인정보 보호를 확보하기 위해 공개용으로 가짜 데이터 사용.

실험 결과

연구 질문

  • RQ1기존 시스템을 중앙집중화하거나 수정하지 않고도 다수의 자율적이고 분산된 정부 데이터 소스를 의미적으로 통합할 수 있는 방법은 무엇인가?
  • RQ2D2RQ와 Fuseki는 정부 환경에서 실시간으로 변화하는 데이터에 대해 효율적이고 실시간으로 피어드레이티드 SPARQL 쿼리를 수행할 수 있는가?
  • RQ3공공 행정 환경에서 다양한 데이터 스키마를 공통 참조 온톨로지에 매핑할 때의 실질적 과제와 최선의 실천 방법은 무엇인가?
  • RQ4통합된 데이터 액세스와 쿼리 기능을 제공하면서도 데이터 소유권과 자율성을 어떻게 유지할 수 있는가?
  • RQ5정부 데이터 통합에 경량의 오픈소스 의미 웹 기술을 사용할 경우 성능 및 유지보수 측면에서의 상충 관계는 어떠한가?

주요 결과

  • S3-AI 접근법은 NARA의 e-Government IT 헬프데스크 시스템 내에서 다섯 개인 분산 데이터 소스 간에 통합된 온톨로지 기반의 피어드레이티드 SPARQL 쿼리 기능을 성공적으로 제공하였다.
  • D2RQ와 Fuseki의 사용으로 데이터 복제나 시스템 재설계 없이 실시간으로 변화하는 데이터에 액세스할 수 있었다.
  • 이 접근법은 낮은 유지보수 노력, 높은 맞춤형 설정 가능성, 낮은 비용을 바탕으로 자원이 제한된 공공 행정 기관에 적합한 솔루션으로 입증되었다.
  • 복잡한 스키마 이질성 조건에서도 잘 선택된 참조 온톨로지와 반자동화된 매핑 지원을 사용할 경우 통합 과정이 타당하게 작동하였다.
  • 배포 과정에서 수동 매핑의 과제가 드러났으며, 잘못된 용어 쌍 배치, 문법 오류, 누락된 매핑 등이 포함되어 있어 철저한 검증의 필요성을 강조하였다.
  • 데이터 보안은 여전히 핵심적인 고려 사항으로, 저자들은 공개적으로 노출된 데이터는 모두 익명화되거나 가짜 데이터였으며, 안전한 엔드포인트는 향후 작업의 우선순위로 언급하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.