Skip to main content
QUICK REVIEW

[논문 리뷰] Mapping XML Data to Relational Data: A DOM-Based Approach

Mustafa Atay, Yezhou Sun|arXiv (Cornell University)|2010. 10. 08.
Advanced Database Systems and Queries참고 문헌 12인용 수 13
한 줄 요약

이 논문은 DOM 기반 접근 방식을 사용하여 XML 데이터를 관계형 데이터베이스에 매핑하기 위한 선형 시간 알고리즘인 XInsert을 제안한다. DOM 트리를 순회하고 인라인 기반 스키마 매핑을 적용함으로써 XML INSERT 문을 SQL INSERT 문의 시퀀스로 효율적으로 변환하며, n개의 XML 요소와 속성에 대해 O(n)의 시간 복잡도를 달성한다.

ABSTRACT

XML has emerged as the standard for representing and exchanging data on the World Wide Web. It is critical to have efficient mechanisms to store and query XML data to exploit the full power of this new technology. Several researchers have proposed to use relational databases to store and query XML data. While several algorithms of schema mapping and query mapping have been proposed, the problem of mapping XML data to relational data, i.e., mapping an XML INSERT statement to a sequence of SQL INSERT statements, has not been addressed thoroughly in the literature. In this paper, we propose an efficient linear algorithm for mapping XML data to relational data. This algorithm is based on our previous proposed inlining algorithm for mapping DTDs to relational schemas and can be easily adapted to other inlining algorithms.

연구 동기 및 목표

  • XML에서 관계형 데이터베이스로의 데이터 매핑 문제 중 아직 다루지 않은 분야를 해결하며, 특히 XML INSERT 문을 SQL INSERT 문으로 변환하는 데 초점을 맞춘다.
  • 기존의 스키마 매핑 기법과 함께 작동하는 효율적인 알고리즘을 개발하며, 특히 인라인 기반 접근 방식에 초점을 맞춘다.
  • DOM 트리 순회를 활용하여 대규모 XML 문서에서도 스케일러블하고 뛰어난 성능을 발휘할 수 있도록 데이터 매핑 과정을 보장한다.
  • 저자들이 개발한 DTDMap 외의 다양한 인라인 기반 스키마 매핑 알고리즘에 적응 가능한 기반을 제공한다.

제안 방법

  • XML 문서를 메모리 내 트리로 표현하기 위해 문서 객체 모델(DOM)을 사용하여 체계적인 순회를 가능하게 한다.
  • 두 단계 알고리즘을 적용한다: 첫 번째로 인라인 불가능한 요소를 식별하고 처리하며, 두 번째로 인라인 가능한 요소를 재귀적 순회로 처리한다.
  • 각 XML 요소를 관계형 테이블에 딱 한 번만 큐에 넣어 중복을 방지하고 삽입 중 참조 무결성을 유지한다.
  • 이전의 스키마 매핑 기법(예: DTDMap)에서 유래한 인라인 기법을 활용하여 테이블 수를 줄이고 조인 연산을 최소화한다.
  • 인라인 불가능한 요소를 처리하기 위한 while 루프와 인라인 가능한 요소를 처리하기 위한 다른 while 루프를 사용하며, 둘 다 선형 시간에 작동한다.
  • 각 DOM 노드가 정확히 한 번만 방문되도록 보장하여, n이 XML 요소와 속성의 총 수일 때 O(n)의 시간 복잡도를 확보한다.

실험 결과

연구 질문

  • RQ1DOM 기반 접근 방식을 사용하여 XML 데이터를 관계형 데이터베이스에 효율적으로 매핑할 수 있는 방법은 무엇인가?
  • RQ2DOM 트리 순회와 인라인 기법을 사용하는 데이터 매핑 알고리즘의 시간 복잡도는 무엇인가?
  • RQ3XML 문서 크기가 증가함에 따라 제안된 알고리즘의 성능은 어떻게 변화하는가?
  • RQ4문서 중심형(예: document-centric)과 데이터 중심형(예: data-centric)의 다양한 구조적 특성을 가진 XML 문서에서 알고리즘의 성능은 어떻게 되는가?

주요 결과

  • XInsert 알고리즘은 n이 XML 요소와 속성의 수일 때 O(n)의 시간 복잡도를 달성하여 선형이며 매우 효율적이다.
  • 알고리즘은 카탈로그.dtd와 같은 데이터 중심형 문서와 애자일.dtd와 같은 문서 중심형 문서 모두에서 뛰어난 성능을 보이며, 일관된 선형 확장성을 보였다.
  • 메모리 제약으로 인해 40MB 문서 크기에서 성능 저하가 발생하며, DOM 트리가 주 메모리 초과하여 디스크 스왑이 필요해지기 때문이다.
  • 심지어 깊이 있는 중첩 구조를 가진 텍스트 요소를 포함한 애자일.dtd 문서는 특히 50MB에서 카탈로그.dtd보다 처리에 더 오래 걸렸다. 이는 트리의 깊이가 증가했기 때문이다.
  • DTDMap 및 공유 인라인 기법을 포함한 다양한 스키마 매핑 체계에서도 알고리즘의 성능은 안정적이고 예측 가능했다.
  • 다른 인라인 기반 스키마 매핑 기법에 쉽게 적응 가능하여 재사용성과 확장성이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.