Skip to main content
QUICK REVIEW

[논문 리뷰] Contexts and Data Quality Assessment

Leopoldo Bertossi, Flavio Rizzolo|arXiv (Cornell University)|2016. 08. 14.
Data Quality and Management참고 문헌 64인용 수 4
한 줄 요약

이 논문은 외부 스키마 및 매핑으로부터 유도된 청소된, 맥락에 의해 검증된 버전들의 집합과 데이터베이스 간의 거리로 품질을 모델링함으로써 맥락에 따라 달라지는 공식적이고 맥락 의존적인 데이터 품질 평가 프레임워크를 제안한다. 주요 기여는 품질 질의 응답을 지원하고 의미론적 제약 조건, 온톨로지, 다차원 맥락을 통합함으로써 강력하고 응용에 관계없이 일반적인 데이터 품질 평가를 가능하게 하는 일반적인 모델이다.

ABSTRACT

The quality of data is context dependent. Starting from this intuition and experience, we propose and develop a conceptual framework that captures in formal terms the notion of "context-dependent data quality". We start by proposing a generic and abstract notion of context, and also of its uses, in general and in data management in particular. On this basis, we investigate "data quality assessment" and "quality query answering" as context-dependent activities. A context for the assessment of a database D at hand is modeled as an external database schema, with possibly materialized or virtual data, and connections to external data sources. The database D is put in context via mappings to the contextual schema, which produces a collection C of alternative clean versions of D. The quality of D is measured in terms of its distance to C. The class C} is also used to define and do "quality query answering". The proposed model allows for natural extensions, like the use of data quality predicates, the optimization of the access by the context to external data sources, and also the representation of contexts by means of more expressive ontologies.

연구 동기 및 목표

  • 데이터 품질을 맥락 의존적으로 공식화함으로써 '좋은' 데이터가 응용 맥락과 사용자 의도에 따라 달라짐을 인식한다.
  • 외부 메타데이터와 외부 데이터 소스가 주어진 맥락에서 데이터 품질을 어떻게 정의하는지를 포괄하는 개념적 모델을 개발한다.
  • 목표 데이터베이스 D를 맥락 스키마로의 매핑을 통해 청소된, 맥락에 의해 유효한 버전들을 유도함으로써 품질 질의 응답을 가능하게 한다.
  • 품질 술어, 온톨로지, 다차원 맥락을 통해 확장성을 지원함으로써 더 풍부한 품질 평가를 가능하게 한다.

제안 방법

  • 외부 데이터베이스 스키마와 물리적 또는 가상의 데이터를 연결한 매핑을 통해 맥락을 모델링한다.
  • 목표 데이터베이스 D를 맥락 스키마로 매핑함으로써 D의 대체 청소된 버전들의 집합 𝒞를 정의한다.
  • D와 집합 𝒞 사이의 거리로 데이터 품질을 측정함으로써 맥락적으로 올바른 데이터에 가까운 정도로 품질을 공식화한다.
  • 집합 𝒞를 사용하여 품질 질의 응답을 정의한다—모든 청소된 버전에서 일관되게 나타나는 응답.
  • 온톨로지(예: Datalog±, OWL)와 다차원 맥락을 지원하도록 모델을 확장하여 더 풍부한 의미론적 제약 조건을 가능하게 한다.
  • 품질 술어와 무결성 제약 조건을 통합하여 맥락 내에서 도메인 특화의 품질 요구 사항을 공식화한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 맥락과 사용자 특정 요구 사항에 따라 의존하는 방식으로 데이터 품질을 공식적으로 정의할 수 있는가?
  • RQ2어떻게 하면 외부 소스로부터 파생된 청소되고 맥락에 의해 유효한 버전들의 집합과 비교하여 데이터베이스의 품질을 평가할 수 있는가?
  • RQ3어떤 메커니즘이 맥락에 의해 검증된 데이터 버전 기반의 일관된 질의 응답을 가능하게 하는가?
  • RQ4온톨로지나 다차원 모델과 같은 더 풍부한 표현 방식은 데이터 품질 평가의 표현력과 정확도를 어떻게 향상시킬 수 있는가?
  • RQ5이 프레임워크는 최적화, 추론, 품질 측정의 효율적 계산을 지원하기 위해 어떻게 확장될 수 있는가?

주요 결과

  • 프레임워크는 데이터베이스와 맥락적으로 유도된 청소된 버전들의 집합 사이의 거리 측정 기반으로 데이터 품질을 공식화함으로써 객관적이고 공식적인 품질 평가를 가능하게 한다.
  • 품질 질의 응답은 맥락 내에서 데이터베이스의 모든 청소된 버전에 공통으로 나타나는 응답으로 정의되며, 이는 일관성과 신뢰성을 보장한다.
  • 모델은 의미론적 제약 조건과 품질 술어의 통합을 자연스럽게 지원하여 도메인 특화의 품질 규칙을 인코딩하고 시행할 수 있도록 한다.
  • 이 접근은 기존의 데이터베이스 복구 및 일관된 질의 응답 모델을 더 넓은 맥락 기반 프레임워크에 통합함으로써 일반화하고 확장한다.
  • 온톨로지와 다차원 맥락의 사용은 기존의 관계 모델을 초월하여 더 풍부하고 표현력 있는 품질 평가를 가능하게 한다.
  • 프레임워크는 확장 가능하며, 품질 측정의 효율적 계산 및 외부 맥락 데이터에 대한 확장 가능한 액세스를 위한 향후 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.