Skip to main content
QUICK REVIEW

[論文レビュー] Contexts and Data Quality Assessment

Leopoldo Bertossi, Flavio Rizzolo|arXiv (Cornell University)|Aug 14, 2016
Data Quality and Management参考文献 64被引用数 4
ひとこと要約

本論文は、外部スキーマおよびマッピングから導出された清浄で文脈的に検証されたバージョンの集合との距離として、データ品質を形式的かつ文脈依存的にモデル化する、形式的で文脈依存のフレームワークを提案する。主な貢献は、品質クエリの回答を可能にし、意味的制約、オントロジー、多次元的文脈を統合する、応用に依存しない強固なデータ品質評価を可能にする一般化されたモデルである。

ABSTRACT

The quality of data is context dependent. Starting from this intuition and experience, we propose and develop a conceptual framework that captures in formal terms the notion of "context-dependent data quality". We start by proposing a generic and abstract notion of context, and also of its uses, in general and in data management in particular. On this basis, we investigate "data quality assessment" and "quality query answering" as context-dependent activities. A context for the assessment of a database D at hand is modeled as an external database schema, with possibly materialized or virtual data, and connections to external data sources. The database D is put in context via mappings to the contextual schema, which produces a collection C of alternative clean versions of D. The quality of D is measured in terms of its distance to C. The class C} is also used to define and do "quality query answering". The proposed model allows for natural extensions, like the use of data quality predicates, the optimization of the access by the context to external data sources, and also the representation of contexts by means of more expressive ontologies.

研究の動機と目的

  • データ品質を文脈依存的に形式化し、『良い』データがアプリケーションの文脈やユーザーの意図によって異なることを認識すること。
  • 外部メタデータおよび外部データソースが特定の文脈においてデータ品質をどのように定義するかを捉える概念的モデルを開発すること。
  • 文脈的スキーマへのマッピングを通じて、データベースの清浄で文脈的に妥当なバージョンを導出し、品質クエリの回答を可能にすること。
  • 品質述語、オントロジー、多次元的文脈を通じて拡張性をサポートし、より豊かな品質評価を可能にすること。

提案手法

  • 文脈を、外部データソースとマッピングで接続された、物的または仮想のデータを有する外部データベーススキーマとしてモデル化する。
  • 対象データベース D を文脈スキーマにマッピングすることにより、D の代替的で清浄なバージョンの集合 𝒞 を定義する。
  • D と集合 𝒞 間の距離としてデータ品質を測定し、文脈的に正しいデータに近いほど品質が高いと形式化する。
  • 集合 𝒞 を用いて品質クエリの答えを定義する——すなわち、𝒞 内のすべての清浄なバージョンで一貫する答え。
  • オントロジー(例:Datalog±、OWL)および多次元的文脈への拡張を実施し、より豊かな意味的制約を可能にする。
  • 品質述語と整合性制約を統合し、文脈内でのドメイン固有の品質要件を形式化する。

実験結果

リサーチクエスチョン

  • RQ1文脈依存性とユーザー固有の要件を反映した形で、データ品質を形式的に定義する方法は何か?
  • RQ2外部ソースから導出された清浄で文脈的に妥当なバージョンの集合と比較することで、データベースの品質をどのように評価できるか?
  • RQ3文脈的に検証されたデータバージョンに基づいた一貫性のあるクエリ回答を可能にするメカニズムは何か?
  • RQ4オントロジーや多次元モデルなどのより豊かな表現は、データ品質評価の表現力と正確性をどのように向上させるか?
  • RQ5フレームワークは、最適化、推論、品質測定の効率的計算をサポートするようにどのように拡張できるか?

主な発見

  • フレームワークは、データベースと文脈から導出された清浄なバージョンの集合との間の距離として、データ品質を形式的かつ客観的に定式化し、形式的で一貫した品質評価を可能にする。
  • 品質クエリの答えは、文脈内でのすべての清浄なバージョンに共通する答えとして定義され、一貫性と信頼性を保証する。
  • モデルは意味的制約と品質述語の統合を自然にサポートし、ドメイン固有の品質ルールをエンコードおよび実装可能にする。
  • 文脈フレームワーク内に埋め込むことで、従来のデータベース修復および一貫性のあるクエリ回答のモデルを一般化・拡張する。
  • オントロジーや多次元的文脈の使用により、従来のリレーショナルモデルをはるかに超えた、より豊かで表現力のある品質評価が可能になる。
  • フレームワークは拡張可能であり、品質測定の効率的計算や、外部的文脈データへのスケーラブルなアクセスを促進する今後の研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。