[论文解读] Evaluating the Quality of RDF Data Sets on Common Vocabularies in the Social, Behavioral, and Economic Sciences
本文使用 115 项约束对来自 33 个 SBE 科研机构的 SPARQL 端点中的 15,694 个 RDF 数据集(42.6 亿个三元组)进行了评估,涉及三个核心词汇表:DDI-RDF、RDF 数据立方体(QB)和 SKOS。研究发现,在结构、语义和语法约束方面存在广泛违规,尽管使用了标准化词汇表,仍暴露出严重的数据质量问题,并为 SBE 研究数据的 RDF 验证实践改进奠定了基础。
From 2012 to 2015 together with other Linked Data community members and experts from the social, behavioral, and economic sciences (SBE), we developed diverse vocabularies to represent SBE metadata and tabular data in RDF. The DDI-RDF Discovery Vocabulary (DDI-RDF) is designed to support the dissemination, management, and reuse of unit-record data, i.e., data about individuals, households, and businesses, collected in form of responses to studies and archived for research purposes. The RDF Data Cube Vocabulary (QB) is a W3C recommendation for expressing data cubes, i.e. multi-dimensional aggregate data and its metadata. Physical Data Description (PHDD) is a vocabulary to model data in rectangular format, i.e., tabular data. The data could either be represented in records with character-separated values (CSV) or fixed length. The Simple Knowledge Organization System (SKOS) is a vocabulary to build knowledge organization systems such as thesauri, classification schemes, and taxonomies. XKOS is a SKOS extension to describe formal statistical classifications. To ensure high quality of and trust in both metadata and data, their representation in RDF must satisfy certain criteria - specified in terms of RDF constraints. In this paper, we evaluate the data quality of 15,694 data sets (4.26 billion triples) of research data for the social, behavioral, and economic sciences obtained from 33 SPARQL endpoints. We checked 115 constraints on three different and representative SBE vocabularies (DDI-RDF, QB, and SKOS) by means of the RDF Validator, a validation environment which is available at http://purl.org/net/rdfval-demo.
研究动机与目标
- 使用正式约束评估社会、行为与经济(SBE)科学中 RDF 数据集的质量。
- 识别通过 SPARQL 端点发布的现实世界 SBE RDF 数据集中常见的数据质量问题。
- 评估不同约束语言(如 SPARQL、OWL、SHACL)在 SBE 元数据和数据中表达与强制执行数据质量规则的表达能力与实用性。
- 为 SBE 领域的 RDF 数据质量提供一套经验证且可重用的 115 项约束。
- 支持在语义网中开发稳健且标准化的 SBE 研究数据验证实践。
提出的方法
- 在三个 SBE 词汇表中定义了 115 项 RDF 约束:DDI-RDF(元数据)、QB(数据立方体)和 SKOS/XKOS(同义词表与分类法)。
- 根据严重性(如严重、主要、次要)和约束语言中的可表达性(RDFS/OWL、SPARQL、高级语言)对约束进行分类。
- 使用 RDF 验证器工具实现约束,该工具公开可访问于 http://purl.org/net/rdfval-demo。
- 在来自 33 个 SBE 机构的 SPARQL 端点的 15,694 个数据集(42.6 亿个三元组)上执行大规模验证。
- 从领域专家和用例中收集并整理约束,参考了 DCMI 和 W3C RDF 验证研讨会的成果。
- 将约束映射到 DCMI RDF 验证需求数据库中识别出的 81 种约束类型,确保与实际需求保持一致。
实验结果
研究问题
- RQ1现实世界中的 SBE RDF 数据集中,结构、语义和语法违规的普遍程度如何?
- RQ2不同约束语言(如 SPARQL、OWL、SHACL)在 SBE 元数据和数据中如何表达和强制执行数据质量规则?
- RQ3在 SBE RDF 数据集中,哪些约束类型最常被违反,这些违规揭示了哪些数据质量问题?
- RQ4现有词汇表(DDI-RDF、QB、SKOS)及其实际实现,在多大程度上满足了数据质量标准?
- RQ5如何实现基于约束的验证的规模化与标准化,以提升 SBE 研究数据在数据之网中的可信度与可重用性?
主要发现
- 在 STRUCTURE-06 约束(缺少必需属性)中记录了超过 239,000 项违规,表明 DDI-RDF 数据集中普遍存在结构缺陷。
- LANGUAGE-TAG-CARDINALITY-02 约束在 36,936 个数据集(如 STW 同义词表)中被违反,表明 SKOS 词汇表中语言标签使用不一致。
- 在 SKOS 和 XKOS 中发现 13 项严重违规(严重性等级为 '!'),包括 DISJOINT-PROPERTIES-01 和 HTTP-URI-SCHEME-VIOLATION,某些情况下影响了 100% 的测试同义词表。
- DDI-RDF 词汇表在 STRUCTURE-01 约束中出现 18,240 项违规,表明元数据描述中缺少必需的结构元素。
- RDF 数据立方体(QB)词汇表在 STRUCTURE-07 约束中出现 110,015 项违规,凸显了立方体结构与维度性方面的问题。
- 共实施并验证了 115 项约束,覆盖 15,694 个数据集,表明即使在成熟的 SBE 词汇表中,数据质量问题也普遍存在。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。