Skip to main content
QUICK REVIEW

[論文レビュー] Fostering the integration of European Open Data into Data Spaces through High-Quality Metadata

Javier Conde, Alejandro Pozo|arXiv (Cornell University)|Feb 8, 2024
Data Quality and ManagementDecision Sciences被引用数 3
ひとこと要約

本論文は、欧州オープンデータの高品質でDCAT準拠のメタデータの生成、検証、公開を自動化するオープンソースのソフトウェアスタックを提示している。このソリューションは、YODAポータルを介して200件以上のデータセットで検証され、data.europa.euにおけるFAIR指標の上位水準を達成し、完全な100/100の検索可能性スコアを記録した。実運用環境におけるスケーラビリティと相互運用性が実証された。

ABSTRACT

The term Data Space, understood as the secure exchange of data in distributed systems, ensuring openness, transparency, decentralization, sovereignty, and interoperability of information, has gained importance during the last years. However, Data Spaces are in an initial phase of definition, and new research is necessary to address their requirements. The Open Data ecosystem can be understood as one of the precursors of Data Spaces as it provides mechanisms to ensure the interoperability of information through resource discovery, information exchange, and aggregation via metadata. However, Data Spaces require more advanced capabilities including the automatic and scalable generation and publication of high-quality metadata. In this work, we present a set of software tools that facilitate the automatic generation and publication of metadata, the modeling of datasets through standards, and the assessment of the quality of the generated metadata. We validate all these tools through the YODA Open Data Portal showing how they can be connected to integrate Open Data into Data Spaces.

研究の動機と目的

  • 欧州オープンデータポータルにおける低品質または準拠不備のメタデータが、新興のData Spacesへの統合を妨げるという重要な障壁に対処すること。
  • DCAT-AP v2.1.0およびFAIR原則に準拠した、自動的でスケーラブルかつ標準化されたメタデータ生成を可能にすること。
  • 生データセットを、相互運用可能なデータ交換に適した意味的豊富なメタデータに変換する再利用可能なソフトウェアスタックの開発。
  • 異なる公共データソース(例:AEMET、SmartSantander、Smart Campus CEI Moncloa)における多様な実運用環境で、ソリューションの検証。
  • 高品質なメタデータが、パンヨーロッパのデータインfraストラクチャにおいて、データの検索可能性、アクセス可能性、再利用可能性を顕著に向上させることの実証。

提案手法

  • 異種のデータソースからのスケーラブルでリアルタイムのデータインジェストおよび変換に、Apache NiFiを活用。
  • 意味的モデリングとメタデータテンプレートを用いて、生データセットをDCAT-AP v2.1.0基準にマッピングするメタデータ生成パイプラインを実装。
  • 検索可能性、アクセス可能性、相互運用性、再利用可能性、文脈的関連性を評価するため、オープンデータポータル品質評価(MQA)フレームワークに基づくメタデータ品質評価モジュールを統合。
  • OAI-PMH v2ハーヴェスティング対応の ckanext-dcatapedp 拡張機能を用いて、CKANベースのポータルへのデータセット自動公開を実装。
  • 異なる公共部門のデータプロバイダーでの再利用を可能にするモジュラーでオープンソースのソフトウェアスタックを設計。また、ヨーロッパデータポータルとの統合を支援。
  • スケーラビリティおよびクロスドメイン適合性の検証のため、3つの異なるデータソース(AEMET、SmartSantander、Smart Campus CEI Moncloa)にシステムを設定。

実験結果

リサーチクエスチョン

  • RQ1異種の公共部門データセットに対して、スケールアップ可能な自動的で高品質なメタデータ生成はどのように達成できるか?
  • RQ2DCAT-AP v2.1.0準拠は、Data SpacesにおけるオープンデータのFAIR性および相互運用性をどの程度向上させるか?
  • RQ3標準化され自動化されたパイプラインは、実運用環境において、検索可能性や再利用可能性といったメタデータ品質指標を顕著に改善できるか?
  • RQ4自動メタデータ品質評価は、パンヨーロッパのデータインfraストラクチャにおけるオープンデータポータルのパフォーマンスにどのような影響を与えるか?
  • RQ5提案されたスタックは、多様な公共データソースをヨーロッパデータポータルに統合する際に、高品質なメタデータを維持しながらどの程度効果的に機能するか?

主な発見

  • YODAポータルは、data.europa.euにおける検索可能性で完全な100.0/100.0のスコアを達成し、他のハーヴェスト済みカタログの平均69.3を大きく上回った。
  • アクセス可能性は96.0/100で、平均53.7を上回り、データの可用性と機械可読性の高さを示した。
  • 相互運用性は80.0/100で、平均40.2を大きく上回り、強固なDCAT-AP準拠性と構造化されたメタデータを示した。
  • 再利用可能性は75.0/100で、平均51.3を上回り、メタデータの豊かさとデータドキュメンテーションの有効性を反映した。
  • データ発見における重要な次元である文脈的関連性は20.0/100で、平均6.6の3倍以上を記録し、優れたデータの文脈情報と出典情報の提供を示した。
  • 本ソリューションは、3つの異なる公共データソース(AEMET、SmartSantander、Smart Campus CEI Moncloa)から200件以上のデータセットを正常にインジェストおよび公開し、スケーラビリティとクロスドメイン適合性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。