Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Integration & Single-Site Opening of Multiple Governmental Data Sources.

Konstantinos Kotis, Iraklis I. Athanasakis|arXiv (Cornell University)|Jul 2, 2014
Semantic Web and Ontologies参考文献 14被引用数 3
ひとこと要約

本論文では、D2RQとFusekiを用いて、単一のサイトから複数の分散型政府データソースを統一的かつオントロジー媒介の方法で照会可能な、S3-AIと呼ばれる意味的アプリケーション統合手法を提案する。この手法は、データ所有権と自律性を保ちながら、リアルタイムで連携されたSPARQL照会を、変化し続けるライブデータに対して実現する。e-Government ITヘルプデスクのユースケースにおいて、最小限のコストと高いカスタマイズ性を実現し、有効性が示された。

ABSTRACT

In many cases, government data is still "locked" in several "data silos", even within the boundaries of a single (inter-)national public organization with disparate and distributed organizational units and departments spread across multiple sites. Opening data and enabling its unified querying from a single site in an efficient and effective way is a semantic application integration and open government data challenge. This paper describes how NARA is using Semantic Web technology to implement an application integration approach within the boundaries of its organization via opening and querying multiple governmental data sources from a single site. The generic approach proposed, namely S3-AI, provides support to answering unified, ontology-mediated, federated queries to data produced and exploited by disparate applications, while these are being located in different organizational sites. S3-AI preserves ownership, autonomy and independency of applications and data. The paper extensively demonstrates S3-AI, using the D2RQ and Fuseki technologies, for addressing the needs of a governmental "IT helpdesk support" case.

研究の動機と目的

  • 複数の異なる、分散型の政府機関データソースを、1つの公共行政機関内で統合する課題に対処すること。
  • 既存のシステムを中央集権化または再設計することなく、複数の自律的データソースからライブで変化するデータを統一的かつリアルタイムに照会できることを実現すること。
  • データ所有権と自律性を保ちながら、オープンで軽量なセマンティックウェブ技術を用いて意味的アプリケーション統合を支援すること。
  • 実世界のe-Government ITヘルプデスクユースケースにおいて、この手法の実現可能性と利点を示すこと。
  • 公共部門におけるデータ統合にセマンティック技術を導入する際のベストプラクティスと教訓を特定すること。

提案手法

  • リレーショナルデータベースを仮想RDFグラフにマッピングすることで、既存のリレーショナルデータソースに対する意味的アクセスを可能にするD2RQの使用。
  • 複数の仮想RDFソースに跨る連携照会を実行するためのSPARQL 1.1エンドポイントとしてのFusekiの使用。
  • 異種のデータスキーマに跨る照会を調整するために、分野特化型の参照オントロジーを構築し、それを用いること。
  • 半自動的手法を用いてアプリケーション固有のスキーマと参照オントロジーとの間の意味的マッピングを構築し、手動による検証を実施すること。
  • 分散データに跨る連携照会を可能にする統一されたSPARQLエンドポイントを公開する単一サイトのアクセスポイントを実装すること。
  • 初期導入段階でのデータセキュリティとプライバシーを確保するため、公的デモ用にダミーデータを用いること。

実験結果

リサーチクエスチョン

  • RQ1複数の自律的かつ分散型の政府データソースを、元のシステムを中央集権化または変更せずに、意味的に統合する方法は何か?
  • RQ2D2RQとFusekiは、政府環境において、変化するライブデータに対して、効率的でリアルタイムの連携SPARQL照会をどの程度実現できるか?
  • RQ3公共行政の文脈において、異種のデータスキーマを共通の参照オントロジーにマッピングする際の実務上の課題とベストプラクティスは何か?
  • RQ4統一的なデータアクセスと照会を可能にしつつ、データ所有権と自律性をどのように維持できるか?
  • RQ5政府データ統合に軽量でオープンソースのセマンティックウェブ技術を用いる場合の、パフォーマンスと保守性のトレードオフは何か?

主な発見

  • S3-AI手法により、NARAのe-Government ITヘルプデスクシステム内において、5つの分散型データソースに跨る統一的でオントロジー媒介の連携SPARQL照会が成功裏に実現された。
  • D2RQとFusekiの使用により、データの複製やシステムの再設計なしに、変化するライブデータへのリアルタイムアクセスが可能となった。
  • この手法は、低メンテナンスコスト、高いカスタマイズ性、低コストを実現しており、リソースが限られた公共機関への導入に適していることが示された。
  • 特に、適切に選択された参照オントロジーと半自動マッピング支援を用いることで、複雑なスキーマの非同型性に対しても統合プロセスが実現可能であった。
  • 導入プロセスにおいて、手作業によるマッピングの課題が明らかになった。具体的には、誤った語のペairリング、構文エラー、欠落したマッピングが確認され、慎重な検証の重要性が強調された。
  • データセキュリティは依然として重要な懸念事項であり、著者らは、公開されたデータはすべて匿名化またはダミーデータに限定されており、安全なエンドポイントの実装が今後の作業の最優先事項であると指摘している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。