Skip to main content
QUICK REVIEW

[論文レビュー] The Query Translation Landscape: a Survey

Mohamed Nadjib Mami, Damien Graux|arXiv (Cornell University)|Oct 7, 2019
Semantic Web and Ontologies参考文献 65被引用数 16
ひとこと要約

本サーベイは、7つの主要なクエリ言語を対象に、40種類以上のクエリ翻訳手法を分析し、翻訳品質を評価するための8つの基準を提案。ユニバーサルクエリ言語としてのSQLとSPARQLが最も適していると特定。高度なクエリ機能の処理における深刻なギャップを明らかにし、標準化されたベンチマークとユースケース駆動の評価を求める。

ABSTRACT

Whereas the availability of data has seen a manyfold increase in past years, its value can be only shown if the data variety is effectively tackled ---one of the prominent Big Data challenges. The lack of data interoperability limits the potential of its collective use for novel applications. Achieving interoperability through the full transformation and integration of diverse data structures remains an ideal that is hard, if not impossible, to achieve. Instead, methods that can simultaneously interpret different types of data available in different data structures and formats have been explored. On the other hand, many query languages have been designed to enable users to interact with the data, from relational, to object-oriented, to hierarchical, to the multitude emerging NoSQL languages. Therefore, the interoperability issue could be solved not by enforcing physical data transformation, but by looking at techniques that are able to query heterogeneous sources using one uniform language. Both industry and research communities have been keen to develop such techniques, which require the translation of a chosen 'universal' query language to the various data model specific query languages that make the underlying data accessible. In this article, we survey more than forty query translation methods and tools for popular query languages, and classify them according to eight criteria. In particular, we study which query language is a most suitable candidate for that 'universal' query language. Further, the results enable us to discover the weakly addressed and unexplored translation paths, to discover gaps and to learn lessons that can benefit future research in the area.

研究の動機と目的

  • 異種データ環境におけるデータ相互運用性の課題に対処すること、特にポリグロットパーゼィジョンおよびデータレイクアーキテクチャにおいて。
  • 一様なクエリ言語を用いて多様なデータソースを照会可能にする、既存のクエリ翻訳手法を特定および評価すること。
  • 特に高度なクエリ機能および最適化戦略におけるサポートに関する、未だ未開拓の翻訳パスや研究ギャップを特定すること。
  • 分野における専用ベンチマークの欠如を特定し、クエリ翻訳のための標準化された評価フレームワークを提案すること。

提案手法

  • 著者らは、言語カバレッジ、表現力、最適化、その他の技術的側面に基づき、クエリ翻訳手法を体系的に評価・分類するための8基準の「クエリ翻訳アイデンティティカード」を定義。
  • SQL、SPARQL、XPath、XQuery、Gremlin、Cypher、NoSQLの変種を含む、広く使われているクエリ言語間のクエリ翻訳に関する、40件を超えるツールおよび学術的論文をサーベイ。
  • 2003年から2019年までのクエリ翻訳研究の歴史的タイムラインを含み、採用傾向を追跡し、研究活動が活発または希薄だった時期を特定。
  • 図解的表現と比較分析を用いて、翻訳カバレッジ、言語ペア、およびシステム間の機能サポートを可視化。
  • 翻訳時と翻訳後の最適化手法の比較を通じて、実行時パフォーマンスの向上を評価し、翻訳段階での最適化の重要性を強調。
  • 複雑なジョイン、時系列関数、空ノード、グループ化などのクエリ機能のサポート範囲を、さまざまな翻訳パイプラインで評価。

実験結果

リサーチクエスチョン

  • RQ1異種データソース間での相互運用性に適したユニバーサルクエリ言語として、どのクエリ言語が最も適しているか?
  • RQ2一般的なクエリ言語の中で、最も対応が不足しているか未探索のクエリ翻訳パスは何か?
  • RQ3クエリ翻訳の過程で適用される最適化戦略は、生成されたターゲットクエリを後処理で最適化するのと比べて、パフォーマンスにどのように影響するか?
  • RQ4時系列関数、複雑なジョイン、SPARQL固有の構文などの高度なクエリ機能を、既存の翻訳手法がどの程度サポートしているか?
  • RQ5なぜクエリ翻訳システムを評価するための標準化されたベンチマークが存在しないのか?また、ユニバーサルベンチマークはどのような形になるか?

主な発見

  • SQLとSPARQLが、他の言語への双方向翻訳マッピングの数が最も多いことから、ユニバーサルクエリ言語として最も適している。
  • ソースシステムの統計を活用して翻訳段階で最適化を適用する方が、ターゲットクエリに対して後処理で最適化を施すよりも、パフォーマンス向上が顕著に大きい。
  • 多くの既存の翻訳システムが、SQLにおける複雑なジョイン、SPARQLにおける空ノードやグループ化、時系列関数のサポートを欠いている。
  • 標準化されたベンチマークが存在しないため、公平で再現可能な比較が困難である。
  • 大多数の評価フレームワークは一時的なものであり、実世界のユースケースでの検証が不十分。代表的なクエリパターンを用いたユースケース駆動のテストが、意味のある評価のために不可欠である。
  • XMLからSQL、XMLからGremlinへの翻訳に関する研究は減少傾向にあり、2015年以降に新しい論文が発表されていない。これは、これらの分野の関心の低下または成熟の兆候である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。