Skip to main content
QUICK REVIEW

[論文レビュー] Data lake concept and systems: a survey.

Rihan Hai, Christoph Quix|arXiv (Cornell University)|Jun 17, 2021
Data Quality and Management参考文献 107被引用数 21
ひとこと要約

本調査は、従来の「スキーマ・オン・ライト」アーキテクチャにおける多様で大量のデータの管理の課題に対処するため、データレイクの概念とシステムの包括的分析を提案する。本調査は、機能別に既存のデータレイクシステムを分類し、アーキテクチャ的インサイトを提供するとともに、今後のデータレイク設計および実装の開発を導くための未解決の研究的課題を特定する。

ABSTRACT

Although big data has been discussed for some years, it still has many research challenges, especially the variety of data. It poses a huge difficulty to efficiently integrate, access, and query the large volume of diverse data in information silos with the traditional 'schema-on-write' approaches such as data warehouses. Data lakes have been proposed as a solution to this problem. They are repositories storing raw data in its original formats and providing a common access interface. This survey reviews the development, definition, and architectures of data lakes. We provide a comprehensive overview of research questions for designing and building data lakes. We classify the existing data lake systems based on their provided functions, which makes this survey a useful technical reference for designing, implementing and applying data lakes. We hope that the thorough comparison of existing solutions and the discussion of open research challenges in this survey would motivate the future development of data lake research and practice.

研究の動機と目的

  • ビッグデータの多様性を扱う能力に制限がある従来のデータウェアハウスの課題を解決すること。
  • 生の多様なデータをネイティブフォーマットそのままで保存するためのデータレイクパラダイムを検討すること。
  • その機能的特徴に基づいて、既存のデータレイクシステムを体系的に分類すること。
  • データレイク設計、実装、展開における主要な研究的課題を特定すること。
  • 研究者および実務家がデータレイクシステムを構築および応用するための技術的リファレンスとして機能すること。

提案手法

  • 本論文は、データレイク開発、定義、およびシステムアーキテクチャに関する包括的調査を実施する。
  • 機能的特徴に基づいてデータレイクシステムを分類することで、構造的な比較を可能にする。
  • データレイク概念の進化およびその技術的基盤を分析する。
  • データインジェクション、ストレージ、クエリ処理、メタデータ管理などの基準を用いて、データレイクシステムを評価する。
  • 既存の文献からの知見を統合し、アーキテクチャ的パターンと設計上のトレードオフを強調する。
  • 今後のデータレイク技術分野におけるイノベーションを導くために、未解決の研究的課題を議論する。

実験結果

リサーチクエスチョン

  • RQ1データレイクは、データの多様性とボリュームを扱う点で、従来のデータウェアハウスとどのように異なるか?
  • RQ2現代のデータレイクシステムのコアなアーキテクチャ的構成要素と設計原則は何か?
  • RQ3既存のデータレイクシステムは、メタデータおよびデータラインレージャンスをどのように分類・管理しているか?
  • RQ4現在のデータレイクプラットフォームの主な機能的特徴と制限は何か?
  • RQ5データレイク設計および展開において、未解決の研究的課題は何か?

主な発見

  • データレイクは、元のフォーマットのまま生データに共通のアクセスインターフェースを提供し、『スキーマ・オン・ライト』アプローチの硬直性を克服する。
  • 本調査は、機能的特徴に基づいてデータレイクシステムを分類し、システム設計のための有用な技術的リファレンスを提供する。
  • データレイクは、異種のデータソースおよびフォーマット間での柔軟なデータ統合とクエリ処理をサポートする。
  • 本調査は、データレイク内でのデータ品質、セキュリティ、パフォーマンス最適化における顕著な研究ギャップを特定する。
  • 既存のシステムは、メタデータ管理、データラインレージャンス、トランザクション整合性のサポートにおいて顕著に異なる。
  • 本論文は、標準化された評価フレームワークおよび改善されたツールキットの必要性を強調し、データレイク分野の研究と実務の発展を促進する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。