[論文レビュー] A Big Data Based Framework for Executing Complex Query Over COVID-19 Datasets (COVID-QF)
本稿では、異種のCOVID-19データセット上で複雑なクエリを効率的に行うために、SQLとNoSQLデータベースを統合する大規模データフレームワークであるCOVID-QFを提案する。Hadoop HDFS/MapReduceおよびApache Sparkを用い、データ収集、ストレージ、クエリ処理の3つの抽象化レイヤーで構成されるアーキテクチャを採用することで、データ取得および処理時間を短縮し、COVID-19-Merging、inside-Hubei、ex-Hubeiの3つの実世界データセットにおいて優れた性能を示した。
COVID-19's rapid global spread has driven innovative tools for Big Data Analytics. These have guided organizations in all fields of the health industry to track and minimized the effects of virus. Researchers are required to detect coronaviruses through artificial intelligence, machine learning, and natural language processing, and to gain a complete understanding of the disease. COVID-19 takes place in different countries in the world, with which only big data application and the work of NOSQL databases are suitable. There is a great number of platforms used for processing NOSQL Databases model like: Spark, H2O and Hadoop HDFS/MapReduce, which are proper to control and manage the enormous amount of data. Many challenges faced by large applications programmers, especially those that work on the COVID-19 databases through hybrid data models through different APIs and query. In this context, this paper proposes a storage framework to handle both SQL and NOSQL databases named (COVID-QF) for COVID-19 datasets in order to treat and handle the problems caused by virus spreading worldwide by reducing treatment times. In case of NoSQL database, COVID-QF uses Hadoop HDFS/Map Reduce and Apache Spark. The COVID-QF consists of three Layers: data collection layer, storage layer, and query Processing layer. The data is collected in the data collection layer. The storage layer divides data into collection of data-saving and processing blocks, and it connects the Connector of the spark with different databases engine to reduce time of saving and retrieving. While the Processing layer executes the request query and sends results. The proposed framework used three datasets increased for time for COVID-19 data (COVID-19-Merging, COVID-19-inside-Hubei and COVID-19-ex-Hubei) to test experiments of this study. The results obtained insure the superiority of the COVID-QF framework.
研究の動機と目的
- パンデミック期に世界中で生成された大規模で多様なCOVID-19データセットを管理・クエリ処理する課題に対処すること。
- 大規模な健康データ分析システムにおけるクエリ実行時間およびデータ取得時間の短縮。
- SQLおよびNoSQLデータベースを両方サポートする統一フレームワークの設計により、データ統合および処理効率の向上。
- スケーラブルなビッグデータ技術を活用して、多様なデータモデルを跨る複雑なマルチソースクエリを効率的に処理すること。
提案手法
- フレームワークは3層アーキテクチャを採用:複数のソースからのデータインgestionを担当するデータ収集レイヤー、データをブロックに分割しSparkおよびデータベースエンジンへのコネクタを管理するストレージレイヤー、クエリ実行と結果返却を担当するクエリ処理レイヤー。
- 分散ストレージおよび並列計算を処理するコアプロセッシングエンジンとして、Hadoop HDFS/MapReduceおよびApache Sparkを用いる。
- ストレージレイヤーは、さまざまなデータベースエンジンへのコネクタを統合しており、SQLおよびNoSQLシステム間での効率的なデータ保存および取得を可能にしている。
- フレームワークはハイブリッドデータモデルをサポートし、構造化および非構造化データ形式の間でシームレスなクエリ処理を可能にしている。
- 性能評価のため、COVID-19-Merging、COVID-19-inside-Hubei、COVID-19-ex-Hubeiの3つの実世界データセットを処理している。
- 並列処理およびデータシャーディングによりクエリ実行が最適化され、複雑な分析ワークロードにおける遅延が低減されている。
実験結果
リサーチクエスチョン
- RQ1どのようにして、多様なグローバルソースからの複雑で多様なCOVID-19データセットを効率的に管理・クエリ処理できる統一フレームワークを構築できるか?
- RQ2大規模でリアルタイムの健康データに対して、低遅延で複雑なクエリを実行できるアーキテクチャ的設計は何か?
- RQ3SQLとNoSQLデータベースを組み合わせることで、パンデミック分析におけるデータ処理パフォーマンスはどの程度向上するか?
- RQ4HadoopとSparkの統合は、ビッグデータベースの疾患監視システムにおけるスケーラビリティおよび応答性をどのように向上させるか?
主な発見
- COVID-QFフレームワークは、従来のシステムと比較して、データ取得および処理時間を顕著に短縮し、パンデミック関連のクエリへの迅速な対応を可能にした。
- SQLおよびNoSQLデータベースを統合したハイブリッドストレージモデルにより、多様なデータタイプ間でのデータ統合およびクエリの柔軟性が向上した。
- Apache SparkおよびHadoop HDFS/MapReduceの使用により、効率的な並列処理が実現され、大規模データセットにおけるスケーラビリティが向上した。
- COVID-19-Merging、inside-Hubei、ex-Hubeiの3つのデータセットにおける性能評価により、フレームワークの強固さと効率性が確認された。
- モジュラーなアーキテクチャにより、進化するデータソースおよびクエリパターンへの拡張性と適応性が確保された。
- 結果は、リアルタイムの公衆衛生意思決定に不可欠な複雑でマルチソースのクエリを効率的に処理できるフレームワークの優位性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。