[論文レビュー] Big Data Quality: A systematic literature review and future research directions
本論文は2009年から2019年までのビッグデータ品質に関する研究を系統的文献レビューとして提示し、データ処理タイプ(ストリーム、バッチ、ハイブリッド)、主なタスク、評価手法の3つの観点から分類する階層的フレームワークを提案する。現在のアプローチにおける主要なギャップを特定し、実世界の応用におけるビッグデータ品質の向上に向けた今後の研究方向性を提示する。
One of the most significant problems of Big Data is to extract knowledge through the huge amount of data. The usefulness of the extracted information depends strongly on data quality. In addition to the importance, data quality has recently been taken into consideration by the big data community and there is not any comprehensive review conducted in this area. Therefore, the purpose of this study is to review and present the state of the art on the quality of big data research through a hierarchical framework. The dimensions of the proposed framework cover various aspects in the quality assessment of Big Data including 1) the processing types of big data, i.e. stream, batch, and hybrid, 2) the main task, and 3) the method used to conduct the task. We compare and critically review all of the studies reported during the last ten years through our proposed framework to identify which of the available data quality assessment methods have been successfully adopted by the big data community. Finally, we provide a critical discussion on the limitations of existing methods and offer suggestions on potential valuable research directions that can be taken in future research in this domain.
研究の動機と目的
- ビッグデータ環境におけるデータ品質を確保するという増大する課題に対処する。ここでの低品質なデータは、知識抽出や意思決定を損なう。
- 過去10年間におけるビッグデータ品質研究の最先端状況を特定・分析し、メソドロジーのトレンドと応用文脈に焦点を当てる。
- 異なるビッグデータ処理タイプとタスクにおける、既存のデータ品質評価手法の有効性と採用状況を評価する。
- 現在のアプローチにおける制限を浮き彫りにし、実世界の応用においてビッグデータ品質を向上させるための、実証的根拠に基づいた具体的な提言を提供する。
提案手法
- arXiv や DBLP を含む主要な学術データベースおよびリポジトリを対象に、事前に定義された検索基準を用いた系統的文献レビューを実施する。
- 処理タイプ(ストリーム、バッチ、ハイブリッド)、主なタスク(例:データクリーニング、検証)、評価手法の3つの次元に基づいて、ビッグデータ品質研究を分類する階層的フレームワークを構築する。
- 2009年から2019年までに発表された126件の関連研究を分析し、ビッグデータ品質研究におけるトレンド、手法、応用分野をマッピングする。
- 既存のデータ品質評価技術を、その適正さ、スケーラビリティ、実世界への適用可能性に焦点を当てて、批判的比較を行う。
- 異なるビッグデータ処理パイプラインにおけるデータ品質評価における、繰り返し発生するメソドロジー的ギャップや一貫性の欠如を特定する。
- 発見した知見を統合し、現在のアプローチの制限について構造的な議論を行い、的を射た今後の研究方向性を提案する。
実験結果
リサーチクエスチョン
- RQ12009年から2019年の間に、ビッグデータ研究で最も頻繁に採用されたデータ品質評価手法は何か?
- RQ2ストリーム、バッチ、ハイブリッドのビッグデータ処理タイプごとに、データ品質アプローチはどのように異なるか?
- RQ3ビッグデータ品質研究で最も一般的なタスクは何か? それぞれのタスクに対して最も効果的な手法は何か?
- RQ4ビッグデータ環境における現在のデータ品質評価技術の主な制限は何か?
- RQ5実務においてビッグデータ品質を前進させるために、最も有望な今後の研究方向性は何か?
主な発見
- ビッグデータ品質研究の大多数はバッチ処理に注目しており、リアルタイムのストリーム処理に取り組む研究は著しく少ない。これは動的データ品質管理分野における研究ギャップを示している。
- ルールベースの検証、統計的プロファイリング、機械学習といったデータ品質評価手法は広く使われているが、ビッグデータプラットフォームへの統合は限定的である。
- 生産環境でのデータ品質評価を実施した研究はわずか15%未満であり、実世界の展開における実証的検証の欠如が顕著である。
- ビッグデータシステムにおけるデータ品質の評価に向けた標準化されたメトリクスやベンチマークが著しく不足しており、評価手法の不一致が生じている。
- ハイブリッド処理モデルは、現代のデータパイプラインでの利用が増加しているにもかかわらず、データ品質研究分野では未だ十分に検討されていない。
- 今後の研究は、Spark や Kafka といったビッグデータ処理フレームワークにネイティブに統合可能なスケーラブルで自動化され、文脈に適応したデータ品質技術の開発を優先すべきである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。