Skip to main content
QUICK REVIEW

[論文レビュー] BDGS: A Scalable Big Data Generator Suite in Big Data Benchmarking

Zijian Ming, Chunjie Luo|arXiv (Cornell University)|Jan 22, 2014
Data Quality and Management参考文献 19被引用数 12
ひとこと要約

BDGS は、現実のデータモデルを活用して、ビッグデータの 4V 特性(ボリューム、ボリューム、バリエーション、信頼性)を保持する合成データを生成することを目的としたスケーラブルなビッグデータ生成キットである。構造化、準構造化、非構造化データをテキスト、グラフ、テーブルのソースからサポートし、データ生成時間における線形スケーラビリティを達成し、さまざまなワークロードにおいて一貫した高速生成レート(例:テキストで 71.3 MB/s、グラフで 591,684 エッジ/s)を維持する。

ABSTRACT

Data generation is a key issue in big data benchmarking that aims to generate application-specific data sets to meet the 4V requirements of big data. Specifically, big data generators need to generate scalable data (Volume) of different types (Variety) under controllable generation rates (Velocity) while keeping the important characteristics of raw data (Veracity). This gives rise to various new challenges about how we design generators efficiently and successfully. To date, most existing techniques can only generate limited types of data and support specific big data systems such as Hadoop. Hence we develop a tool, called Big Data Generator Suite (BDGS), to efficiently generate scalable big data while employing data models derived from real data to preserve data veracity. The effectiveness of BDGS is demonstrated by developing six data generators covering three representative data types (structured, semi-structured and unstructured) and three data sources (text, graph, and table data).

研究の動機と目的

  • ベンチマーク用に、実データの特性を保持するアプリケーション固有のスケーラブルなビッグデータを生成する課題に対処すること。
  • Hadoop などの特定プラットフォームに限定される既存の生成ツールの限界を克服すること。
  • 現実のデータモデルを用いて、データボリュームとボリュームの柔軟な制御を可能にしつつ、データの信頼性を維持すること。
  • 検索エンジン、電子商取引、ソーシャルネットワークなど、さまざまな分野のビッグデータワークロードをカバーすること。
  • 実データの統計的・構造的特性を反映する合成データを生成するモジュラーで拡張可能なフレームワークを提供すること。

提案手法

  • テキスト、グラフ、テーブルのソースから得た現実のデータセットに基づき、実データの信頼性を保証する 6 つのデータ生成ツールのキットを設計すること。
  • ハードウェアの能力と実行時間に基づいて、データボリュームとボリュームをスケーリングする並列生成戦略を実装すること。
  • 分布、構造、関係性などの重要な特性を保持するため、実データから導出された統計モデルを用いること。
  • Hadoop や Spark などの主要ビッグデータシステムとの相互運用性を確保するため、データフォーマット変換ツールを統合すること。
  • メモリ使用量と並列処理の最適化により、異なるデータタイプとボリュームにおいて一貫した生成レートを維持すること。
  • 広範なアクセシビリティと統合を実現するため、オープンソースの BigDataBench フレームワーク内に生成ツールキットを統合すること。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、実ビッグデータの 4V 特性(ボリューム、ボリューム、バリエーション、信頼性)を保持するビッグデータ生成キットを設計できるか?
  • RQ2どのような技術が、構造化、準構造化、非構造化データなど多様なデータタイプとテキスト、グラフ、テーブルなど多様なソースにおいて、スケーラブルで高性能なデータ生成を可能にするか?
  • RQ3データボリュームが増加するに従って、合成データ生成が一貫した性能レートを維持できる範囲はどの程度か?
  • RQ4メモリ使用率はデータ生成パフォーマンスにどのように影響するか?また、異なる生成ツールタイプにおけるボトル neck は何か?
  • RQ5同じ生成ツールが、ビッグデータベンチマークにおける複数のワークロードで効果的に再利用可能か?

主な発見

  • BDGS キットは、データボリュームの増加に伴い、すべての生成ツールタイプで線形の総時間性能を達成しており、スケーラビリティを示している。
  • テキスト生成ツールは、辞書サイズに応じて、アマゾン映画レビューで平均 71.3 MB/s、ウィキペディアデータで 63.23 MB/s の生成レートを達成している。
  • グラフ生成ツールは、十分なメモリが確保されていれば、最低でも 591,684 エッジ/秒のレートを維持しているが、高いメモリ要件のため最も遅い。
  • テーブル生成ツールは 23.85 MB/s のレートを達成しており、ボリュームが大きくなると平均設定時間の単位あたりの効率が向上し、効率が向上している。
  • 実験ではメモリ使用率が 90% を超えており、特にテキストおよびグラフ生成ツールにおいて、メモリが主なパフォーマンスボトル neck であると示されている。
  • 異なるデータタイプおよびボリュームにおいて、データ生成レートが概ね一定であるため、システムの安定性およびスケーラビリティが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。