Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Abstractions for Big Data: Why, Where, How, and What

Mary Hall, Robert M. Kirby|arXiv (Cornell University)|Jun 14, 2013
Distributed and Parallel Computing Systems参考文献 8被引用数 7
ひとこと要約

この論文は、現代のデータが抱える前代未聞の複雑性を扱うために、ビッグデータシステム、アルゴリズム、分析分野における従来の抽象化が不十分であると主張する。本稿では、システム設計、アルゴリズム的モデル、不確実性の管理、構造的発見の4つのコアな課題に対して、神話的「シクロプス」を比喩として用い、スケーラブルで信頼性が高く、人間が理解可能なビッグデータコンピューティングのための変革的で横断的な協働を提唱する。

ABSTRACT

Big data refers to large and complex data sets that, under existing approaches, exceed the capacity and capability of current compute platforms, systems software, analytical tools and human understanding. Numerous lessons on the scalability of big data can already be found in asymptotic analysis of algorithms and from the high-performance computing (HPC) and applications communities. However, scale is only one aspect of current big data trends; fundamentally, current and emerging problems in big data are a result of unprecedented complexity--in the structure of the data and how to analyze it, in dealing with unreliability and redundancy, in addressing the human factors of comprehending complex data sets, in formulating meaningful analyses, and in managing the dense, power-hungry data centers that house big data. The computer science solution to complexity is finding the right abstractions, those that hide as much triviality as possible while revealing the essence of the problem that is being addressed. The "big data challenge" has disrupted computer science by stressing to the very limits the familiar abstractions which define the relevant subfields in data analysis, data management and the underlying parallel systems. As a result, not enough of these challenges are revealed by isolating abstractions in a traditional software stack or standard algorithmic and analytical techniques, and attempts to address complexity either oversimplify or require low-level management of details. The authors believe that the abstractions for big data need to be rethought, and this reorganization needs to evolve and be sustained through continued cross-disciplinary collaboration.

研究の動機と目的

  • 伝統的な抽象化とビッグデータのスケールおよび複雑性の現実との間のギャップが拡大しているのを是正すること。
  • ビッグデータは量の問題にとどまらず、構造的複雑性、信頼性の欠如、人間の理解限界、エネルギー消費コストも含むことの特定。
  • 孤立した低水準の抽象化から、生産性とパフォーマンスの両立を図る統合的・スタック横断的抽象化へのシフトを提唱すること。
  • システム、アルゴリズム、データ分析のコミュニティが協働し、持続可能でスケーラブルな抽象化を創出すること。
  • コアな課題を4体の「シクロプス」の怪物としてフレーミングし、英雄的で多様な分野の統合的解決策の必要性を象徴すること。

提案手法

  • ビッグデータの課題を、システム、アルゴリズム、不確実性、構造の4つの主要分野に分類し、それぞれを神話的シクロプスとしてフレーミングする。
  • 特に異種かつエネルギー効率の良いハードウェア向けに、高水準の生産性と低水準のパフォーマンス制御の両立を図るシステム抽象化を提唱する。
  • 計算量だけでなく、通信、電力、レジリエンスといった新たなコストを考慮するアルゴリズム的モデルの開発。
  • データと結果の信頼性をさまざまな解像度で定量化・管理できる不確実性対応抽象化の導入。
  • 高次元で複雑なデータの対話的・マルチスケールな探索を支援する、概要+詳細型の可視化抽象化の設計。
  • 認知科学と知覚の原則に基づいた、分野特化的だが一般化可能な可視化および分析ツールの推進。

実験結果

リサーチクエスチョン

  • RQ1異種アーキテクチャ向けに、プログラマの生産性と低水準のパフォーマンス制御の両立を図るビッグデータシステムの抽象化は、どのように実現できるか?
  • RQ2分散システムにおける通信、エネルギー、レジリエンスといった新たなコストを効果的にモデル化・管理する計算抽象化は何か?
  • RQ3ビッグデータにおける不確実性は、どのように定量化・表現・可視化され、信頼性のある分析と意思決定を支援できるか?
  • RQ4高次元で複雑なデータから低次元のコアな構造を発見・検証する抽象化は、過剰適合を避けるためにどのように設計できるか?
  • RQ5人間の知覚的・認知的限界を尊重しながら、対話的かつマルチスケールな探索を可能にする可視化抽象化は、どのように設計できるか?

主な発見

  • データの可用性、スケーラブルなインfraの整備、経済的価値の統合が、ビッグデータ研究における画期的で横断的な機会を創出した。
  • システム、アルゴリズム、可視化分野における従来の抽象化は、特に不確実性や高次元構造の取り扱いにおいて、ビッグデータの複雑性に対応できない。
  • MapReduceモデルは生産性に優れるが、複雑な計算にはあまりに制限的であり、より表現力の高いアルゴリズム的抽象化の必要性が浮き彫りになった。
  • 概要+詳細パターンを用いた対話的可視化は、人間の知覚帯域幅を活用することで、大規模かつ多次元のデータの効果的探索を可能にする。
  • システム抽象化、アルゴリズム的モデル、不確実性、構造的発見の4つのシクロプス課題は相互に依存しており、共同で横断的解決が不可欠である。
  • 効果的な抽象化は、一般性と分野特化性の両立が求められ、利用者の分析的差異や認知的違いに対しても適切に対応できるべきである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。