Skip to main content
QUICK REVIEW

[論文レビュー] Role of Apache Software Foundation in Big Data Projects

Aleem Akhtar|arXiv (Cornell University)|May 5, 2020
Cloud Computing and Resource Management参考文献 16被引用数 4
ひとこと要約

この論文は、Big Data分野におけるApache Software Foundation (ASF) の役割を、特にBig Dataに分類される350以上のオープンソースプロジェクトを分析することで検討している。7つのサブカテゴリ—フレームワーク、ツール、プログラミングモデル、データ管理、ライブラリ、データベース、データ処理—を特定し、多くのプロジェクトが独立して運用されている一方で、多くの場合、互いに連携したり、互いの基盤を活用したりすることで、イノベーションを促進するレジilientかつ協働的なエコシステムを形成していることが明らかになった。

ABSTRACT

With the increase in amount of Big Data being generated each year, tools and technologies developed and used for the purpose of storing, processing and analyzing Big Data has also improved. Open-Source software has been an important factor in the success and innovation in the field of Big Data while Apache Software Foundation (ASF) has played a crucial role in this success and innovation by providing a number of state-of-the-art projects, free and open to the public. ASF has classified its project in different categories. In this report, projects listed under Big Data category are deeply analyzed and discussed with reference to one-of-the seven sub-categories defined. Our investigation has shown that many of the Apache Big Data projects are autonomous but some are built based on other Apache projects and some work in conjunction with other projects to improve and ease development in Big Data space.

研究の動機と目的

  • Apache Software Foundation (ASF) がBig Dataプロジェクトの開発およびガバナンスにおいて果たす構造的・機能的役割を調査すること。
  • フレームワーク、データ処理、データベースなどの技術的サブカテゴリに基づいて、Apache Big Dataプロジェクトを分類・分析すること。
  • Apache Big Dataプロジェクト間の相互依存関係および協働的関係を理解すること。
  • ASFのオープンソースモデルが、Big Data分野におけるイノベーション、スケーラビリティ、コミュニティ主導の開発をどのように促進しているかを評価すること。

提案手法

  • 2008年以降にホスティングされたプロジェクトに焦点を当て、'Big Data'カテゴリに属するApacheの公式プロジェクトリストに対する体系的分析。
  • フレームワーク、ツール、プログラミングモデル、Big Data管理、ライブラリ、データベース/データフォーマット、データ処理の7つのサブカテゴリにプロジェクトを分類。
  • 他のApacheプロジェクトのサービスに依存するか、それらを拡張するプロジェクトの相互依存関係の調査。
  • 1995年から2019年までのApacheのインキュベータおよび委員会開発の歴史データ(タイムライン)を用いたプロジェクトの進化の検討。
  • Apacheの公式ウェブサイトおよびプロジェクトメタデータからのデータを用いて、言語の分布とプロジェクトのカテゴリの分析。
  • コミュニティおよび貢献のダイナミクスの評価、具体的には貢献者数、コードベースのサイズ、ユーザーエンゲージメント指標。

実験結果

リサーチクエスチョン

  • RQ1Apache Big Dataプロジェクトはどのように分類されており、エコシステム内で支配的である技術的サブカテゴリは何か?
  • RQ2Apache Big Dataプロジェクトは、統合やサービス再利用を通じてどれほど相互依存的に運用されているのか?
  • RQ3Apache Software Foundationのガバナンスモデルは、Big Dataプロジェクト間の協働とイノベーションをどのように促進しているか?
  • RQ4Apache Big Dataプロジェクトエコシステムは、プロジェクト数、言語使用、コミュニティ参加の観点から、時間の経過とともにどのように進化してきたか?

主な発見

  • Apache Software Foundationは350以上のオープンソースプロジェクトをホスティングしており、2億行以上のコードと約7,000人のコミッターを擁し、活発でスケーラブルな開発エコシステムを形成している。
  • JavaはApacheプロジェクトの主要言語であり、Big Dataプロジェクトの58%で使用されており、Apache SparkのようにScalaやPythonを含む複数言語のサポートを提供するプロジェクトも多い。
  • Apache Big Dataプロジェクトの大多数はフレームワーク、ツール、データ処理のサブカテゴリに属しており、データパイプラインおよび計算インfraストラクチャに強い注力がなされていることが示された。
  • 多くのプロジェクトが相互に依存しており、一部のプロジェクトは他のApacheプロジェクトのサービスを基盤として活用しており、エコシステム全体でのモジュラリティと再利用性が高まっている。
  • Apacheインキュベータプログラムは1995年以降に350以上のプロジェクトの進化を可能にした。2019年末に最新の委員会としてApache Druidが設立されたことは、持続的な成長を示している。
  • Apacheプロジェクトは広く採用されており、Apacheミラーからのダウンロード数が900万件を超え、ASFのウェブサイトで週間3000万回のページビューが記録されており、世界的な利用と信頼性の高さが裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。