[논문 리뷰] Role of Apache Software Foundation in Big Data Projects
이 논문은 아파치 소프트웨어 재단(ASF)이 빅데이터 기술의 발전에 기여하는 데서 그 역할을 분석하기 위해 빅데이터 분야에 속하는 350개 이상의 오픈소스 프로젝트를 분석한다. 주로 빅데이터 분야에 속하는 프로젝트들을 중심으로, 프레임워크, 도구, 프로그래밍 모델, 데이터 관리, 라이브러리, 데이터베이스, 데이터 처리의 일곱 가지 하위 분류를 식별하며, 많은 프로젝트들이 독립적으로 운영되지만 동시에 상호 간에 상호운용성이나 상호 기반 구조를 형성함으로써 빅데이터 분야의 혁신을 이끄는 탄력적이고 협업 기반의 생태계를 형성하고 있음을 밝혀낸다.
With the increase in amount of Big Data being generated each year, tools and technologies developed and used for the purpose of storing, processing and analyzing Big Data has also improved. Open-Source software has been an important factor in the success and innovation in the field of Big Data while Apache Software Foundation (ASF) has played a crucial role in this success and innovation by providing a number of state-of-the-art projects, free and open to the public. ASF has classified its project in different categories. In this report, projects listed under Big Data category are deeply analyzed and discussed with reference to one-of-the seven sub-categories defined. Our investigation has shown that many of the Apache Big Data projects are autonomous but some are built based on other Apache projects and some work in conjunction with other projects to improve and ease development in Big Data space.
연구 동기 및 목표
- 아파치 소프트웨어 재단(ASF)이 빅데이터 프로젝트의 개발 및 거버넌스에 기여하는 구조적·기능적 역할을 조사하는 것.
- 프레임워크, 데이터 처리, 데이터베이스 등의 기술적 하위 분류 기반으로 아파치 빅데이터 프로젝트를 분류하고 분석하는 것.
- 아파치 빅데이터 프로젝트 간의 상호의존성과 협업 관계를 이해하는 것.
- ASF의 오픈소스 모델이 빅데이터 분야에서 혁신, 확장성, 커뮤니티 주도 개발을 어떻게 촉진하는지 평가하는 것.
제안 방법
- 2008년 이후 운영된 프로젝트를 중심으로 아파치 공식 프로젝트 목록에서 '빅데이터' 카테고리에 속하는 프로젝트에 대한 체계적 분석.
- 프레임워크, 도구, 프로그래밍 모델, 빅데이터 관리, 라이브러리, 데이터베이스/데이터 포맷, 데이터 처리의 일곱 가지 하위 분류로 프로젝트 분류.
- 프로젝트 간 상호의존성 분석을 통해 다른 아파치 프로젝트의 서비스를 의존하거나 확장하는 프로젝트를 조사.
- 아파치의 인큐베이터 및 위원회 개발 역사(1995–2019)의 시계열 데이터를 활용한 프로젝트 진화 분석.
- 아파치 공식 웹사이트 및 프로젝트 메타데이터에서 확보한 데이터를 바탕으로 언어 분포 및 프로젝트 카테고리 분석.
- 기여자 수, 코드베이스 크기, 사용자 참여 지표 등의 커뮤니티 및 기여 동적 분석 평가.
실험 결과
연구 질문
- RQ1아파치 빅데이터 프로젝트는 어떻게 분류되며, 생태계 내에서 지배적인 기술적 하위 분류는 무엇인가?
- RQ2아파치 빅데이터 프로젝트들이 통합 또는 서비스 재사용을 통해 얼마나 많은 정도로 상호의존적으로 운영되는가?
- RQ3아파치 소프트웨어 재단의 거버넌스 모델이 빅데이터 프로젝트 간 협업 및 혁신을 어떻게 가능하게 하는가?
- RQ4아파치 빅데이터 프로젝트 생태계는 시간이 지남에 따라 프로젝트 수, 언어 사용, 커뮤니티 참여 측면에서 어떻게 진화해 왔는가?
주요 결과
- 아파치 소프트웨어 재단은 350개 이상의 오픈소스 프로젝트를 운영하며, 2억 2천만 행 이상의 코드와 거의 7,000명의 커밋터를 보유하고 있어 매우 활발하고 확장 가능한 개발 생태계를 형성하고 있다.
- 아파치 프로젝트에서 지배적인 프로그래밍 언어는 자바로, 빅데이터 프로젝트의 58%에서 사용되며, 아파치 스파크와 같은 많은 프로젝트들이 스칼라 및 파이썬을 포함한 다중 언어 지원을 제공하고 있다.
- 아파치 빅데이터 프로젝트의 대부분은 프레임워크, 도구, 데이터 처리 하위 분류에 속해 있어 데이터 파이프라인 및 계산 인프라에 대한 강한 집중을 보이고 있다.
- 많은 프로젝트들이 상호의존적이다: 일부는 다른 아파치 프로젝트의 서비스를 기반으로 하거나 이를 확장함으로써 생태계 전반에서 모듈성과 재사용성을 향상시키고 있다.
- 아파치 인큐베이터 프로그램은 1995년 이래 350개 이상의 프로젝트의 진화를 가능케 했으며, 2019년 말에 최신 위원회인 아파치 드루이드가 런칭되어 지속적인 성장을 반영하고 있다.
- 아파치 프로젝트는 널리 보급되어 있으며, 아파치 미러에서 900만 건 이상의 다운로드와 ASF 웹사이트에서 주간 3,000만 건 이상의 페이지 조회 수를 기록하여 글로벌 사용과 신뢰를 입증하고 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.