Skip to main content
QUICK REVIEW

[논문 리뷰] CANFAR+Skytree: A Cloud Computing and Data Mining System for Astronomy

Nicholas M. Ball|arXiv (Cornell University)|2013. 12. 14.
Astronomical Observations and Instrumentation인용 수 3
한 줄 요약

이 논문은 천문학을 위한 세계 최초의 클라우드 기반 데이터 마이닝 시스템인 CANFAR+Skytree를 제안한다. 이는 CANFAR의 확장 가능한 클라우드 인프라와 Skytree의 고성능 머신러닝 알고리즘을 통합한 것으로, 천문학적 데이터셋에서 대규모로 선형적으로 확장 가능한 데이터 마이닝을 가능하게 한다. CFHTLS 설문에서 유입된 130억 개의 객체로 구성된 카탈로그에 대해 광학적 적색편이 확률 밀도 함수를 계산함으로써, 페타스케일 데이터에서 완전한 분석 능력을 입증하였다.

ABSTRACT

At the Canadian Astronomy Data Centre, we have combined our cloud computing system, CANFAR, with the world's most advanced machine learning software, Skytree, to create the world's first cloud computing system for data mining in astronomy. CANFAR provides a generic environment for the storage and processing of large datasets, removing the requirement to set up and maintain a computing system when implementing an extensive undertaking such as a survey pipeline. 500 processor cores and several hundred terabytes of persistent storage are currently available to users. The storage is implemented via the International Virtual Observatory Alliance's VOSpace protocol, and is accessible both interactively, and to all processing jobs. The user interacts with CANFAR by utilizing virtual machines, which appear to them as equivalent to a desktop. Each machine is replicated as desired to perform large-scale parallel processing. Such an arrangement enables the user to immediately install and run the same astronomy code that they already utilize, in the same way as on a desktop. In addition, unlike many cloud systems, batch job scheduling is handled for the user on multiple virtual machines by the Condor job queueing system. Skytree is installed and run just as any other software on the system, and thus acts as a library of command line data mining functions that can be integrated into one's wider analysis. Thus we have created a generic environment for large-scale analysis by data mining, in the same way that CANFAR itself has done for storage and processing. Because Skytree scales to large data in linear runtime, this allows the full sophistication of the huge fields of data mining and machine learning to be applied to the hundreds of millions of objects that make up current large datasets. We demonstrate the utility of the CANFAR+Skytree system by showing science results obtained. [Abridged]

연구 동기 및 목표

  • 천문학에서 소규모 데이터셋의 정교한 분석과 대규모 데이터셋의 단순한 분석 사이의 격차를 해소한다.
  • 머신러닝이나 인프라 관리 전문 지식이 없어도 천문학자들이 대규모 데이터셋에서 고급 데이터 마이닝을 수행할 수 있도록 한다.
  • CANFAR의 스토리지 및 처리 능력과 Skytree의 고성능 머신러닝 알고리즘을 결합한 확장 가능한 클라우드 기반 플랫폼을 제공한다.
  • 실제 천문학적 데이터를 대상으로 시스템의 능력을 입증하며, 특히 광학적 적색편이 추정을 위한 전면적 확률 밀도 함수를 중심으로 한다.
  • 향후 설문 데이터(예: LSST)를 위한 대규모 데이터 마이닝을 수행할 수 있도록 개방적이고 접근 가능한 시스템을 구축한다.

제안 방법

  • 500개의 프로세서 코어와 수백 테라바이트의 VOSpace 호환 영구 스토리지가 제공되는 CANFAR의 클라우드 인프라를 활용하여, 마운트된 파일시스템으로 접근 가능한 스토리지와 컴퓨팅 자원을 확보한다.
  • 가상 머신을 사용해 데스크톱 환경을 모방하여, 사용자가 기존의 천문학 소프트웨어를 변경 없이 확장 가능하고 병렬화된 클라우드 환경에서 실행할 수 있도록 한다.
  • Skytree를 명령줄 기반의 머신러닝 함수 라이브러리로 통합하여, 데이터 처리 파이프라인에 원활하게 통합할 수 있도록 한다.
  • Condor 작업 큐잉 시스템을 활용해 다수의 가상 머신을 통해 배치 작업을 자동으로 스케줄링하고, 저수준 병렬 처리를 추상화한다.
  • 모든 kn (k-가장 가까운 이웃) 및 커널 밀도 추정(KDE)과 같은 Skytree의 최적화된 알고리즘을 적용하여, 데이터셋 크기에 따라 선형적으로 확장되도록 하여 제곱 복잡도를 피한다.
  • CANFAR의 확장 가능한 컴퓨팅 노드에 걸쳐 계산을 분산하여 대규모 천문학 카탈로그를 처리함으로써 고성능과 재현 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1클라우드 기반 시스템이 천문학적 데이터셋에 대해 확장 가능한 스토리지와 고성능 데이터 마이닝을 효과적으로 통합할 수 있는가?
  • RQ2Skytree의 선형 확장 가능한 머신러닝 알고리즘이 천문학 클라우드 환경에서 실용적으로 구현되어 페타스케일 데이터를 분석할 수 있는가?
  • RQ3이 시스템을 통해 대규모 카탈로그에서 광학적 적색편이의 전면적 확률 밀도 함수를 효율적으로 계산할 수 있는가?
  • RQ4CANFAR와 Skytree의 통합이 비전문가가 대규모 천문학적 데이터셋에서 고급 데이터 마이닝을 수행할 수 있도록 하는가?
  • RQ5이 시스템은 향후 세대 설문(예: LSST)에서 예상되는 규모의 데이터셋을 처리할 수 있는가?

주요 결과

  • CANFAR+Skytree 시스템은 CFHTLS 설문에서 유입된 130억 개 객체에 대해 광학적 적색편이 확률 밀도 함수(PDF)를 성공적으로 계산하여, 페타스케일 데이터에서 완전한 분석 능력을 입증하였다.
  • Skytree의 allkn 알고리즘이 데이터셋 크기에 따라 선형적으로 런타임이 확장되는 것을 확인하여, 대규모 천문학적 데이터셋에서 제곱 복잡도의 성능 저하 없이 확장 가능함을 입증하였다.
  • 성능 벤치마크 결과, 런타임 오차 구간이 데이터 포인트보다 작았으며, 특히 고메모리 노드(256GB)에서 높은 재현성과 안정성을 보였다.
  • 시스템은 Condor를 통한 자동 병렬 처리를 통해 천문학자들이 클라우드 환경에서 데스크톱과 구분되지 않는 환경에서 기존 코드를 그대로 실행할 수 있도록 했다.
  • Skytree를 CANFAR 인프라에 통합함으로써, 저수준 알고리즘 전문 지식 없이도 비전문가가 천문학적 데이터에 고급 머신러닝 기법을 적용할 수 있도록 했다.
  • 이 시스템은 생산용으로 사용 가능하며, 천문학 공동체 전반에서 접근 가능하며, LSST에서 예상되는 데이터 크기와 유사한 규모의 데이터에서의 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.