Skip to main content
QUICK REVIEW

[논문 리뷰] Infrastructure for Usable Machine Learning: The Stanford DAWN Project

Peter Bailis, Kunle Olukotun|arXiv (Cornell University)|2017. 05. 22.
Data Stream Mining Techniques참고 문헌 23인용 수 16
한 줄 요약

스탠퍼드 DAWN 프로젝트는 데이터 준비, 특징 공학, 배포 및 모니터링에 이르기까지 엔드 투 엔드 머신러닝 개발을 자동화함으로써 머신러닝의 민주화를 위한 종합적인 시스템 인프라를 제안한다. 이는 비전문가가 효율적으로 프로덕션 수준의 머신러닝 애플리케이션을 구축할 수 있도록 한다. 새로운 시스템, 하드웨어 인지 최적화, 분산 런타임을 통합함으로써 DAWN은 머신러닝 시스템을 구축하고 유지하는 데 소요되는 시간, 비용, 전문 지식을 크게 줄이고자 한다.

ABSTRACT

Despite incredible recent advances in machine learning, building machine learning applications remains prohibitively time-consuming and expensive for all but the best-trained, best-funded engineering organizations. This expense comes not from a need for new and improved statistical models but instead from a lack of systems and tools for supporting end-to-end machine learning application development, from data preparation and labeling to productionization and monitoring. In this document, we outline opportunities for infrastructure supporting usable, end-to-end machine learning applications in the context of the nascent DAWN (Data Analytics for What's Next) project at Stanford.

연구 동기 및 목표

  • 현재 대규모 전문 엔지니어 및 데이터 과학자 팀이 필요로 하는 높은 비용과 복잡도를 가지는 머신러닝 애플리케이션 개발 문제를 해결하기 위해.
  • 알고리즘 혁신이 아닌 노동 집약적인 데이터 준비, 특징 공학, 프로덕션화로 인해 발생하는 머신러닝 개발의 병목 현상을 극복하기 위해.
  • 머신러닝, 분산 시스템, 하드웨어에 깊은 전문 지식이 없는 도메인 전문가가 고품질의 프로덕션 준비가 된 머신러닝 시스템을 구축하고 배포할 수 있도록 머신러닝의 민주화를 위해.
  • 의료 및 비즈니스 분석과 같은 다양한 분야에서 머신러닝 애플리케이션을 개발, 배포, 모니터링하는 데 소요되는 시간, 비용, 엔지니어링 노력의 감소를 위해.
  • 데이터 파이프라인, 모델 훈련, 하드웨어 가속, 분산 실행을 통합하는 전체 스택 기반의 오픈소스 인프라를 구축하여 엔드 투 엔드 머신러닝 개발을 원활하게 하기 위해.

제안 방법

  • 데이터 수신, 특징 추출, 모델 훈련, 프로덕션 배포를 하나의 사용자 친화적인 프레임워크로 통합한 전체 스택 시스템인 DAWN 스택을 설계한다.
  • 데이터 레이블링과 특징 공학을 단순화하기 위해 고수준 추상화와 도메인 특화 언어(DSL)를 활용하여 수동으로 전문가가 데이터를 정제하는 데 의존도를 낮춘다.
  • 저정밀도 가속기와 재구성 가능한 FPGA를 포함한 신규 하드웨어 기반 아키텍처를 고려하여 머신러닝 워크로드를 최적화하여 성능과 에너지 효율성을 향상시킨다.
  • 이질적인 클러스터에서 자동으로 로드 밸런싱, 장애 내성, 자원 할당을 관리하는 분산 런타임을 개발하여 스케일아웃 훈련 및 추론을 효율적으로 가능하게 한다.
  • TensorFlow와 Spark와 같은 기존 머신러닝 프레임워크와 통합하여 광범위한 호환성과 보급을 확보하면서도 자동 튜닝 및 모니터링 기능을 추가로 제공한다.
  • 알고리즘-하드웨어 공동 설계에 대한 이론적 통찰을 적용하여 타깃 플랫폼에서 최적 성능을 낼 수 있도록 학습 알고리즘의 자동 하드웨어 인지 튜닝을 가능하게 한다.

실험 결과

연구 질문

  • RQ1전문 시스템이나 머신러닝 전문 지식이 없는 사용자에게 머신러닝 애플리케이션을 지정하고 배포하는 데 소요되는 시간과 비용을 줄일 수 있는 방법은 무엇인가?
  • RQ2데이터 준비, 특징 공학, 모델 프로덕션화를 자동화하면서도 높은 성능과 신뢰성을 유지할 수 있는 시스템 추상화와 프로그래밍 모델은 무엇인가?
  • RQ3특히 저정밀도 및 재구성 가능한 컴퓨팅을 포함한 하드웨어 인지 시스템 설계는 머신러닝 워크로드의 효율성과 확장성에 어떻게 기여할 수 있는가?
  • RQ4분산 머신러닝 실행에서 내부 장치(GPU/FPGA 등) 및 외부 장치(클러스터 등) 간 병렬 처리를 효과적으로 관리할 수 있는 통합 프로그래밍 모델은 무엇인가?
  • RQ5특히 분산 및 서버리스 환경에서 다양한 하드웨어 및 네트워크 조건에서 학습 알고리즘을 자동으로 튜닝하여 최적 성능을 낼 수 있는 방법은 무엇인가?

주요 결과

  • DAWN 프로젝트는 산업계에서 머신러닝 개발의 대부분의 엔지니어링 노력이 새로운 모델 개발이 아니라 데이터 준비, 특징 공학, 프로덕션화에 쓰이고 있음을 입증한다.
  • Snorkel, MacroBase, DeepDive와 같은 기존 시스템들이 이미 실무에서 강력한 실현 가능성을 보이며 DAWN 접근법의 타당성을 입증하고 있다.
  • 저정밀도 실행 및 FPGA 기반 가속을 포함한 하드웨어 인지 최적화는 모델 정확도를 훼손하지 않으면서 성능 향상과 전력 소비 감소에 크게 기여할 수 있다.
  • 이상적 비동기 처리, 로드 분배, 장애 내성을 자동으로 관리하는 분산 런타임은 클러스터 전역에서 머신러닝 모델의 확장성 있고 견고한 배포를 가능하게 한다.
  • 고수준 추상화와 저수준 시스템, 하드웨어 최적화의 통합은 사용성 향상에 상당한 기여를 하여 비전문가 사용자의 진입 장벽을 낮춘다.
  • 초기 결과는 머신러닝 스택 전반에 걸친 엔드 투 엔드 자동화가 프로덕션 머신러닝 시스템을 구축하고 유지하는 데 소요되는 시간과 비용을 극적으로 줄일 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.