Skip to main content
QUICK REVIEW

[논문 리뷰] Cloudy with high chance of DBMS: A 10-year prediction for Enterprise-Grade ML

Ashvin Agrawal, Rony Chatterjee|arXiv (Cornell University)|2019. 08. 30.
Data Quality and Management참고 문헌 29인용 수 12
한 줄 요약

이 논문은 엔터프라이즈급 머신러닝(EGML)을 위한 통합된 데이터베이스 중심 아키텍처를 제안하며, 클라우드 기반 모델 훈련, SQL 확장된 대체 대수를 통한 DBMS 내 추론, 그리고 SQL 및 파이썬 시스템 간의 종단 간 프로벤ance 추적을 통합한다. SQL 및 파이썬 모듈을 갖춘 카탈로그 기반 프로벤ance 프레임워크를 도입하여 데이터 라인리지, 모델 의존성, 및 버전 관리를 기록하며, 카글 데이터셋에서는 95%의 모델 커버리지, 마이크로소프트 내부 데이터셋에서는 100%의 커버리지 달성.

ABSTRACT

Machine learning (ML) has proven itself in high-value web applications such as search ranking and is emerging as a powerful tool in a much broader range of enterprise scenarios including voice recognition and conversational understanding for customer support, autotuning for videoconferencing, intelligent feedback loops in large-scale sysops, manufacturing and autonomous vehicle management, complex financial predictions, just to name a few. Meanwhile, as the value of data is increasingly recognized and monetized, concerns about securing valuable data and risks to individual privacy have been growing. Consequently, rigorous data management has emerged as a key requirement in enterprise settings. How will these trends (ML growing popularity, and stricter data governance) intersect? What are the unmet requirements for applying ML in enterprise settings? What are the technical challenges for the DB community to solve? In this paper, we present our vision of how ML and database systems are likely to come together, and early steps we take towards making this vision a reality.

연구 동기 및 목표

  • 엔터프라이즈 ML 응용 프로그램에서 철저한 데이터 거버넌스, 모델 공정성, 및 프라이버시 요구 증가에 대응하기 위해.
  • 규제 및 데이터 민감도가 높은 환경에서 ML을 확장할 때 발생하는 해결되지 않은 기술적 과제를 규명하기 위해.
  • 단일이고 안전한 인fra구조 내에서 훈련, 추론, 거버넌스를 포함한 전체 ML 라이프사이클 관리를 데이터베이스 네이티브 방식으로 통합하기 위해.
  • 감사 가능성과 규정 준수를 지원하기 위해 이질적인 시스템(SQL 및 파이썬) 간 종단 간 데이터 및 모델 프로벤ance 추적을 가능하게 하기 위해.
  • 데이터 유출을 방지하고 성능 및 보안을 향상시키기 위해 DBMS 쿼리 엔진 내부에 ML 스코어링을 직접 통합하기 위해.

제안 방법

  • 클라우드 기반 모델 훈련, 확장된 관계 대수를 통한 DBMS 네이티브 추론, 카탈로그를 통한 중앙 집중식 거버넌스를 포함한 3단계 아키텍처 설계.
  • Apache Calcite를 사용해 쿼리 파싱 및 조기 및 지연 캡처 모드에서의 거친 라인리지(입력 테이블/컬럼) 추출을 위한 SQL 프로벤ance 모듈 구현.
  • 시간적 추적 및 다중 시스템 상관관계를 지원하기 위해 중심 카탈로그(Apache Atlas)에 버전 관리된 프로벤ance 데이터 저장.
  • 정적 분석 및 커리레이티드 지식 기반의 ML API를 활용해 모델 훈련 코드, 특징, 하이퍼파라미터, 데이터 소스를 식별하는 파이썬 프로벤ance 모듈 개발.
  • 카탈로그를 통해 SQL 입력 테이블과 파이썬 훈련 데이터 세트를 연결함으로써, 원시 데이터에서 모델 출력까지의 종단 간 라인리지 보장.
  • 대규모 캡처에서의 저장소 최적화 및 지연 감소를 위해 프로벤ance 저장소를 위한 데이터 압축 및 요약 기법 적용.

실험 결과

연구 질문

  • RQ1데이터 이동 없이 DBMS 내에서 효율적이고 안전하게 ML 추론를 수행할 수 있는 방법은 무엇인가?
  • RQ2기업 환경에서 SQL 및 파이썬 시스템 간 종단 간 데이터 및 모델 프로벤ance를 구현할 때의 핵심 기술적 과제는 무엇인가?
  • RQ3규제 환경에서 전체 ML 라이프사이클—훈련, 스코어링, 거버넌스—를 네이티브로 지원하기 위해 데이터베이스 시스템은 어떻게 진화해야 하는가?
  • RQ4다양하고 대규모 워크로드에서 세밀한 프로벤ance를 캡처할 때의 성능 및 확장성 특성은 무엇인가?
  • RQ5특히 고속도의 데이터 및 모델 업데이트 상황에서, 프로벤ance 캡처를 실용적으로 정확하고 효율적으로 구현할 수 있는 방법은 무엇인가?

주요 결과

  • SQL 프로벤ance 모듈은 TPC-H 2,208개 및 TPC-C 2,200개의 쿼리에서 평균 지연 110초 및 124초로 라인리지 캡처를 수행했으며, 최대 34,785개의 노드 및 간선을 포함하는 프로벤ance 그래프 생성.
  • 프로벤ance 데이터 모델은 크기가 크게 증가할 수 있음—예를 들어 삽입 횟수만큼의 버전이 있는 테이블의 경우—압축 및 요약이 필요함을 시사.
  • 파이썬 프로벤ance 모듈은 카글 데이터셋에서 모델의 95% 및 훈련 데이터 세트의 61% 커버리지 달성했으며, 생산용 마이크로소프트 내부 데이터셋에서는 100% 커버리지 달성.
  • 중앙 카탈로그를 통한 SQL 및 파이썬 프로벤ance 통합은 감사 및 모델 재훈련 트리거에 필수적인 다중 시스템 라인리지 추적 가능.
  • 초기 결과에 따르면, 프로벤ance 캡처가 현실적인 워크로드에서 확장성과 정확성을 모두 확보함으로써 DBMS에 ML 거버넌스를 통합하는 것이 가능함을 입증.
  • 원천에서 추론까지의 추적 가능한 데이터 라인리지를 통해 GDPR 준수, 모델 편향 감사, 설명 가능성 등 핵심 거버넌스 요구사항 지원 가능.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.