Skip to main content
QUICK REVIEW

[논문 리뷰] Method of Divide-and-Combine in Regularised Generalised Linear Models for Big Data

Lu Tang, Ling Zhou|arXiv (Cornell University)|2016. 11. 18.
Advanced Statistical Methods and Models참고 문헌 25인용 수 17
한 줄 요약

이 논문은 대용량 데이터에서 정규화된 일반화선형모형을 위한 새로운 분할-통합 방법을 제안하며, 편향 보정 추정량 기반 신뢰분포를 사용하여 라소 유형의 회귀 추정치를 통합한다. 이 방법은 전체 데이터 최대우도 추정치와 동일한 추정 정확도인 파이셔의 효율성(Fisher's efficiency)을 달성하면서도 확장 가능하고 안정적인 변수 선택을 가능하게 한다.

ABSTRACT

When a data set is too big to be analysed entirely once by a single computer, the strategy of divide-and-combine has been the method of choice to overcome the computational hurdle due to its scalability. Although random data partition has been widely adopted, there is lack of clear theoretical justification and practical guidelines to combine results obtained from separate analysis of individual sub-datasets, especially when a regularisation method such as lasso is utilised for variable selection to improve numerical stability. In this paper we develop a new strategy to combine separate lasso-type estimates of regression parameters by the means of the confidence distributions based on bias-corrected estimators. We first establish the approach to the construction of the confidence distribution and then show that the resulting combined estimator enjoys the Fisher's efficiency in the sense of the estimation efficiency achieved by the maximum likelihood estimator from the analysis of full data. Furthermore, using the combined regularised estimator we propose an inference procedure. Extensive simulation studies are presented to evaluate the performance of the proposed methodology with comparisons to the classical meta estimation method and a voting-based variable selection method.

연구 동기 및 목표

  • 대용량 데이터에서 라소와 같은 정규화를 사용할 때 부분 데이터셋에서의 결과를 통합하는 데 있어 이론적 근거와 실용적 지침의 부족을 해결하기 위해.
  • 전체 데이터셋을 처리하지 않고도 분할된 데이터에서의 별개의 라소 추정치를 통합할 수 있는 확장 가능하고 효율적인 방법을 개발하기 위해.
  • 통합된 추정량이 전체 데이터 분석에서의 최대우도 추정량과 동등한 추정 효율성을 달성하도록 보장하기 위해.
  • 정규화된 추정량 기반의 타당한 추론 절차를 제안하여 통계적 가설 검정과 신뢰구간 추정을 수행하기 위해.

제안 방법

  • 데이터 분할에 의해 유도된 추정 편향을 보완하기 위해 개별 부분 데이터셋에서의 편향 보정 추정량을 사용하여 신뢰분포를 구축하기 위해.
  • 추정 효율성을 유지하는 가중 평균 방식을 통해 부분 데이터셋의 신뢰분포를 통합하기 위해.
  • 통합된 신뢰분포를 활용하여 전체 데이터 최대우도 추정량과 동등한 효율성을 가지는 최종 정규화된 추정량을 유도하기 위해.
  • 정규화된 모델 프레임워크 내에서 가설 검정과 신뢰구간 구성과 같은 추론을 수행하기 위해 통합된 추정량을 적용하기 위해.
  • 전체 데이터 계산을 피하면서도 수치적 안정성과 확장 가능성을 확보하면서 통계적 효율성을 유지하기 위해.

실험 결과

연구 질문

  • RQ1일반화선형모형에서 라소 유형 추정을 위한 분할-통합 전략이 전체 데이터셋을 처리하지 않고도 파이셔의 효율성을 달성할 수 있는가?
  • RQ2어떻게 부분 데이터셋에서의 통신분포를 구성하고 통합하여 신뢰할 수 있고 효율적인 추정량을 도출할 수 있는가?
  • RQ3제안된 방법은 기존의 고전적 메타-추정 및 투표 기반 변수 선택보다 추정 정확도와 변수 선택 일致성 측면에서 뛰어나게 성능을 발휘하는가?
  • RQ4데이터 분할과 정규화 하에 통합된 추정량의 효율성에 대한 이론적 근거는 무엇인가?

주요 결과

  • 제안된 통합 추정량은 파이셔의 효율성을 달성하여 전체 데이터에서 유도된 최대우도 추정량과 동일한 추정 정확도를 보인다.
  • 기존의 분할-통합 전략에서 부족했던 이론적 근거를 보완하여 부분 데이터셋에서의 라소 추정치를 통합하는 타당한 방법을 제공한다.
  • 시뮬레이션 연구 결과, 제안된 방법은 변수 선택 정확도와 추정 정밀도 측면에서 고전적 메타-추정 및 투표 기반 변수 선택보다 뛰어난 성능을 보였다.
  • 통합 추정량 기반의 추론 절차는 신뢰구간에 대해 타당한 커버리지 확률과 가설 검정에서 적절한 제1종 오류 비율을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.