Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal subsampling for quantile regression in big data

HaiYing Wang, Yanyuan Ma|arXiv (Cornell University)|2020. 01. 28.
Statistical Methods and Inference참고 문헌 20인용 수 5
한 줄 요약

이 논문은 대용량 데이터에서 분위수 회귀를 위한 최적의 서브샘플링 방법을 제안하며, 응답 밀도에 대한 지식이 없고 쉽게 구현 가능한 두 가지 유형의 최적 확률을 통해 渐近 분산을 최소화한다. 반복적 서브샘플링 절차는 계산적 확장성을 보장하고 밀도 추정이 없이 표준 오차 추정이 가능하게 하여 거대한 데이터셋에서 渐近 최적성과 강건한 추론을 달성한다.

ABSTRACT

We investigate optimal subsampling for quantile regression. We derive the asymptotic distribution of a general subsampling estimator and then derive two versions of optimal subsampling probabilities. One version minimizes the trace of the asymptotic variance-covariance matrix for a linearly transformed parameter estimator and the other minimizes that of the original parameter estimator. The former does not depend on the densities of the responses given covariates and is easy to implement. Algorithms based on optimal subsampling probabilities are proposed and asymptotic distributions and asymptotic optimality of the resulting estimators are established. Furthermore, we propose an iterative subsampling procedure based on the optimal subsampling probabilities in the linearly transformed parameter estimation which has great scalability to utilize available computational resources. In addition, this procedure yields standard errors for parameter estimators without estimating the densities of the responses given the covariates. We provide numerical examples based on both simulated and real data to illustrate the proposed method.

연구 동기 및 목표

  • 기존 최적화 방법이 너무 느려 대규모 데이터셋에서 분위수 회귀의 계산 부담을 완화하기 위해.
  • 예측 변수 조건 하에서 응답의 조건부 밀도가 알려지지 않았기 때문에 분위수 회귀에서의 渐近 분산-공분산 행렬 추정 문제를 해결하기 위해.
  • 분위수 회귀 추정량의 渐近 평균제곱오차를 최소화하는 최적의 서브샘플링 확률을 개발하기 위해.
  • 확장성과 계산 효율성을 향상시키고 밀도 추정 없이 표준 오차 추정이 가능한 반복적 서브샘플링 알고리즘을 제안하기 위해.
  • 제안된 서브샘플링 프레임워크 하에서 추정량의 이론적 渐近 분포와 최적성을 확립하기 위해.

제안 방법

  • 두 가지 무작위성 원천(데이터 및 서브샘플링)을 고려한 일반 서브샘플링 추정량의 渐近 분포를 유도한다.
  • 두 가지 유형의 최적 서브샘플링 확률을 제안한다: 원래 매개변수 추정량의 渐近 분산-공분산 행렬의 트레이스를 최소화하는 것과 선형 변환된 매개변수 추정량을 위한 것.
  • 후자의 경우 예측 변수 조건 하에서 응답의 조건부 밀도를 알 필요가 없어 구현이 용이하다.
  • 변환된 매개변수를 위한 최적 확률 기반 반복적 서브샘플링 절차를 설계하여 확장성과 계산 효율성을 향상시킨다.
  • 반복 절차를 이용해 응답의 밀도 추정 없이 표준 오차를 추정함으로써 추론을 단순화한다.
  • 제안된 서브샘플링 계획 하에서 추정량의 渐近 정규성과 渐近 최적성을 확립한다.

실험 결과

연구 질문

  • RQ1대용량 데이터에서 분위수 회귀의 渐近 평균제곱오차를 최소화하기 위해 최적의 서브샘플링 확률를 어떻게 유도할 수 있는가?
  • RQ2통계적 효율성과 추론 능력을 유지하면서도 확장성과 계산 효율성을 확보할 수 있는가?
  • RQ3예측 변수 조건 하에서 응답의 밀도 추정 없이 분위수 회귀의 표준 오차를 어떻게 추정할 수 있는가?
  • RQ4최적의 서브샘플링 확률 하에서 서브샘플링 추정량의 渐近 분포는 무엇인가?
  • RQ5반복적 서브샘플링 절차는 분할-통합 방법과 비교해 계산 시간과 추정 정확도 측면에서 어떻게 다른가?

주요 결과

  • 제안된 방법은 최적 서브샘플링 확률 하에서 渐近 분산-공분산 행렬의 트레이스를 최소화함으로써 渐近 최적성을 달성한다.
  • 선형 변환된 매개변수 추정량의 분산을 최소화하는 최적 확률 버전은 예측 변수 조건 하에서 응답의 알려지지 않은 밀도에 의존하지 않아 간편한 구현이 가능하다.
  • 수치적 연구 결과, 95% 신뢰구간의 커버리지 확률은 작은 서브샘플 크기(n₀ = 1000)와 큰 전체 데이터(N = 10⁶) 조건에서도 명목 수준(예: 약 95%)에 가까운 것으로 나타나 신뢰할 수 있는 추론이 가능하다.
  • B = 100 또는 500일 때, τ = 0.5 및 τ = 0.75에서 좋은 커버리지가 유지되나, n₀ = 100 및 B ≥ 100 조건에서는 커버리지가 다소 감소함(예: β₁의 τ = 0.75에서 약 83%)을 보이며, 서브샘플 크기가 작을 경우 주의가 필요하다.
  • 반복적 서브샘플링 절차는 최적 확률 계산의 오버헤드가 있음에도 불구하고 전체 데이터 블록을 사용하는 대신 작은 서브샘플에 의존함으로써 분할-통합 방법보다 훨씬 빠른 속도를 보인다.
  • 실증적 MSE는 계산 시간 증가에 따라 감소하며, 제안된 방법은 분할-통합 방법과 다른 MSE 대 시간 트레이드오프 공간에 위치해 있어 계산 자원과 정밀도 우선순위에 따라 다른 성능 프로파일을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.