Skip to main content
QUICK REVIEW

[논문 리뷰] Large-Scale Online Experimentation with Quantile Metrics

Min Liu, Xiaohui Sun|arXiv (Cornell University)|2019. 03. 20.
Advanced Bandit Algorithms Research참고 문헌 9인용 수 6
한 줄 요약

이 논문은 시간적 상관관계가 있는 종속 표본에서 p90 페이지 로드 시간과 같은 분위수 지표를 위한 A/B 테스트를 위한 통계적으로 타당하고 확장 가능한 방법론을 제시한다. 이는 동적 히스토그램 기반 분위수 추정과 시간적 상관관계를 보정하는 신규 변동성 추정기법을 조합한 것으로, 부트스트랩보다 500배 이상 빠른 성능을 보이며 부트스트랩 추정치와 98%의 일치도를 유지한다. 이는 리노크의 산업 시스템에서 대규모 실시간 분위수 A/B 테스트를 가능하게 한다.

ABSTRACT

Online experimentation (or A/B testing) has been widely adopted in industry as the gold standard for measuring product impacts. Despite the wide adoption, few literatures discuss A/B testing with quantile metrics. Quantile metrics, such as 90th percentile page load time, are crucial to A/B testing as many key performance metrics including site speed and service latency are defined as quantiles. However, with LinkedIn's data size, quantile metric A/B testing is extremely challenging because there is no statistically valid and scalable variance estimator for the quantile of dependent samples: the bootstrap estimator is statistically valid, but takes days to compute; the standard asymptotic variance estimate is scalable but results in order-of-magnitude underestimation. In this paper, we present a statistically valid and scalable methodology for A/B testing with quantiles that is fully generalizable to other A/B testing platforms. It achieves over 500 times speed up compared to bootstrap and has only $2\%$ chance to differ from bootstrap estimates. Beyond methodology, we also share the implementation of a data pipeline using this methodology and insights on pipeline optimization.

연구 동기 및 목표

  • 대규모 A/B 테스트에서 분위수 지표에 대한 확장 가능하고 통계적으로 타당한 분산 추정 기법의 부재를 해결하기 위해.
  • 사용자 경험을 측정하는 데 핵심적이지만 계산 및 통계적 과제로 인해 활용이 부족한 p50 및 p90과 같은 분위수를 위한 실시간 A/B 테스트를 가능하게 하기 위해.
  • 부트스트랩과 유사한 정확성과 부트스트랩보다 500배 이상 빠른 효율성을 동시에 확보한 산업 규모의 온라인 실험을 위한 방법론을 개발하기 위해.
  • 다양한 플랫폼과 실험 유형에서 저지연 분위수 A/B 테스트를 지원하는 데이터 파이프라인을 구현하고 최적화하기 위해.
  • 리노크 생태계를 초월한 다른 A/B 테스트 플랫폼에 일반화 가능한 솔루션을 제공하기 위해.

제안 방법

  • 데이터 파artition 내에서 페이지 로드 시간을 버킷으로 묶어 분포 정보를 효율적으로 요약하는 히스토그램 기반 분위수 추정 기법을 사용한다.
  • 파artition 간 히스토그램을 병합하여 원시 데이터를 모두 저장하지 않고도 p50 및 p90를 정확하게 추정할 수 있도록 한다.
  • 표본 분위수 주변의 동적 간격 너비를 사용하여 종속 표본의 시간적 상관관계를 고려하는 새로운 변동성 추정기법을 제안한다. 이는 밀도 추정을 향상시킨다.
  • 데이터 정규화, memberId와 타임스탬프 기반으로 메트릭스와 실험 추적 정보를 공통 파artitioning하고, 메모리 기반 비트맵 색인을 사용하여 조인을 가속화하고 I/O를 감소시킨다.
  • 각 파artition 별로 ∑Ji, ∑Pi, ∑Ji², ∑Pi², ∑JiPi, ∑Wi 와 같은 요약 통계량을 한 번의 스캔으로 계산하여 분위수 및 분산 추정을 동시에 지원한다.
  • Spark를 활용한 분산 처리를 통해 데이터 팽창을 방지하고, 3000억 건의 행을 2시간 이내로 처리할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1시간적 상관관계가 존재하는 상황에서도 통계적 타당성을 유지하면서 분위수 지표에 대한 확장 가능한 분산 추정 기법을 개발할 수 있는가?
  • RQ2대규모 프로덕션 시스템에서 저지연 보고 요구사항(예: 5시간 이내)을 충족하기 위해 분위수 A/B 테스트를 어떻게 가속화할 수 있는가?
  • RQ3제안된 방법이 분위수 지표의 표준 오차 추정에서 부트스트랩 방법과 얼마나 정확하게 일치하는가?
  • RQ4고정 너비 간격 대비 동적 간격 너비가 분산 추정 정확도에 어떤 영향을 미치는가?
  • RQ5다양한 실험 구성(다양한 플랫폼, 지리적 지역, 날짜 범위)에서 파이프라인의 성능은 어떠한가?

주요 결과

  • 제안된 방법은 부트스트랩 대비 500배 이상 빠른 처리 속도를 확보하여 3000억 건의 행에 대해 처리 시간을 수일에서 2시간 이내로 단축시켰다.
  • 부트스트랩 추정치와 7% 이상의 차이가 나는 확률이 2% 이하로 낮아 높은 정확성과 신뢰성을 입증했다.
  • 명목상의 유의수준 5%일 때, 제안된 방법을 사용한 실제 유의수준은 5%에 매우 가까워 통계적 타당성이 확인되었다.
  • 분산 추정기법은 i.i.d. 점근적 근사법보다 뚜렷이 우수하며, 후자는 표준 오차를 약 10배나 과소평가하고 61%의 가짜 양성 결과를 초래한다.
  • 파이프라인은 평균적으로 30일치 데이터(3000억 건의 행)를 약 2시간 내로 처리하여 리노크의 5시간 이내 보고 요구사항을 충족했다.
  • 실험 추적을 위한 비트맵의 사용은 효율적인 메모리 기반 조인을 가능하게 하여 I/O를 감소시키고 조인 단계를 수배수로 가속화했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.