Skip to main content
QUICK REVIEW

[논문 리뷰] Inform Product Change through Experimentation with Data-Driven Behavioral Segmentation

Zhenyu Zhao, Yan He|arXiv (Cornell University)|2022. 01. 25.
Mobile Crowdsensing and Crowdsourcing참고 문헌 26인용 수 4
한 줄 요약

이 논문은 웹 제품 개발에서 A/B 테스트를 위한 데이터 기반 행동 분할 프레임워크를 제안한다. 제품 구성 요소에 대한 사전 실험기반 사용자 참여도를 활용해 의미 있는 사용자 세그먼트를 생성한다. 세그먼트 수준에서 치료 효과를 분석함으로써, Yahoo 파이낸스의 리디자인으로 인해 인용구 및 메시지 보드에 집중하는 사용자들 사이에서 방문당 콘텐츠 수(CPV)가 10.3% 감소한 것으로 드러났다. 이는 실험군에서 사용자 생성 콘텐츠가 감소함에 따라 발생한 것으로, 이에 대응해 타겟팅된 디자인 수정을 통해 CPV는 6.1% 감소로 회복되었고, APV는 35.1% 증가했다.

ABSTRACT

Online controlled experimentation is widely adopted for evaluating new features in the rapid development cycle for web products and mobile applications. Measurement of the overall experiment sample is a common practice to quantify the overall treatment effect. In order to understand why the treatment effect occurs in a certain way, segmentation becomes a valuable approach to a finer analysis of experiment results. This paper introduces a framework for creating and utilizing user behavioral segments in online experimentation. By using the data of user engagement with individual product components as input, this method defines segments that are closely related to the features being evaluated in the product development cycle. With a real-world example, we demonstrate that the analysis with such behavioral segments offered deep, actionable insights that successfully informed product decision-making.

연구 동기 및 목표

  • 전체 메트릭 변화를 넘어서 치료 효과의 '왜'를 설명하기 위해.
  • 제품 기능과 연관된 행동적으로 관련 있는 사용자 세그먼트를 만드는 방법을 개발하기 위해.
  • 실험 결과의 세그먼트 수준 분석을 통해 실질적인 통찰을 도출해 제품 개발에 활용하기 위해.
  • 세그먼트 정의를 실험 치료와 독립적으로 유지함으로써 편향을 방지하기 위해.
  • 실제 제품 의사결정에 영향을 주는 프레임워크의 영향을 측정 가능한 향상으로 보여주기 위해.

제안 방법

  • 특정 제품 구성 요소(예: 메인페이지, 인용구, 메시지 보드)에 대한 사용자 참여도를 기반으로 행동 특징을 정의한다.
  • 비지도 학습을 활용해 사전 실험 데이터를 사용해 상호 배타적이고 포괄적인 세그먼트로 사용자를 군집화한다.
  • 기능적 구성 요소를 통해의 참여 패턴에 따라 거리 기반 군집화를 적용해 사용자를 그룹화한다.
  • 사용자 세그먼트 정의가 실험 치료와 독립적이도록 사전 실험 행동 데이터만을 사용한다.
  • CPV, APV, 세션 수와 같은 핵심 메트릭에 대한 치료 효과를 세그먼트 수준에서 분석한다.
  • 수정 사항을 검증하기 위해 후속 A/B 테스트를 실시하고, 변경 전후의 세그먼트 수준 결과를 비교한다.
Figure 1: BIC and Davies-Bouldin Index for k-means with different number of clusters K
Figure 1: BIC and Davies-Bouldin Index for k-means with different number of clusters K

실험 결과

연구 질문

  • RQ1행동 분할을 통해 집계 메트릭을 넘어서 A/B 테스트 결과의 해석을 어떻게 향상시킬 수 있는가?
  • RQ2제품 실험에서 치료 효과 변동성을 가장 잘 예측하는 사용자 참여 패턴은 무엇인가?
  • RQ3세그먼트 수준의 통찰은 어떻게 실질적인 제품 개발 의사결정을 이끌 수 있는가?
  • RQ4실험 기간 데이터를 사용할 경우 세그먼트 정의의 편향 위험은 무엇인가?
  • RQ5세그먼트 수준 분석은 예상치 못한 치료 효과의 근본 원인을 어느 정도 드러낼 수 있는가?

주요 결과

  • Yahoo 파이낸스의 리디자인으로 전체 인구집단에서 방문당 콘텐츠 수(CPV)가 유의미하게 10.3% 감소했으며, 이는 주로 '인용구 및 메시지 보드' 세그먼트에서 기인했다.
  • 세그먼트 수준 분석을 통해 '인용구 및 메시지 보드' 세그먼트에서 CPV 감소 원인이 실험군에서 사용자 생성 콘텐츠가 감소했기 때문임을 밝혀냈다. 이는 표본 수가 적어 발생한 네트워크 효과였다.
  • 메인페이지에 다시 인용구 관련 모듈을 추가한 후, 후속 테스트에서 CPV는 6.1% 감소로 회복되었고, APV는 35.1% 증가했다.
  • '메인페이지 및 하이브리드 높음' 및 '메인페이지 및 하이브리드 중간' 세그먼트가 수정 후 가장 큰 개선을 보였으며, CPV는 각각 9%와 6% 증가했다.
  • 수정 후에도 전체 치료 효과는 유의미했지만, 세그먼트 수준 분석이 근본 원인을 특정하고 해결책을 안내하는 데 핵심적이었다.
  • 세그먼트를 사전 실험 데이터를 사용해 정의함으로써 이 프레임워크는 편향을 효과적으로 방지했고, 치료군과 대조군 간의 유효한 비교를 보장했다.
Figure 2: Average Per-User Metrics for Each Cluster Defined by K-means Algorithm for Yahoo Finance. Green indicates high engagement, while white denotes low engagement. There are a total of $14$ clusters defined by the k-means algorithm. The x-axis shows the cluster label from k-means.
Figure 2: Average Per-User Metrics for Each Cluster Defined by K-means Algorithm for Yahoo Finance. Green indicates high engagement, while white denotes low engagement. There are a total of $14$ clusters defined by the k-means algorithm. The x-axis shows the cluster label from k-means.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.