[논문 리뷰] Causal inference from observational data: Estimating the effect of contributions on visitation frequency atLinkedIn
이 논문은 관찰 데이터를 사용하여 사용자 기여(예: 게시물, 메시지)가 방문 빈도에 미치는 동시 효과 및 확산 효과를 추정하기 위한 인과적 추론 방법을 제안하고 평가한다. 고정 효과 및 이중으로 강건한 추정기법이 단순 상관관계보다 성능이 뛰어나며, 모형 잘못 설정이 있을 경우에도 편향을 줄이는 것으로 나타났다. 공개 기여는 양의 인과 효과를 보이고, 비공개 기여는 적절한 조정이 이루어지지 않으면 큰 음의 편향을 보였다.
Randomized experiments (A/B testings) have become the standard way for web-facing companies to guide innovation, evaluate new products, and prioritize ideas. There are times, however, when running an experiment is too complicated (e.g., we have not built the infrastructure), costly (e.g., the intervention will have a substantial negative impact on revenue), and time-consuming (e.g., the effect may take months to materialize). Even if we can run an experiment, knowing the magnitude of the impact will significantly accelerate the product development life cycle by helping us prioritize tests and determine the appropriate traffic allocation for different treatment groups. In this setting, we should leverage observational data to quickly and cost-efficiently obtain a reliable estimate of the causal effect. Although causal inference from observational data has a long history, its adoption by data scientist in technology companies has been slow. In this paper, we rectify this by providing a brief introduction to the vast field of causal inference with a specific focus on the tools and techniques that data scientist can directly leverage. We illustrate how to apply some of these methodologies to measure the effect of contributions (e.g., post, comment, like or send private messages) on engagement metrics. Evaluating the impact of contributions on engagement through an A/B test requires encouragement design and the development of non-standard experimentation infrastructure, which can consume a tremendous amount of time and financial resources. We present multiple efficient strategies that exploit historical data to accurately estimate the contemporaneous (or instantaneous) causal effect of a user's contribution on her own and her neighbors' (i.e., the users she is connected to) subsequent visitation frequency. We apply these tools to LinkedIn data for several million members.
연구 동기 및 목표
- 관찰 데이터를 사용하여 사용자 기여(공개 및 비공개)가 자신의 방문 빈도와 이웃의 방문 빈도에 미치는 인과 효과를 추정한다.
- 높은 비용, 인프라 복잡성, 지연 효과 등의 A/B 테스트의 한계를 극복하기 위해 역사적 데이터를 활용한다.
- 특히 고정 효과 및 이중으로 강건한 추정기법의 정확도를 시간에 따라 변하지 않는 잠재 변수와 모형 잘못 설정 하에서 평가한다.
- LinkedIn 내에서 인과적 추론을 위한 확장성 있고 안전하며 표준화된 내부 플랫폼을 개발하여 접근성을 높이고 방법론의 엄밀함을 확보한다.
- 처리 효과가 사용자 세그먼트 및 기여 유형에 따라 어떻게 달라지는지 파악하여 향후 제품 기획에 기여한다.
제안 방법
- 관측된 공변량, 시간에 따라 변하는 및 시간에 따라 변하지 않는 잠재 변수, 네트워크 이웃의 행동을 고려하여 기여 확률과 방문 빈도를 모델링하는 구조적 모형을 사용한다.
- 치료 할당의 선택 편향을 보정하기 위해 역확률가중법(IPW)을 적용한다.
- 결과 회귀 모형과 성향 스코어 모형을 조합한 이중으로 강건한 추정기법을 사용하여, 어느 한 모형이 정확히 설정되어 있더라도 일관성을 확보한다.
- 사용자 수준의 시간에 따라 변하지 않는 잠재 변수를 통제하기 위해 고정 효과(FE) 및 가중 고정 효과 모형을 구현한다.
- 이웃의 기여 행동을 치료 및 결과 방정정식에 포함시켜 확산 효과를 모델링하며, 공개 및 비공개 기여에 대해 로그 함수와 지표 함수를 사용한다.
- 정확한 기준값이 알려진 시뮬레이션을 통해 방법을 검증하고, 시간에 따라 변하지 않는 vs. 시간에 따라 변하는 잠재 변수가 존재하는 다양한 편향 상황에서 편향과 정밀도를 비교한다.
실험 결과
연구 질문
- RQ1관찰 데이터에서 추정할 때, 사용자의 공개 또는 비공개 기여가 그 후 방문 빈도에 미치는 인과 효과는 무엇인가?
- RQ2사용자의 기여가 그의 사회적 네트워크 이웃의 방문 빈도에 미치는 영향(확산 효과)은 어떠한가?
- RQ3선택 편향이 존재할 경우, IPW, 이중으로 강건한 추정기법, 고정 효과 등 다양한 인과적 추론 방법의 성능은 어떻게 평가되는가?
- RQ4모형 잘못 설정(예: 잘못된 함수 형태 또는 시간에 따라 변하는 잠재 변수)이 인과 추정의 정확도에 어떤 영향을 미치는가?
- RQ5중앙집중식, 안전하고 표준화된 플랫폼을 통해 데이터 과학자들이 체계적으로 고급 인과적 추론 기법을 대규모로 신뢰성 있게 적용할 수 있는가?
주요 결과
- 기여와 방문 빈도 사이의 상관관계는 잘못된 음의 관계를 암시하며, 이는 잘못된 인과적 추론을 유도하지만, 인과적 방법은 양의 영향을 드러낸다.
- 고정 효과(FE) 및 가중 고정 효과 모형은 시간에 따라 변하지 않는 잠재 변수에 의한 편향을 크게 줄이며, 이러한 잠재 변수가 존재할 경우 FE 모형은 진짜 효과를 거의 완벽하게 추정한다.
- 공개 기여의 경우, 동시 효과는 시간에 따라 변하지 않는 경우 +6.93, 시간에 따라 변하는 경우 +1.34로 추정되어 시간이 지남에 따라 영향력이 감소하는 양의 영향을 보인다.
- 비공개 기여의 경우, 시간에 따라 변하지 않는 효과는 -72.53로 추정되나 이는 심각한 편향을 포함한다. 진짜 효과는 FE 모형을 통해 -10.00으로 보다 잘 측정되며, 이는 단순 방법이 음의 영향을 과대평가함을 시사한다.
- 이중으로 강건한 추정기법과 고정 효과 모형은 특히 모형 잘못 설정 상황에서 표준 IPW보다 편향을 더 효과적으로 줄인다.
- 시뮬레이션 연구는 고정 효과 모형이 시간에 따라 변하지 않는 잠재 변수에 대해 강건함을 확인하였으며, 고정 효과가 없는 모형은 진짜 값보다 5배 이상 큰 추정치를 도출할 수 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.