Skip to main content
QUICK REVIEW

[논문 리뷰] Topological Data Analysis of Time Series Data for B2B Customer Relationship Management

Rodrigo Rivera-Castro, Polina Pilyugina|arXiv (Cornell University)|2019. 05. 26.
Data Mining Algorithms and Applications참고 문헌 13인용 수 8
한 줄 요약

이 논문은 시간 시리즈와 위상적 데이터 분석(TDA)을 적용하여 전통적인 RFM을 개선하는 두 가지 새로운 고객 세분화 방법인 Time Series RFM 및 Topological RFM을 제안한다. 이는 고객의 최근성, 빈도, 지출 금액을 시간 시리즈로 모델링하고, 시간적 패턴을 포착하기 위해 TDA를 활용한다. 이 방법은 B2B CRM에서 예측 정확도를 향상시키며, 클라우드 컴퓨팅 데이터셋에서 기준선 RFM 대비 RMSE를 92% 감소시킨다.

ABSTRACT

Topological Data Analysis (TDA) is a recent approach to analyze data sets from the perspective of their topological structure. Its use for time series data has been limited to the field of financial time series primarily and as a method for feature generation in machine learning applications. In this work, TDA is presented as a technique to gain additional understanding of the customers' loyalty for business-to-business customer relationship management. Increasing loyalty and strengthening relationships with key accounts remain an active topic of discussion both for researchers and managers. Using two public and two proprietary data sets of commercial data, this research shows that the technique enables analysts to better understand their customer base and identify prospective opportunities. In addition, the approach can be used as a clustering method to increase the accuracy of a predictive model for loyalty scoring. This work thus seeks to introduce TDA as a viable tool for data analysis to the quantitate marketing practitioner.

연구 동기 및 목표

  • 희소하고 비대표적인 시간 시리즈 데이터를 가진 B2B 환경에서 전통적인 RFM의 동적 고객 행동을 포착하는 데 한계가 있음을 해결하기 위해.
  • 비기술자인 마케팅 전문가들이 사용할 수 있고 해석이 가능한 기계학습 방법을 개발하여 고객 충성도 예측을 향상시키기 위해.
  • 시간 시리즈 군집화와 위상적 데이터 분석(TDA)이 표준 RFM보다 고객 수요 예측 성능을 높일 수 있는지 평가하기 위해.
  • TDA를 활용한 CRM 데이터 분석을 위한 재현 가능하고 오픈소스 파이프라인을 제공하여, 전문가들이 고객 프로파일을 생성하고 모델 정확도를 향상시킬 수 있도록 하기 위해.

제안 방법

  • 각 고객의 거래 이력에 대해 최근성, 빈도, 지출 금액을 시간 시리즈 데이터로 변환한다.
  • 각 RFM 차원에 대해 엘보우 방법을 사용하여 클러스터 수를 선택한 후, 시간 시리즈 데이터에 K-means 군집화를 적용한다.
  • 시간 시리즈에서 유도된 점 클러스터 임베딩에 대해 Rips 필터레이션을 적용하여 지속성 다이어그램을 계산하며, 주로 1차원 호모로지(루프)에 초점을 맞춰 위상적 특징을 포착한다.
  • 0차원 및 1차원 호모로지의 바코드 다이어그램(persistence diagrams)에서 특징을 추출하여 위상적 구조를 표현한다.
  • 위상적 특징에 대해 K-means 군집화를 수행하여 향상된 고객 세그먼트를 생성하고, 이를 기울기 트리 부스팅 모델(CatBoost)의 범주형 특징으로 사용한다.
  • CatBoost는 범주형 특징를 내장으로 지원하므로 예측에 사용되었으며, 70-30 훈련-테스트 분할을 기반으로 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1희소하고 비대표적인 역사적 데이터를 가진 B2B 환경에서 전통적인 RFM 프레임워크가 고객 행동의 핵심 요소를 충분히 포착할 수 있는가?
  • RQ2RFM를 시간 시리즈로 모델링하고 위상적 데이터 분석(TDA)을 적용하면 고객 충성도 및 수요 예측 모델의 정확도가 향상되는가?
  • RQ3Time Series RFM와 Topological RFM는 표준 RFM 및 기준선 모델에 비해 예측 성능에서 어떻게 비교되는가?
  • RQ4어떤 상황에서 Topological RFM가 Time Series RFM보다 유리하며, 전문가들이 모델 선택을 가이드할 수 있는 히ュ리스틱은 무엇인가?

주요 결과

  • Topological RFM는 기준선 no-RFM 모델 대비 클라우드 컴퓨팅 데이터셋에서 RMSE를 92% 감소시켜 RMSE 0.03(기준선 0.38)를 기록했다.
  • Time Series RFM는 모든 데이터셋에서 가장 낮은 RMSE를 기록했으며, 클라우드 데이터셋에서 기준선 대비 92% 향상(기준선 RMSE 0.38 → 0.05)을 달성했다.
  • 표준 RFM는 no-RFM 기준선 대비 근소한 향상만 보였으며, 클라우드 데이터셋에서 RMSE가 3.56에서 3.98로 증가하여 예측 가치가 제한적임을 시사했다.
  • 호텔리어티 데이터셋에서는 Topological RFM가 표준 RFM를 능가했으며(RMSE 275 vs. 240), 그러나 클라우드 데이터셋만큼은 아니었으며, 이는 데이터 품질에 민감함을 시사했다.
  • 위상적 특징의 사용 덕분에 클러스터 중심점(자체로 시간 시리즈인)을 통해 이해하기 쉬운 고객 프로파일을 생성할 수 있었으며, 의사결정자와의 커뮤니케이션에 유용했다.
  • 본 연구는 TDA 기반 방법이 CRM 파이프라인에 효과적으로 통합될 수 있으며, 비즈니스 분석가들에게 더 높은 정확도와 해석 가능성 향상을 제공할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.