Skip to main content
QUICK REVIEW

[논문 리뷰] Synthesizing Credit Card Transactions

Erik Altman|arXiv (Cornell University)|2019. 10. 04.
Financial Distress and Bankruptcy Prediction인용 수 7
한 줄 요약

이 논문은 실제 거래 데이터에 접근하지 않고도 대규모이고 현실적인 합성 신용카드 거래 데이터를 생성하는 새로운 프라이버시 보장 방법을 제시한다. 개인의 개별적인 소비 행동, 지리적 이동성, 상관관계가 있는 재정 패턴을 확률적 샘플링과 상태 기반 시뮬레이션을 사용해 모델링함으로써, 35년에 걸쳐 300만 건 이상의 합성 거래를 생성한다. 이는 거래량, 분포, 사기 특성 측면에서 실제 세계 통계와 일치하며, 사기 탐지 모델의 강력한 훈련을 가능하게 한다.

ABSTRACT

Two elements have been essential to AI's recent boom: (1) deep neural nets and the theory and practice behind them; and (2) cloud computing with its abundant labeled data and large computing resources. Abundant labeled data is available for key domains such as images, speech, natural language processing, and recommendation engines. However, there are many other domains where such data is not available, or access to it is highly restricted for privacy reasons, as with health and financial data. Even when abundant data is available, it is often not labeled. Doing such labeling is labor-intensive and non-scalable. As a result, to the best of our knowledge, key domains still lack labeled data or have at most toy data; or the synthetic data must have access to real data from which it can mimic new data. This paper outlines work to generate realistic synthetic data for an important domain: credit card transactions. Some challenges: there are many patterns and correlations in real purchases. There are millions of merchants and innumerable locations. Those merchants offer a wide variety of goods. Who shops where and when? How much do people pay? What is a realistic fraudulent transaction? We use a mixture of technical approaches and domain knowledge including mechanics of credit card processing, a broad set of consumer domains: electronics, clothing, hair styling, etc. Connecting everything is a virtual world. This paper outlines some of our key techniques and provides evidence that the data generated is indeed realistic. Beyond the scope of this paper: (1) use of our data to develop and train models to predict fraud; (2) coupling models and the synthetic dataset to assess performance in designing accelerators such as GPUs and TPUs.

연구 동기 및 목표

  • 개인정보 보호 제약과 높은 레이블링 비용으로 인해 대규모 레이블이 부여된 재무 거래 데이터가 부족한 데 대응하기 위해.
  • 기존의 합성 데이터 방법이 실제 데이터를 모방하기 위해 필요로 하거나, 짧은 시간 범위와 소규모 양에 국한되는 한계를 극복하기 위해.
  • 실제 세계의 복잡성을 반영하는, 확장 가능하고 프라이버시 준수 가능한 합성 데이터 생성 프레임워크를 구축하여 신용카드 거래에 적용하기 위해.
  • 가상 세계와 상태 기계를 사용해 다양한 분야(예: 소매, 여행, 의료)의 소비자 행동을 고정밀도로 시뮬레이션하기 위해.
  • 강력한 사기 탐지 모델 개발 및 훈련을 지원하고 하드웨어 설계를 가속화하기 위해, GAN과 TPU가 다른 AI 분야에서 발전시킨 것과 유사한 방식으로 활용하기 위해.

제안 방법

  • 실제 미국 인구 조사 및 인구 통계 데이터에서 유래한 개인별 통계 분포(소비, 소득, 신용점수, 지리적 위치 등)를 사용해 소비자를 모델링한다.
  • 정규분포(그리고 기타 분포)에서의 확률적 샘플링을 통해 개인 수준의 파라미터를 할당함으로써 인구 수준의 평균과 표준편차를 유지한다.
  • 직접 데이터로 제공되지 않는 재정 지표 간의 정확한 상관관계(예: 여행과 소득 간의 상관관계)를 확보하기 위해 특이값 분해(SVD)와 특수한 기법을 적용한다.
  • 가상 세계에 상태 기반 기계를 도입해 이동, 거주지, 직장 스케줄과 같은 동적 행동을 모델링함으로써 거래의 현실적인 시간 및 맥락을 구현한다.
  • 가상 세계의 상호작용을 기록하여 카드 유형(신용, 직불, 선불), 채널(대면, 온라인), 거래 금액을 포함한 거래 로그를 생성한다.
  • 실제 세계의 요약 통계(예: 사기 비율, 카테고리별 소비, MCC 코드)를 사용해 입력 파라미터를 校정함으로써 생성된 데이터가 경험적 분포와 일치하도록 보장한다.

실험 결과

연구 질문

  • RQ1실제 거래 데이터에 접근하지 않고도 복잡한 상관관계와 시간적 동역학을 유지하면서 현실적인 합성 신용카드 거래 데이터를 생성할 수 있는가?
  • RQ2인구 수준의 변동이 아닌 개인별 안정적인 분포를 기반으로 한 개별화된 소비 행동이 합성 거래의 현실성에 얼마나 기여하는가?
  • RQ3직접 데이터가 제공되지 않는 다양한 재정 지표 간의 상관관계(예: 여행 빈도와 소비)를 정확히 모델링할 수 있는가?
  • RQ4상태 기반 기계와 행동 규칙을 갖춘 가상 세계 시뮬레이션을 통해 시간, 지리, 거래 유형에 따라 실제 세계 요약 통계와 일치하는 거래 데이터를 생성할 수 있는가?
  • RQ5사기 탐지 모델의 훈련 및 평가, 하드웨어 가속화를 의미 있게 지원하기 위해 필요한 합성 데이터의 규모와 정밀도는 어느 정도인가?

주요 결과

  • 이 방법은 35년 동안 20,000명의 가상 소비자에게서 300만 건 이상의 합성 거래를 성공적으로 생성하였으며, CSV 형식으로 20GB 이상의 데이터 크기를 확보하였다.
  • 생성된 데이터는 핵심 지표에서 실제 세계 통계와 일치한다: 신용/직불/선불 카드 사용 비율, 연간 거래 건수, 거래 금액 분포, 사기 비율(온라인 사기 비율이 높은 경우 포함).
  • 소득과 외국 여행 간의 현실적인 상관관계를 반영하며, 카테고리별(예: 식당, 전자기기) 및 MCC 코드 기반 소비 표현도 정확하게 포함하고 있다.
  • 수명 주기, 연간, 거래 단위 등 다양한 정밀도에서 현실적인 거래 스니펫과 요약 통계를 생성하였으며, 실제 기준치와 매우 유사한 값을 기록하였다.
  • 이 합성 데이터셋은 널리 사용되는 카글 사기 데이터셋보다 1,000배 이상 크며, 수십 년에 이르는 기간을 커버하여 장기적 소비 행동 모델링과 모델 일반화 향상을 가능하게 한다.
  • 이 방법은 신용카드 거래 외에도 대출 신청서, 의료 비용, 콜센터 상호작용 등과 통합된 이질적이고 통합된 데이터셋 생성을 가능하게 하여, 다중 모odal AI 연구를 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.