Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Transactions Representations for Information Management in Banks: Mastering Local, Global, and External Knowledge

Alexandra Bazarova, Maria Kovaleva|arXiv (Cornell University)|2024. 04. 02.
Business Strategy and Innovation인용 수 4
한 줄 요약

이 논문은 금융 거래 데이터에 대한 통합된 표현 학습 프레임워크를 제안하며, 고객 행동의 국소적, 전역적, 동적 성질을 동시에 포괄하고, 집계된 고객 표현으로부터 외부 맥락을 통합한다. 국소적(예: 다음 MCC 예측), 전역적(전체 이력), 동적(시간에 따른 변화) 차원에서 표현을 평가하기 위한 새로운 생성 모델과 벤치마크를 도입하여, 대비 기반 모델 대비 최대 14% 높은 ROC-AUC 성능을 달성하고 외부 맥락을 통합할 경우 20% 향상된 성능을 보였다.

ABSTRACT

In today's world, banks use artificial intelligence to optimize diverse business processes, aiming to improve customer experience. Most of the customer-related tasks can be categorized into two groups: 1) local ones, which focus on a client's current state, such as transaction forecasting, and 2) global ones, which consider the general customer behaviour, e.g., predicting successful loan repayment. Unfortunately, maintaining separate models for each task is costly. Therefore, to better facilitate information management, we compared eight state-of-the-art unsupervised methods on 11 tasks in search for a one-size-fits-all solution. Contrastive self-supervised learning methods were demonstrated to excel at global problems, while generative techniques were superior at local tasks. We also introduced a novel approach, which enriches the client's representation by incorporating external information gathered from other clients. Our method outperforms classical models, boosting accuracy by up to 20\%.

연구 동기 및 목표

  • 기존 방법이 국소적 또는 전역적 표현에만 집중하는 점을 감안해, 동시에 양쪽을 다루지 못하는 격차를 해소하기 위해.
  • 시간에 따라 변화하는 고객 행동과 임베딩의 시간적 동적 성질을 포괄하는 통합된 표현 학습 프레임워크를 개발하기 위해.
  • 전문가가 정의한 지표에 의존하지 않고도, 집계된 고객 행동이나 거시경제 동향과 같은 외부 맥락을 개인 고객 표현에 통합하기 위해.
  • 금융 거래 데이터에서 국소적, 전역적, 동적 성질을 평가하기 위한 종합적인 벤치마크를 설계하기 위해.
  • 더 나은 표현 품질을 통해 다음 이벤트 예측 및 이상 탐지와 같은 후속 작업에서 성능 향상을 이루기 위해.

제안 방법

  • 프레임워크는 생성 모델(예: 오토인코더, 트랜스포머, 시간적 포인트 프로세스)과 대비 학습을 융합한 하이브리드 접근 방식을 사용하여 거래 시퀀스에서 보편적인 임베딩을 학습한다.
  • 이중 손실 학습 전략을 적용: 생성 모델링을 위한 복원 손실과 시퀀스 간의 구조적 유사성을 유지하기 위한 대비 손실.
  • 외부 맥락은 훈련 세트에 포함된 모든 고객의 표현을 집계하여 전역 신호로 모델링하고, 어텐션 메커니즘을 통해 개별 고객 인코더에 통합한다.
  • 불규칙하게 간격이 있는 거래 이벤트를 처리하기 위해 시간 인코딩과 정규화된 시간 간격(일 단위)을 사용하여 원시 타임스탬프에서 발생할 수 있는 수치 오버플로우를 방지한다.
  • 국소 표현 평가를 위해 시퀀스 상에서 슬라이딩 윈도우를 사용하는 전용 검증 프로토콜을 도입하며, 다음 이벤트 예측에 대한 ROC-AUC와 같은 메트릭을 활용한다.
  • 모델은 하이퍼파rameter 조정에 주의를 기울여 훈련되며, 희귀한 MCC 코드의 경우 시퀀스 길이 클리핑을 적용하고, 외부 맥락을 통합할 경우 메모리 제약으로 인해 배치 크기를 감소시킨다.

실험 결과

연구 질문

  • RQ1단일 표현 학습 프레임워크가 금융 거래 시퀀스의 국소적(현재 상태) 및 전역적(전체 이력) 성질을 효과적으로 동시에 포괄할 수 있는가?
  • RQ2집계된 고객 표현에서 유도된 외부 맥락을 통합할 경우 개인 고객 표현의 품질이 얼마나 향상되는가?
  • RQ3다음 MCC 예측과 같은 국소 후속 작업에서 생성 모델이 대비 기반 모델보다 얼마나 뛰어난 성능을 보이는가?
  • RQ4거래 데이터에서 표현의 시간적 동적 성질을 어떻게 의미 있게 평가하고 벤치마크화할 수 있는가?
  • RQ5불규칙한 시간 간격, 혼합된 범주형 및 연속형 특성과 같은 데이터 특성은 표현 학습 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 생성 프레임워크는 최첨단 대비 기반 모델 대비 다음 MCC 예측 작업에서 최대 14% 높은 ROC-AUC 성능을 달성했다.
  • 외부 맥락을 통합할 경우 후속 작업에서 추가로 20% 향상된 성능을 보여, 전역 행동 신호의 가치를 입증했다.
  • 모델의 국소 표현은 사기 탐지 및 변화점 탐지에 핵심적인 순간적 고객 행동을 포착하는 데 기존 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 벤치마크 프레임워크는 국소적, 전역적, 동적 차원에서 표현을 성공적으로 평가하여 표현 품질에 대한 종합적인 평가를 가능하게 했다.
  • 고도로 메모리 소모가 큰 외부 맥락 모델링에 비해, 고객 표현의 무작위 부분 집합을 사용함으로써 확장성을 확보할 수 있었다.
  • 이 프레임워크는 공개 데이터(Churn, Age, Default, HSBC)와 사내 산업 데이터를 포함한 다양한 데이터셋에 일반화되며 도메인 이동에 대한 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.