Skip to main content
QUICK REVIEW

[논문 리뷰] Event sequence metric learning.

Dmitrii Babaev, Ivan Kireev|arXiv (Cornell University)|2020. 02. 19.
Domain Adaptation and Few-Shot Learning참고 문헌 39인용 수 8
한 줄 요약

이 논문은 원시 거래 데이터에서 생성된 부분 시퀀스를 사용하여 사용자 이벤트 시퀀스의 압축되고 분류 가능한 벡터 임베딩을 학습하기 위한 자기지도적 거리 학습 방법을 제안한다. 이 방법은 라벨이 없는 데이터를 사용함에도 불구하고 하류 분류 작업에서 기존 방법들을 능가하며, 저차원 표현을 통해 사용자 프라이버시를 향상시킨다.

ABSTRACT

In this paper we consider a challenging problem of learning discriminative vector representations for event sequences generated by real-world users. Vector representations map behavioral client raw data to the low-dimensional fixed-length vectors in the latent space. We propose a novel method of learning those vector embeddings based on metric learning approach. We propose a strategy of raw data subsequences generation to apply a metric learning approach in a fully self-supervised way. We evaluated the method over several public bank transactions datasets and showed that self-supervised embeddings outperform other methods when applied to downstream classification tasks. Moreover, embeddings are compact and provide additional user privacy protection.

연구 동기 및 목표

  • 실세계 사용자 이벤트 시퀀스에 대한 분류 가능한 벡터 표현을 학습하는 도전 과제를 해결한다.
  • 학습용 임베딩을 위한 라벨 데이터에 의존하지 않도록 완전히 자기지도적 방법을 개발한다.
  • 저차원, 고정 길이의 벡터 표현을 사용하여 하류 분류 성능을 향상시킨다.
  • 원시 행동 데이터를 폭로하지 않는 압축된 임베딩을 생성함으로써 사용자 프라이버시를 향상시킨다.
  • 수동 주석 없이도 원시 거래 로그에서 효과적인 표현 학습을 가능하게 한다.

제안 방법

  • 사용자 이벤트 시퀀스에서 원시 데이터의 부분 시퀀스를 생성하여 거리 학습을 위한 학습 샘플을 만든다.
  • 유사한 시퀀스 간의 의미적 유사성을 유지하는 임베딩을 학습하기 위해 거리 학습 프레임워크를 적용한다.
  • 외부 레이블 없이 부분 시퀀스의 구조에서 학습하는 자기지도 전략을 사용한다.
  • 의미적으로 유사한 이벤트 시퀀스가 잠재 벡터 공간에서 가까워지도록 임베딩 공간을 최적화한다.
  • 생성된 부분 시퀀스에서 대비 손실 또는 유사한 거리 학습 목표를 사용하여 모델을 엔드 투 엔드로 훈련한다.
  • 최종 임베딩이 저차원이고 고정 길이임을 확보하여 효율적인 하류 사용을 위해 설계한다.

실험 결과

연구 질문

  • RQ1라벨이 없는 데이터에서 자기지도적 거리 학습이 사용자 이벤트 시퀀스에 대해 효과적으로 분류 가능한 표현을 학습할 수 있는가?
  • RQ2기존의 비지도 또는 지도 학습 기반 베이스라인과 비교해 러닝된 임베딩의 하류 분류 작업 성능은 어떠한가?
  • RQ3분류 용도에서의 유용성을 유지하면서 얼마나 잘 프라이버시를 보존하는가?
  • RQ4부분 시퀀스 생성 전략이 학습된 표현의 품질에 어떤 영향을 미치는가?
  • RQ5실세계 거래 데이터에서 임베딩의 압축성과 성능 사이의 상호 상충 관계는 어떠한가?

주요 결과

  • 제안된 자기지도적 거리 학습 방법은 기존의 비지도 및 지도 학습 기반 베이스라인과 비교해 하류 분류 작업에서 뛰어난 성능을 달성한다.
  • 이 방법으로 학습된 임베딩는 압축되어 있어 저장 및 추론에 효율적이면서도 분류 능력을 유지한다.
  • 라벨 데이터에 접근할 수 없음에도 불구하고 강력한 성능을 유지하여 자기지도적 부분 시퀀스 생성 전략의 효과성을 입증한다.
  • 저차원이고 고정 길이인 특성 덕분에 학습된 표현은 본질적으로 프라이버시 보호 기능을 제공한다.
  • 다양한 공개 은행 거래 데이터셋에 대한 평가를 통해 다양한 실세계 시나리오에서 일관된 성능 향상이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.