Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer Hawkes Process

Simiao Zuo, Haoming Jiang|arXiv (Cornell University)|2020. 02. 21.
Point processes and geometric inequalities참고 문헌 35인용 수 22
한 줄 요약

이 논문은 자기주의 어텐션 메커니즘을 활용하여 이벤트 시계열 데이터의 단기적 및 장기적 시간적 의존성을 모두 포착하는 새로운 포인트 프로세스 모델인 Transformer Hawkes Process (THP)를 제안한다. 이는 RNN 기반 모델인 NHP보다도 우수한 우도 및 예측 정확도를 기록하면서도 더 뛰어난 계산 효율성을 확보한다. THP는 어텐션 메커니즘을 통해 구조적 지식을 통합함으로써 관계 그래프와 같은 구조적 데이터로의 일반화 성능도 뛰어나다.

ABSTRACT

Modern data acquisition routinely produce massive amounts of event sequence data in various domains, such as social media, healthcare, and financial markets. These data often exhibit complicated short-term and long-term temporal dependencies. However, most of the existing recurrent neural network based point process models fail to capture such dependencies, and yield unreliable prediction performance. To address this issue, we propose a Transformer Hawkes Process (THP) model, which leverages the self-attention mechanism to capture long-term dependencies and meanwhile enjoys computational efficiency. Numerical experiments on various datasets show that THP outperforms existing models in terms of both likelihood and event prediction accuracy by a notable margin. Moreover, THP is quite general and can incorporate additional structural knowledge. We provide a concrete example, where THP achieves improved prediction performance for learning multiple point processes when incorporating their relational information.

연구 동기 및 목표

  • 이벤트 시계열에서 장기적 시간적 의존성을 포착하는 데에 RNN 기반 포인트 프로세스 모델의 한계를 해결하기 위해.
  • 복잡한 이벤트 역학을 모델링할 때 재귀 아키텍처의 계산 비효율성과 학습 불안정성을 극복하기 위해.
  • 단기적 및 장기적 의존성을 모두 갖춘 이벤트 스트림을 모델링하기 위한 확장성 있고 효율적이며 일반화 능력이 뛰어난 프레임워크를 개발하기 위해.
  • 관계적 또는 공간 정보와 같은 구조적 지식을 포인트 프로세스 모델링에 통합하여 복잡한 데이터에서 성능을 향상시키기 위해.
  • 다양한 실세계 데이터셋에서 우수한 우도 및 이벤트 예측 정확도를 입증하며 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 모델은 모든 이벤트 쌍 간의 어텐션 가중치를 직접 계산하는 자기주의 어텐션 메커니즘을 사용하여, 재귀 없이 장거리 의존성을 모델링할 수 있도록 한다.
  • 시간적 인코딩(Eq. 2)을 사용하여 상대적 시간 간격을 어텐션 메커니즘에 통합함으로써 시간 역학을 유지한다.
  • Vaswani 등(2017)의 방법을 따르며, 순서 정보를 유지하기 위해 순서 인코딩을 적용하여 트랜스포머 아키텍처를 지원한다.
  • 관측된 이벤트 시계열에 대해 최대 우도 추정을 통해 엔드 투 엔드로 학습된다.
  • 구조적 데이터의 경우, THP는 전체 어텐션(THP-F) 또는 이웃 기반 어텐션(THP-S)을 통해 관계 정보를 통합하며, 공간적 근접성을 기반으로 정보 흐름을 제약한다.
  • 이 프레임워크는 비구조적 및 그래프 기반의 이벤트 시계열을 모두 지원하여 복잡한 의존성을 영리하게 모델링할 수 있다.

실험 결과

연구 질문

  • RQ1자기주의 어텐션 기반 아키텍처가 RNN 기반 모델보다 이벤트 시계열 데이터에서 장기적 의존성을 더 잘 포착할 수 있는가?
  • RQ2Transformer Hawkes Process는 NHP 및 TSES와 같은 기존 모델보다 더 높은 우도 및 예측 정확도를 달성하는가?
  • RQ3관계적 또는 구조적 지식의 통합이 다중 노드 이벤트 시스템에서 모델링 성능에 어떤 영향을 미치는가?
  • RQ4자기주의 어텐션 및 시간적 인코딩과 같은 아키텍처 구성 요소가 모델 성능에 미치는 영향은 무엇인가?
  • RQ5RNN 기반 기준 모델 대비 THP의 모델 크기 및 학습 속도 측면에서의 확장성은 어떠한가?

주요 결과

  • 911-Calls 및 지진 데이터셋에서 THP는 NHP 및 TSES보다 유의미하게 높은 로그 우도와 이벤트 예측 정확도를 기록하였으며, Retweets 데이터셋에서는 최대 3.5개의 로그 우도 포인트 향상이 있었다.
  • Retweets 데이터셋에서 시간적 인코딩을 적용한 THP는 로그 우도 -2.03을 기록한 반면, NHP는 -5.60을 기록하여 상당한 성능 향상을 입증하였다.
  • 100k~200k 파라미터를 사용한 THP는 NHP(1M 파라미터) 및 TSES(2M 파라미터)를 모두 초월하여 더 뛰어난 파라미터 효율성을 보였다.
  • NHP 대비 최대 2.56배의 학습 속도 향상을 기록하였으며, 다양한 모델 크기에서 일관된 성능을 유지하였다.
  • THP-S(이웃 기반 어텐션을 갖춘 구조적-THP)는 THP-F(전체 어텐션)보다 이벤트 예측 성능이 뛰어나며, 특히 데이터가 적은 환경에서 임의의 어텐션 의존성을 줄여 성능 향상을 이룬다.
  • 제거 실험 결과, 자기주의 어텐션과 시간적 인코딩이 모두 핵심 구성 요소임을 확인하였으며, 이들의 제거는 로그 우도 성능에 심각한 하락을 초래하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.