Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking travel behavior modeling representations through embeddings

Francisco C. Pereira|arXiv (Cornell University)|2019. 08. 31.
Human Mobility and Location-Based Analysis참고 문헌 7인용 수 10
한 줄 요약

이 논문은 이동 행동 임베딩을 소개한다—즉, 이동 행동의 순서형 변수(예: 교통수단, 이동 목적, 교육 수준 등)를 연속적이고 저차원의 잠재 공간에 표현하는 데이터 기반, 신경망 기반 방법이다. 기존의 더미 변수나 주성분 분석(PCA) 인코딩과 달리, 임베딩은 미묘한 의미 관계를 포착하고, 외부 샘플 테스트에서 로그우도 측면에서 최대 60% 향상된 모델 성능을 달성한다. 이는 동시에 해석 가능성과 데이터셋 간 전이 학습을 가능하게 한다.

ABSTRACT

This paper introduces the concept of travel behavior embeddings, a method for re-representing discrete variables that are typically used in travel demand modeling, such as mode, trip purpose, education level, family type or occupation. This re-representation process essentially maps those variables into a latent space called the \emph{embedding space}. The benefit of this is that such spaces allow for richer nuances than the typical transformations used in categorical variables (e.g. dummy encoding, contrasted encoding, principal components analysis). While the usage of latent variable representations is not new per se in travel demand modeling, the idea presented here brings several innovations: it is an entirely data driven algorithm; it is informative and consistent, since the latent space can be visualized and interpreted based on distances between different categories; it preserves interpretability of coefficients, despite being based on Neural Network principles; and it is transferrable, in that embeddings learned from one dataset can be reused for other ones, as long as travel behavior keeps consistent between the datasets. The idea is strongly inspired on natural language processing techniques, namely the word2vec algorithm. Such algorithm is behind recent developments such as in automatic translation or next word prediction. Our method is demonstrated using a model choice model, and shows improvements of up to 60\% with respect to initial likelihood, and up to 20% with respect to likelihood of the corresponding traditional model (i.e. using dummy variables) in out-of-sample evaluation. We provide a new Python package, called PyTre (PYthon TRavel Embeddings), that others can straightforwardly use to replicate our results or improve their own models. Our experiments are themselves based on an open dataset (swissmetro).

연구 동기 및 목표

  • 기존의 순서형 변수 인코딩 기법(예: 더미 변수, 주성분 분석)이 직교성을 강제하고 의미 관계를 포착하지 못하는 데서 비롯되는 한계를 해결하기 위해.
  • 이동 행동 모델링에서 교통수단, 이동 목적, 교육 수준 등의 순서형 변수에 대해 데이터 기반, 해석 가능하고 전이 가능한 표현 방법을 개발하기 위해.
  • 신경망에서 유도된 임베딩이 기존의 표준 인코딩 기법보다 예측 성능이 뛰어나면서도 계수의 해석 가능성을 유지할 수 있음을 입증하기 위해.
  • 이동 행동 패턴이 일관된 경우, 한 데이터셋에서 학습한 임베딩을 다른 데이터셋에 재사용할 수 있도록, 데이터셋 간 호환성을 보장하기 위해.
  • 이동 행동 모델링 분야에서의 보급과 공동 개발을 촉진하기 위해 재사용 가능한 오픈소스 프레임워크(PyTre)를 제공하기 위해.

제안 방법

  • 자연어 처리(NLP)에서의 word2vec 원리를 이동 행동 모델링에 응용하여, 순서형 변수의 조밀한 벡터 표현(임베딩)을 학습하는 신경망을 훈련시키기.
  • 목표 변수(예: 교통수단 선택)를 임베딩된 순서형 입력 기반으로 예측하는 지도 학습 설정을 사용하며, 역전파를 통한 엔드 투 엔드 학습 방식으로 임베딩을 훈련시키기.
  • 각 카테고리(예: '학생', '취업자')를 의미적 유사성이 벡터 간 거리에 반영되는 학습된 잠재 공간 내의 조밀한 벡터로 표현하기.
  • 교차 엔트로피 손실 함수를 사용하여 임베딩 레이어를 훈련시키며, 최종 레이어는 선택 모델을 위한 소프트맥스 분류기로 구성하기.
  • 과적합을 방지하기 위해 정규화 및 조기 정지 기법을 적용하고, 방법의 확률적 성격을 감안해 검증 세트를 활용해 최고의 성능을 보인 모델 런을 선택하기.
  • 행동 패턴이 일관된 경우, 한 데이터셋에서 사전에 학습된 임베딩을 다른 데이터셋에 재사용함으로써 전이 학습을 가능하게 하기.

실험 결과

연구 질문

  • RQ1신경망 기반 임베딩은 기존의 더미 변수 인코딩에 비해 이동 수요 모델의 예측 성능을 향상시킬 수 있는가?
  • RQ2임베딩은 순서형 변수 간 의미적 관계(예: '학생'과 '취업자'는 '학생'과 '은퇴자'보다 더 유사함)를 어느 정도 잘 포착할 수 있는가?
  • RQ3임베딩은 데이터셋 간 전이가 가능한가? 즉, 재학습 없이도 학습된 표현을 재사용할 수 있는가?
  • RQ4임베딩 기반 모델과 기존의 더미 변수 모델 간 계수의 해석 가능성은 어떻게 비교되는가?
  • RQ5데이터셋 크기와 카테고리 분포는 임베딩 기반 모델의 안정성과 성능에 어떤 영향을 미치는가?

주요 결과

  • 임베딩 기반 모델은 외부 샘플 테스트에서 초기 모델 대비 최대 60% 향상된 로그우도를 기록하여, 기존의 더미 변수 인코딩에 비해 뚜렷이 뛰어난 성능을 보였다.
  • 외부 샘플 평가에서, 동일한 조건의 기존 모델 대비 임베딩 기반 모델이 최대 20% 높은 우도를 기록하였다.
  • 훈련의 확률적 성격으로 인해 런 간 성능 변동이 발생했으며, 300회의 런에서 테스트 로그우도가 -1365.0에서 -1466.0 사이로 변동되었다. 이에 따라 검증 세트를 통한 신중한 모델 선택이 필수적이었다.
  • 임베딩은 해석 가능성을 유지하였으며, 신경망 기반 구조임에도 불구하고 계수를 의미 있게 분석할 수 있었다.
  • 이 방법은 전이 가능성을 입증하였다. 한 데이터셋에서 학습된 임베딩은 행동 패턴이 일관된 경우 다른 데이터셋에 재사용 가능했다.
  • 제안된 PyTre 파이썬 패키지는 결과의 재현 및 확장이 용이하며, 공동 개발 기반의 공유 임베딩 자원 개발을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.