Skip to main content
QUICK REVIEW

[논문 리뷰] Machine learning modeling for time series problem: Predicting flight ticket prices

Jun Lu|arXiv (Cornell University)|2017. 05. 19.
Imbalanced Data Classification Techniques참고 문헌 6인용 수 9
한 줄 요약

이 논문은 103일 간의 8개 노선에서 수집한 시계열 데이터를 사용하여 기계학습 기반으로 항공권 구매 시점을 예측하는 방법을 제안한다. 특정 문제(역사적 데이터 존재)에 대해 AdaBoost-결정트리 분류기를 적용하여 무작위 구매 대비 61.35% 향상된 성능을 달성하였으며, 새로운 노선에 대해서는 HMM 시퀀스 분류를 통해 역사적 데이터 없이도 무작위 구매 대비 31.71% 향상된 성능을 기록하였다.

ABSTRACT

Machine learning has been used in all kinds of fields. In this article, we introduce how machine learning can be applied into time series problem. Especially, we use the airline ticket prediction problem as our specific problem. Airline companies use many different variables to determine the flight ticket prices: indicator whether the travel is during the holidays, the number of free seats in the plane etc. Some of the variables are observed, but some of them are hidden. Based on the data over a 103 day period, we trained our models, getting the best model - which is AdaBoost-Decision Tree Classification. This algorithm has best performance over the observed 8 routes which has 61.35$\%$ better performance than the random purchase strategy, and relatively small variance over these routes. And we also considered the situation that we cannot get too much historical datas for some routes (for example the route is new and does not have historical data) or we do not want to train historical data to predict to buy or wait quickly, in which problem, we used HMM Sequence Classification based AdaBoost-Decision Tree Classification to perform our prediction on 12 new routes. Finally, we got 31.71$\%$ better performance than the random purchase strategy.

연구 동기 및 목표

  • 기존 가격 데이터를 바탕으로 항공권 최적 구매 시점을 예측할 수 있는 기계학습 모델을 개발하는 것.
  • 역사적 데이터가 없거나 부족한 신규 노선이나 데이터가 적은 노선에서의 항공권 가격 예측 과제를 해결하는 것.
  • 항공 운임 예측의 시계열 예측에 적합한 다양한 분류 및 회귀 모델을 비교하는 것.
  • 다양한 항공 노선에 걸쳐 예측 분산을 줄이고 모델의 강건성을 향상시키는 것.
  • 기존 노선에서 사전에 학습된 지식을 활용하여 새로운 노선에서 신속하고 계산 비용이 낮은 예측을 가능하게 하는 일반화된 모델을 설계하는 것.

제안 방법

  • 2015년 11월에서 2016년 2월 사이에 웹 크롤링을 통해 수집한 8개 노선의 일일 항공권 가격 데이터를 103일 간의 데이터셋으로 사용하였다.
  • 모델의 강건성을 향상시키기 위해 K-평균 및 EM 알고리즘을 사용하여 이질치를 제거하였다.
  • 다수 클래스에 대한 편향을 방지하기 위해 무작위 오버샘플링을 통해 클래스 불균형 문제를 완화하였다.
  • 모델 성능 최적화를 위해 5개의 교차 검증 폴드를 기반으로 그리드 서치를 수행하여 하이퍼파라미터를 튜닝하였다.
  • 특정 문제(역사적 데이터 존재)에 대해 AdaBoost-결정트리 분류기를 적용하고, Q-러닝, 균일 블렌딩 및 기타 분류기들과 비교하였다.
  • 일반화 문제(역사적 데이터 없음)에 대해 HMM 시퀀스 분류를 사전에 학습된 AdaBoost-결정트리 모델과 융합하여 12개의 신규 노선에서의 예측을 수행하였다.

실험 결과

연구 질문

  • RQ1역사적 데이터가 있는 노선에서 최적의 항공권 구매 시점을 예측하는 데 가장 높은 성능을 보이는 기계학습 모델은 무엇인가?
  • RQ2다양한 가격 행동 패턴을 보이는 다양한 항공 노선에서 모델의 성능는 어떻게 변화하는가?
  • RQ3일반화된 모델은 역사적 데이터가 전혀 없는 신규 노선에 대해 최적의 구매 시점을 예측할 수 있는가?
  • RQ4역사적 데이터가 없는 신규 노선에서 일반화된 모델의 성능는 무작위 구매 및 기타 기준 모델과 비교해 볼 때 어떻게 되는가?
  • RQ5왜 이 시계열 예측 과제에서 분류 모델이 회귀 모델보다 성능이 뛰어나게 되는가?

주요 결과

  • 특정 문제에 대해 AdaBoost-결정트리 분류기가 가장 뛰어난 성능을 보였으며, 8개 노선에서 무작위 구매 전략 대비 61.35% 향상된 결과를 기록하였다.
  • 균일 블렌딩 분류기는 노선 간 변동성이 가장 낮아 높은 강건성을 보였으며, 다소 낮은 성능에도 불구하고 안정적인 성능을 보였다.
  • Q-러닝 방법은 AdaBoost-결정트리와 유사한 성능을 보였으며, 평균 성능는 55.11%로 중간 정도의 변동성을 보였다.
  • 일반화 문제에 대해 HMM 시퀀스 분류 기반 모델은 역사적 데이터가 없는 12개의 신규 노선에서 무작위 구매 대비 31.71% 향상된 성능을 기록하였다.
  • 두 노선(R3 및 R6)에서 일반화 설정에서 성능이 크게 하락(각각 71.69%에서 63.11%, 85.33%에서 0.54%로)하여, 제로샷 예측의 과제를 확인하였다.
  • 분류 모델은 회귀 모델에 비해 교차 검증 오차 및 정밀도에서 유의미하게 낮은 변동성을 보이며, 이 작업에 있어 더 뛰어난 안정성을 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.