Skip to main content
QUICK REVIEW

[論文レビュー] On feature selection and evaluation of transportation mode prediction strategies

Mohammad Etemad, Amílcar Soares|arXiv (Cornell University)|Aug 9, 2018
Human Mobility and Location-Based Analysis参考文献 25被引用数 4
ひとこと要約

本論文は、トラジェクトリーベースの移動モード予測を最適化するため、ラッパー法と情報理論的手法を組み合わせた特徴選択フレームワークを提案する。ランダムフォレストを用い、上位20の特徴を用いることで、endo2016deepに対して69.5%の精度(p=0.0431)、dabiri2018inferringに対して88.5%の精度(p=0.0796)を達成し、両者を上回る性能を発揮するとともに、モデルの解釈可能性と低い計算コストを確保した。

ABSTRACT

Transportation modes prediction is a fundamental task for decision making in smart cities and traffic management systems. Traffic policies designed based on trajectory mining can save money and time for authorities and the public. It may reduce the fuel consumption and commute time and moreover, may provide more pleasant moments for residents and tourists. Since the number of features that may be used to predict a user transportation mode can be substantial, finding a subset of features that maximizes a performance measure is worth investigating. In this work, we explore wrapper and information retrieval methods to find the best subset of trajectory features. After finding the best classifier and the best feature subset, our results were compared with two related papers that applied deep learning methods and the results showed that our framework achieved better performance. Furthermore, two types of cross-validation approaches were investigated, and the performance results show that the random cross-validation method provides optimistic results.

研究の動機と目的

  • トラジェクトリーベースの移動モード予測のための最適な特徴サブセットを、特徴選択手法を用いて同定すること。
  • ランダムフォレストやXGBoostを含む複数の分類器の性能を、トラジェクトリーデータからの移動モード予測において比較すること。
  • 最先端の深層学習モデル(endo2016deepおよびdabiri2018inferring)と比較して、提案フレームワークの精度および計算効率を評価すること。
  • クロスバリデーション戦略(特にランダム vs. ユーザー指向のクロスバリデーション)が、モデル評価の信頼性に与える影響を調査すること。
  • エンドツーエンドの表現学習ではなく、手作業で作成された人間が読み取り可能な特徴を用いることで、モデルの解釈可能性を確保すること。

提案手法

  • ラッパー法(逐次前向き選択)と情報理論的手法(相互情報量に基づくもの)を用い、最も関連性の高いトラジェクトリーフィーチャーを順位付け・選択した。
  • 移動行動を表現するため、スピードの百分位数(例:$F_{p90}^{speed}$)、距離、加速度メトリクスなどを含む70の手作業で作成されたトラジェクトリーフィーチャーを用いた。
  • モデルの汎化性能を評価するために、5分割交差検証とユーザー指向の交差検証を適用し、ユーザーが1つの分割にのみ含まれるようにした。
  • ラッパー法から上位20の特徴を選出し、最終評価にはランダムフォレスト分類器(50エスティメーター)を用いた。
  • 基準モデル(endo2016deepおよびdabiri2018inferringから得たもの)との性能を統計的に比較するために、一標本ウィルコクソン符号順位検定を実施した。
  • データ漏洩を防ぐために、テスト段階でノイズ除去を回避し、現実的な性能推定を保証した。

実験結果

リサーチクエスチョン

  • RQ1特徴選択手法と分類器のどの組み合わせが、トラジェクトリーデータからの移動モード予測において最も高い精度を達成するか?
  • RQ2提案モデルの性能は、最先端の深層学習モデル(endo2016deepおよびdabiri2018inferring)と比較して、精度および計算コストの観点でどのように異なるか?
  • RQ3異なるクロスバリデーション戦略(ランダム vs. ユーザー指向)が、移動モード予測モデルの評価に与える影響は何か?
  • RQ4どのトラジェクトリーフィーチャーが移動モードに対して最も予測力を持っており、なぜノイズに対して頑健なのか?
  • RQ5解釈可能な手作業特徴が、このタスクにおいてエンドツーエンドで学習された表現よりも優れた性能を発揮できるか?

主な発見

  • ランダムフォレスト分類器が、評価された分類器の中で最高の精度(69.5%)を達成し、SVMを顕著に上回り、XGBoostと同等の性能を示した。
  • ラッパー法により、$F_{p90}^{speed}$ が最も重要な特徴であると特定された。これは、パーセンタイルに基づく計算により外れ値に対して頑健である。
  • 提案モデルはテストセットで69.5%の精度を達成し、endo2016deepの67.9%(p=0.0431)を顕著に上回り、優れた性能を示した。
  • dabiri2018inferringベンチマークでは88.5%の精度を達成し、彼らが報告した84.8%(p=0.0796)を上回ったが、p<0.05の有意水準では有意ではなかった。
  • ユーザー指向のクロスバリデーションは、より現実的で保守的な性能推定をもたらしたのに対し、ランダムなクロスバリデーションはユーザー間のデータ漏洩により、楽観的な結果をもたらした。
  • 本フレームワークは、深層学習モデルに代わるより解釈可能で計算コストが低い代替手段を提供し、人間が理解しやすく検証しやすい手作業特徴を備えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。