Skip to main content
QUICK REVIEW

[論文レビュー] Driving with Data: Modeling and Forecasting Vehicle Fleet Maintenance in Detroit

Josh Gardner, Danai Koutra|arXiv (Cornell University)|Oct 18, 2017
Tensor decomposition and applications参考文献 19被引用数 6
ひとこと要約

本稿では、2010年から2017年までの2,500台以上の車両のデータセットを用いて、テンソル分解、シーケンスマイニング、LSTMニューラルネットワークを活用したデータ駆動型アプローチを提案し、デトロイトの車両群の保守をモデル化・予測する。複雑な時間的および車種・モデル固有の保守パターンが存在し、それらを効果的に予測可能であることが示された。軽量なLSTMモデルを用いてテストのパープレキシティは44.6に達し、ランダムベースラインの260±40を上回った。

ABSTRACT

The City of Detroit maintains an active fleet of over 2500 vehicles, spending an annual average of over \$5 million on new vehicle purchases and over \$7.7 million on maintaining this fleet. Understanding the existence of patterns and trends in this data could be useful to a variety of stakeholders, particularly as Detroit emerges from Chapter 9 bankruptcy, but the patterns in such data are often complex and multivariate and the city lacks dedicated resources for detailed analysis of this data. This work, a data collaboration between the Michigan Data Science Team (http://midas.umich.edu/mdst) and the City of Detroit's Operations and Infrastructure Group, seeks to address this unmet need by analyzing data from the City of Detroit's entire vehicle fleet from 2010-2017. We utilize tensor decomposition techniques to discover and visualize unique temporal patterns in vehicle maintenance; apply differential sequence mining to demonstrate the existence of common and statistically unique maintenance sequences by vehicle make and model; and, after showing these time-dependencies in the dataset, demonstrate an application of a predictive Long Short Term Memory (LSTM) neural network model to predict maintenance sequences. Our analysis shows both the complexities of municipal vehicle fleet data and useful techniques for mining and modeling such data.

研究の動機と目的

  • デトロイトの2,500台を超える車両群の自治体保守データに隠された時間的および多次元的パターンを解明すること。
  • PARAFACを用いたテンソル分解を適用し、車両、システム、時間の間の関係を可視化すること。
  • 微分的シーケンスマイニングを用いて、車両のメーカーおよびモデルごとに統計的に特徴的な保守シーケンスを同定すること。
  • 将来の保守イベントを予測するための予測モデルを構築・評価すること。
  • データサイエンスが公共部門の車両管理においてコスト削減と運用効率化の観点から実現可能で価値があることを示すこと。

提案手法

  • 車両×システム×時間のデータテンソルに対して並列要因(PARAFAC)テンソル分解を適用し、多次元保守パターンを抽出・可視化した。
  • 微分的シーケンスマイニングを用いて、車両のメーカーおよびモデルごとにグループ化された頻出で統計的に特徴的な保守シーケンスを同定した。
  • 長短期記憶(LSTM)ニューラルネットワークモデルを構築し、履歴パターンに基づいて車両保守イベントのシーケンスを予測した。
  • 時間的依存性をモデル化するため、50種類の固有の車両システムタイプのシーケンスを用い、スライディングウィンドウアプローチを採用した。
  • パープレキシティを指標としてモデルの性能を評価し、システム頻度に比例する確率を割り当てるランダムベースラインモデルと比較した。
  • データクリーニング、テンソル分解、モデルトレーニングにオープンソースツール(MATLAB、Python、R)を活用し、コードを公開した。

実験結果

リサーチクエスチョン

  • RQ1テンソル分解を用いて、自治体車両保守データに内在する複雑な多次元的パターンを発見・可視化できるか?
  • RQ2車両メーカーおよびモデルごとに、統計的に特徴的な保守シーケンスが存在するか。また、それらはシーケンスマイニングによって同定可能か?
  • RQ3実世界の自治体車両記録のやや小さいデータセットのみを用いても、LSTMのようなディープラーニングモデルが将来的な保守イベントを効果的に予測できるか?
  • RQ4LSTMモデルの予測性能は、シーケンスの予測可能性という観点から、単純なランダムベースラインモデルと比較してどうなるか?
  • RQ5データサイエンス技術は、観察的で不完全な公共部門データから、どれほど実行可能なインサイトを明らかにできるか?

主な発見

  • PARAFACテンソル分解により、車両タイプ、保守システム、時間的トレンドの間の複雑で時間依存する関係が明確に可視化され、車両群全体のパターンが把握された。
  • 微分的シーケンスマイニングにより、統計的に有意で特徴的な、車両メーカーおよびモデルごとにグループ化された保守シーケンスが同定され、明確な修理行動の差異が確認された。
  • LSTMモデルはテストのパープレキシティが44.6に達し、ランダムベースラインモデルのパープレキシティ($260 \pm 40$)を著しく下回り、優れた予測能力を示した。
  • データセットのサイズが小さく、実世界の不具合(例:一貫性のないコード、欠損データ)があるにもかかわらず、保守シーケンスの構造的性質のおかげで、LSTMモデルは高い予測可能性を示した。
  • 限られたリソースの中でも、ドメインに配慮したデータクリーニングを組み合わせることで、自治体データから実行可能なインサイトを抽出できることが確認された。
  • オープンソースのコードおよび手法は、多次元的かつ時間依存的なプロセスを含む他の市民データ分野へも応用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。