Skip to main content
QUICK REVIEW

[論文レビュー] Comparison Analysis of Tree Based and Ensembled Regression Algorithms for Traffic Accident Severity Prediction

Muhammad Umer, Saima Sadiq|arXiv (Cornell University)|Oct 27, 2020
Traffic Prediction and Management Techniques参考文献 26被引用数 15
ひとこと要約

本研究では、実世界の都市交通データを用いて、交通事故の深刻度を予測するための木構造型およびアンサンブル回帰アルゴリズムを評価している。ランダムフォレストは、20個の最も重要な特徴量を用いて97.4%の正確性、95.4%の精度、93.0%の再現率、94.2%のFスコアを達成し、深刻度予測の観点から最も効果的な手法であると判明した。

ABSTRACT

Rapid increase of traffic volume on urban roads over time has changed the traffic scenario globally. It has also increased the ratio of road accidents that can be severe and fatal in the worst case. To improve traffic safety and its management on urban roads, there is a need for prediction of severity level of accidents. Various machine learning models are being used for accident prediction. In this study, tree based ensemble models (Random Forest, AdaBoost, Extra Tree, and Gradient Boosting) and ensemble of two statistical models (Logistic Regression Stochastic Gradient Descent) as voting classifiers are compared for prediction of road accident severity. Significant features that are strongly correlated with the accident severity are identified by Random Forest. Analysis proved Random Forest as the best performing model with highest classification results with 0.974 accuracy, 0.954 precision, 0.930 recall and 0.942 F-score using 20 most significant features as compared to other techniques classification of road accidents severity.

研究の動機と目的

  • 機械学習を用いて事故深刻度の早期予測を可能にすることで、都市部の道路事故増加という課題に取り組む。
  • モデルの解釈可能性を通じて、交通事故深刻度に影響を与える最も重要な特徴量を特定する。
  • 木構造型アンサンブルモデル(ランダムフォレスト、アダブースト、エキストラツリー、勾配ブースティング)とハイブリッド統計モデルの性能を比較する。
  • 都市環境における事故深刻度レベルの正確で信頼性の高い予測を実現する最適な機械学習モデルを特定する。
  • 都市部の道路当局がデータドリブンで高精度な予測フレームワークを提供することで、交通安全性管理を支援する。

提案手法

  • 回帰ベースの深刻度分類に向け、木構造型アンサンブルモデル(ランダムフォレスト、アダブースト、エキストラツリー、勾配ブースティング)を適用した。
  • ベースラインモデルとして確率的勾配降下法(SGD)を用いたロジスティック回帰を採用し、投票分類器を組み合わせて統計モデルのアンサンブルを構築した。
  • ランダムフォレストの特徴量重要度順位を用いて特徴量選択を行い、事故深刻度の予測に最も寄与する20個の特徴量を特定した。
  • 標準分類指標(正確性、精度、再現率、F1スコア)を用いてモデルの性能を評価した。
  • 実世界の都市交通事故データセットを用いてモデルを学習・評価し、妥当性と一般化能力を確保した。
  • 10分割交差検証を用いて、信頼性の高い性能推定を実施し、過学習のリスクを低減した。

実験結果

リサーチクエスチョン

  • RQ1都市部の道路で交通事故の深刻度を予測する際、どの木構造型およびアンサンブル回帰モデルが最も優れた性能を示すか?
  • RQ2事故深刻度に最も影響を与える要因としての特徴量は何か?
  • RQ3ランダムフォレストの正確性、精度、再現率、F1スコアは、他のアンサンブルモデルと比べてどのように差がつくか?
  • RQ4確率的勾配降下法(SGD)を用いたロジスティック回帰のアンサンブルは、木構造型アンサンブルと同等の性能を達成できるか?
  • RQ5ランダムフォレストによる特徴量重要度順位は、事故深刻度を左右する要因を理解するのにどの程度役立つか?

主な発見

  • ランダムフォレストは97.4%の正確性を達成し、テストされたすべての他のモデルを顕著に上回った。
  • 95.4%の精度を記録し、深刻な事故の予測において強い陽性予測能力を示した。
  • 93.0%の再現率を達成し、実際の深刻な事故の大多数を効果的に特定できた。
  • 94.2%のF1スコアは、精度と再現率のバランスの良さを裏付け、モデルの頑健性を示している。
  • ランダムフォレストが特定した20個の最も重要な特徴量には、道路種別、天候状態、時間帯、車両種別などの変数が含まれた。
  • 確率的勾配降下法(SGD)を用いたロジスティック回帰のアンサンブルは、すべての木構造型モデルより劣った性能を示し、この文脈において木構造型アンサンブルの優位性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。