[論文レビュー] Safer Together: Machine Learning Models Trained on Shared Accident Datasets Predict Construction Injuries Better than Company-Specific Models
本研究では、9社の建設事故報告書(計57,000件)を統合して得た共通データセットを用いて訓練された機械学習モデルが、各社固有のモデルよりも、怪我の重症度、怪我の種別、事故の種別を予測する性能に優れていることを示している。複数の組織間で転移学習を活用することで、汎用モデルは平均でF1スコアが4.4(最大+15.3)向上し、平均して2.26個の追加される結果カテゴリを予測できる。これにより、個々の企業のデータやモデル訓練の必要性を減らしながら、より広範かつ実行可能な安全予測が可能になる。
In this study, we capitalized on a collective dataset repository of 57k accidents from 9 companies belonging to 3 domains and tested whether models trained on multiple datasets (generic models) predicted safety outcomes better than the company-specific models. We experimented with full generic models (trained on all data), per-domain generic models (construction, electric T&D, oil & gas), and with ensembles of generic and specific models. Results are very positive, with generic models outperforming the company-specific models in most cases while also generating finer-grained, hence more useful, forecasts. Successful generic models remove the needs for training company-specific models, saving a lot of time and resources, and give small companies, whose accident datasets are too limited to train their own models, access to safety outcome predictions. It may still however be advantageous to train specific models to get an extra boost in performance through ensembling with the generic models. Overall, by learning lessons from a pool of datasets whose accumulated experience far exceeds that of any single company, and making these lessons easily accessible in the form of simple forecasts, generic models tackle the holy grail of safety cross-organizational learning and dissemination in the construction industry.
研究の動機と目的
- 複数企業の統合された事故データを用いて訓練された汎用的機械学習モデルが、各社固有のモデルよりも建設現場の安全結果を予測する精度が優れているかどうかを評価すること。
- データ共有と集団知能の価値が、建設現場の怪我リスク予測の精度向上に寄与するかどうかを評価すること。
- 分野別モデルと完全汎用モデルのどちらがより効果的であるか、および汎用モデルと固有モデルをアンサンブル化することで性能が向上するかどうかを特定すること。
- 事故データが限られた中小企業が、汎用モデルを通じて高品質な安全予測にアクセスできるようにすること。
- 標準化された属性を用いた、スケーラブルでプライバシーを保護する組織間安全予測フレームワークを確立すること。
提案手法
- 本研究では、ルールと語彙ベースの検証済みNLPツールを用いて、物語形式の事故報告書から基本的な作業環境要因(例:床の物、工具、材料)を標準化された属性フレームワークで抽出した。
- 3つの分野(建設、電力送配電、石油ガス)にまたがる9社分の全データセットを、相互運用性とプライバシー保護を確保するため、共通の分類体系に統一した。
- 教師あり学習モデルを、3種類のデータセット(各社固有のデータセット、全企業を含む汎用データセット、分野別汎用データセット:建設、T&D、石油ガス)で訓練した。
- モデルの性能評価には、F1スコア、適合率、再現率、ROC曲線下の面積(AUC)を用い、妥当性を確保するためストラティファイド交差検証を実施した。
- 最適な重みを検証セット上で決定することで、重み付き平均を用いて汎用モデルと各社固有モデルの予測を統合したアンサンブルモデルを作成した。
- 最良の性能を示したモデルは、ハイパーパramータチューニングとモデルスタッキングを用いて選別され、全設定でランダムフォレスト、XGBoost、SVMを検証した。

実験結果
リサーチクエスチョン
- RQ1複数企業の共有事故データを用いて訓練された汎用モデルは、個々の企業のデータで訓練されたモデルよりも、建設現場の怪我の結果をより正確に予測できるか?
- RQ2汎用モデルによる性能向上は、怪我の重症度、怪我の種別、事故の種別といった異なる安全結果および分野にわたり一貫しているか?
- RQ3汎用モデルと各社固有モデルをアンサンブル化することで、単独で使用する場合よりも高い性能が得られるか?
- RQ4分野別汎用モデル(例:建設専用)は、全分野のデータで訓練された完全汎用モデルと同等の効果を発揮するか?
- RQ5アンサンブルモデルにおいて、データ量(汎用)とデータの関連性(固有)の最適なバランスは何か?
主な発見
- 57,000件の事故記錟を含む全データセットで訓練された汎用モデルは、82%の企業・分野・結果の組み合わせで各社固有モデルを上回り、平均でF1スコアが4.4(最大+15.3)向上した。
- 怪我の種別予測において、汎用モデルは平均でF1スコアが6.17向上し、建設分野では最大10.64の向上を記録した。
- 汎用モデルは、各社固有モデルよりも平均で2.26個の追加カテゴリを予測でき、最大で7個の追加カテゴリを達成した。これにより、より実行可能な安全予測が可能になった。
- 汎用モデルと固有モデルをアンサンブル化することで最高の性能が得られ、特に怪我の種別と重症度の予測では、両モデルタイプを組み合わせた場合にのみ最良の結果が得られた。
- 完全汎用モデルが常に分野別汎用モデルを上回るわけではなく、一部のケースでは分野別モデルが優れていた。これは、分野固有のパターンが重要であることを示している。
- XGBoostは、ランダムフォレストと同等の性能を示したが、モデルサイズが小さく、実装に適しているため、導入の観点で最も実用的であった。一方、ランダムフォレストは15の組み合わせのうち6つで最高の個別スコアを記録した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。