Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Pollution Level Using Random Forest: A Case Study of Marilao River in Bulacan Province, Philippines

Jayson M. Victoriano, Manuel Luis C. Delos Santos|RePEc: Research Papers in Economics|Feb 12, 2022
Water Quality Monitoring Technologies参考文献 4被引用数 4
ひとこと要約

本研究では、フィリピン・マリラオ川の水質パラメータ(DO、pH、BOD、TSS)を用いて、ランダムフォレストに基づく機械学習モデルを開発し、汚染レベルを予測した。モデルは91.75%の正確性と0.8115のカッパ値を達成し、汚染状態を緑(通常)、黄(平均)、オレンジ(汚染)、赤(重度汚染)に分類する上で強力な予測性能を示した。

ABSTRACT

This study aims to predict the pollution level that threatens the Marilao River, located in the province of Bulacan, Philippines. The inhabitants of this area are now being exposed to pollution. Contamination of this waterway comes from both formal and informal industries, such as a used lead-acid battery, open dumpsites metal refining, and other toxic metals. Using various water quality parameters like Dissolved Oxygen (DO), Potential of Hydrogen (pH), Biochemical Oxygen Demand (BOD) and Total Suspended Solids (TSS) were the basis for predicting the pollution level. This study used the Data Mining technique based on the sample data collected from January of 2013 to November of 2017. These were used as a training data and test results to predict the river condition with its corresponding pollution level classification indicated with the used of colors such as Green for Normal, Yellow for Average, Orange for Polluted and Red for Highly Polluted. The model got an accuracy of 91.75% with a Kappa value of 0.8115, interpreted as Strong in terms of the level of agreement.

研究の動機と目的

  • マリラオ川はフィリピン・ブラークラーン州の重要な水資源であるが、汚染懸念が高まっているため、これを解決すること。
  • 鉛蓄電池のリサイクルやオープンダンプ場を含む、公式および非公式の工業活動が川の水質に与える影響を分析すること。
  • 歴史的水質データを用いた機械学習により、汚染レベルを分類する予測モデルを開発すること。
  • 行動可能な環境モニタリングのため、色分けされた汚染分類システム(緑、黄、オレンジ、赤)を提供すること。
  • ランダムフォレストアルゴリズムが、高い正確性と良好な一致指標を示して汚染レベルを予測する能力を評価すること。

提案手法

  • 2013年1月から2017年11月までの間、溶解酸素(DO)、pH、生物学的酸素要求量(BOD)、全懸濁固形物(TSS)の主な水質パラメータについて、水質データを収集および分析した。
  • 機械学習モデリングのためのデータ前処理とデータ構造化に、データマイニング技術を適用した。
  • 歴史的データセットを用いてランダムフォレスト分類器を訓練し、入力水質パラメータに基づいて汚染レベルを予測した。
  • 色分けラベルを用いて、汚染レベルを4つのカテゴリーに分類した:緑(通常)、黄(平均)、オレンジ(汚染)、赤(重度汚染)。
  • 予測の信頼性と評価者間一致度を評価するため、正確性とケンダールのカッパ係数を用いてモデルの性能を評価した。
  • モデルの堅牢性と汎化性能を確保するため、10分割交差検証を用いた。

実験結果

リサーチクエスチョン

  • RQ1DO、pH、BOD、TSSといった標準的な水質パラメータを用いて、ランダムフォレストモデルはマリラオ川の汚染レベルを正確に予測できるか?
  • RQ2ランダムフォレストアルゴリズムは、DO、pH、BOD、TSSに基づいて、汚染レベルを明確なカテゴリー(緑、黄、オレンジ、赤)に分類するのにどの程度効果的か?
  • RQ3ケンダールのカッパ統計量で測定した場合、予測された分類と実際の分類との一致度はどの程度か?
  • RQ4機械学習モデルは、工業化地域における河川汚染の環境モニタリングおよび早期警報システムをどの程度支援できるか?
  • RQ5選択された水質パラメータ(DO、pH、BOD、TSS)は、モデルの予測力にどの程度寄与しているか?

主な発見

  • ランダムフォレストモデルは、テストデータセットで91.75%の予測正確性を達成し、強力な予測能力を示した。
  • モデルのケンダールのカッパ値は0.8115であり、予測された分類と実際の分類との間に「強い」一致があると解釈された。
  • モデルは、汚染レベルを4つの明確なカテゴリーに分類することができた:緑(通常)、黄(平均)、オレンジ(汚染)、赤(重度汚染)。
  • DO、pH、BOD、TSSを入力特徴量として含めることで、モデルの予測性能が顕著に向上した。
  • 10分割交差検証を通じて、モデルは堅牢性と汎化性能を示し、データ分割にかかわらず一貫した結果を示した。
  • 本研究は、特にデータが乏しく工業的影響を受ける河川系において、機械学習、特にランダムフォレストが、環境汚染予測のための実用的で効果的なツールであることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。