[论文解读] Predicting Pollution Level Using Random Forest: A Case Study of Marilao River in Bulacan Province, Philippines
本研究开发了一种基于随机森林的机器学习模型,利用水质参数(DO、pH、BOD、TSS)预测菲律宾马里拉奥河的污染水平。该模型实现了91.75%的准确率和0.8115的卡帕值,表明其在分类污染为绿色(正常)、黄色(一般)、橙色(污染)或红色(严重污染)方面具有出色的预测性能。
This study aims to predict the pollution level that threatens the Marilao River, located in the province of Bulacan, Philippines. The inhabitants of this area are now being exposed to pollution. Contamination of this waterway comes from both formal and informal industries, such as a used lead-acid battery, open dumpsites metal refining, and other toxic metals. Using various water quality parameters like Dissolved Oxygen (DO), Potential of Hydrogen (pH), Biochemical Oxygen Demand (BOD) and Total Suspended Solids (TSS) were the basis for predicting the pollution level. This study used the Data Mining technique based on the sample data collected from January of 2013 to November of 2017. These were used as a training data and test results to predict the river condition with its corresponding pollution level classification indicated with the used of colors such as Green for Normal, Yellow for Average, Orange for Polluted and Red for Highly Polluted. The model got an accuracy of 91.75% with a Kappa value of 0.8115, interpreted as Strong in terms of the level of agreement.
研究动机与目标
- 为应对菲律宾布拉卡南省重要水源马里拉奥河日益严重的污染问题。
- 分析正规和非正规工业活动(包括铅酸电池回收和露天垃圾填埋场)对河流水质的影响。
- 基于历史水质数据,利用机器学习开发预测模型以分类污染水平。
- 提供一种基于颜色的污染分类系统(绿色、黄色、橙色、红色),以支持环境监测的行动决策。
- 评估随机森林算法在实现高准确率和强一致性度量下预测污染水平的性能。
提出的方法
- 收集并分析了2013年1月至2017年11月期间的关键水质参数数据:溶解氧(DO)、pH、生化需氧量(BOD)和总悬浮固体(TSS)。
- 应用数据挖掘技术对数据集进行预处理和结构化,以支持机器学习建模。
- 使用历史数据集训练随机森林分类器,基于输入的水质参数预测污染水平。
- 采用颜色编码标签,将污染水平划分为四种类别:绿色(正常)、黄色(一般)、橙色(污染)和红色(严重污染)。
- 通过准确率和科恩卡帕系数评估模型性能,以衡量预测结果与实际分类之间的一致性及预测可靠性。
- 采用10折交叉验证方法,确保模型在整个数据集上的鲁棒性和泛化能力。
实验结果
研究问题
- RQ1基于标准水质参数,随机森林模型能否准确预测马里拉奥河的污染水平?
- RQ2随机森林算法在基于DO、pH、BOD和TSS参数将污染水平分类为不同类别(绿色、黄色、橙色、红色)方面有多高效?
- RQ3通过卡帕统计量衡量,预测与实际污染分类之间的一致性水平如何?
- RQ4机器学习模型在多大程度上可支持工业化地区河流污染的环境监测与早期预警系统?
- RQ5所选水质参数(DO、pH、BOD、TSS)对模型预测能力的贡献程度如何?
主要发现
- 该随机森林模型在测试数据集上实现了91.75%的预测准确率,表明其具备强大的预测能力。
- 模型的科恩卡帕值为0.8115,解释为预测与实际污染分类之间达到“强”一致性。
- 该模型成功地将污染水平划分为四种类别:绿色(正常)、黄色(一般)、橙色(污染)和红色(严重污染)。
- 将DO、pH、BOD和TSS作为输入特征显著提升了模型的预测性能。
- 通过10折交叉验证,模型展现出良好的鲁棒性和泛化能力,确保在不同数据划分中结果一致。
- 本研究证实,机器学习,尤其是随机森林,是数据稀缺且受工业影响的河流系统中环境污染预测的可行且高效工具。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。