[논문 리뷰] Predicting Pollution Level Using Random Forest: A Case Study of Marilao River in Bulacan Province, Philippines
이 연구는 필리핀 마리아라오 강의 오염 수준을 예측하기 위해 랜덤 포레스트 기반 기계학습 모델을 개발한다. 수질 매개변수(DO, pH, BOD, TSS)를 사용하여 모델은 91.75%의 정확도와 0.8115의 코HEN의 카파 값을 기록했으며, 이는 오염 수준을 초록색(정상), 노랑색(평균), 주황색(오염됨), 빨강색(심각하게 오염됨)으로 분류하는 데 있어 강력한 예측 성능을 나타낸다.
This study aims to predict the pollution level that threatens the Marilao River, located in the province of Bulacan, Philippines. The inhabitants of this area are now being exposed to pollution. Contamination of this waterway comes from both formal and informal industries, such as a used lead-acid battery, open dumpsites metal refining, and other toxic metals. Using various water quality parameters like Dissolved Oxygen (DO), Potential of Hydrogen (pH), Biochemical Oxygen Demand (BOD) and Total Suspended Solids (TSS) were the basis for predicting the pollution level. This study used the Data Mining technique based on the sample data collected from January of 2013 to November of 2017. These were used as a training data and test results to predict the river condition with its corresponding pollution level classification indicated with the used of colors such as Green for Normal, Yellow for Average, Orange for Polluted and Red for Highly Polluted. The model got an accuracy of 91.75% with a Kappa value of 0.8115, interpreted as Strong in terms of the level of agreement.
연구 동기 및 목표
- 필리핀 루카산 주의 중요한 수자원인 마리아라오 강의 오염 증가 문제를 다루기 위해.
- 수은 배터리 재활용 및 개방형 매립지와 같은 공식 및 비공식 산업 활동이 강 수질에 미치는 영향을 분석하기 위해.
- 역사적 수질 데이터를 기반으로 기계학습을 사용하여 오염 수준을 분류하는 예측 모델을 개발하기 위해.
- 실질적인 환경 모니터링을 위한 색상 기반 오염 분류 체계(Green, Yellow, Orange, Red)를 제공하기 위해.
- 랜덤 포레스트 알고리즘이 고정확도와 강한 일致도 지표를 통해 오염 수준을 예측하는 데 얼마나 효과적인지 평가하기 위해.
제안 방법
- 2013년 1월부터 2017년 11월까지의 주요 매개변수인 용존산소(DO), pH, 생화학적 산소 요구량(BOD), 총 휘발성 고형물(TSS)에 대한 수질 데이터를 수집하고 분석하였다.
- 기계학습 모델링을 위해 데이터를 전처리하고 구조화하기 위해 데이터 마이닝 기법을 적용하였다.
- 기존 데이터셋을 사용하여 입력 수질 매개변수에 기반해 오염 수준을 예측하는 데 목적이 있는 랜덤 포레스트 분류기를 훈련시켰다.
- 예측된 오염 수준을 초록색(정상), 노랑색(평균), 주황색(오염됨), 빨강색(심각하게 오염됨)으로 분류하여 색상 기반 레이블을 사용하였다.
- 정확도와 코헨의 카파 계수를 사용하여 모델 성능을 평가하여 예측 신뢰도와 평가자 간 일치도를 분석하였다.
- 모델의 강건성과 일반화 능력을 확보하기 위해 10겹 교차검증 방법을 사용하였다.
실험 결과
연구 질문
- RQ1표준 수질 매개변수를 사용하여 랜덤 포레스트 모델이 마리아라오 강의 오염 수준을 정확하게 예측할 수 있는가?
- RQ2랜덤 포레스트 알고리즘이 DO, pH, BOD, TSS를 기반으로 오염 수준을 초록색, 노랑색, 주황색, 빨강색으로 분류하는 데 얼마나 효과적인가?
- RQ3코펜의 카파 통계량으로 측정한 예측된 오염 분류와 실제 분류 간의 일치 수준은 어느 정도인가?
- RQ4기계학습 모델은 산업 지역에서 강 오염에 대한 환경 모니터링 및 조기 경고 시스템을 얼마나 잘 지원할 수 있는가?
- RQ5선택된 수질 매개변수(DO, pH, BOD, TSS)는 모델의 예측 성능에 어떤 기여를 하는가?
주요 결과
- 랜덤 포레스트 모델은 테스트 데이터셋에서 91.75%의 예측 정확도를 기록하여 강력한 예측 능력을 보였다.
- 모델의 코헨의 카파 값은 0.8115로, 예측된 오염 분류와 실제 분류 간 '강한' 일치도를 나타내었다.
- 모델은 오염 수준을 네 가지 명확한 범주로 성공적으로 분류하였다: 초록색(정상), 노랑색(평균), 주황색(오염됨), 빨강색(심각하게 오염됨).
- DO, pH, BOD, TSS를 입력 특성로 포함시킴으로써 모델의 예측 성능에 상당한 기여가 있었다.
- 10겹 교차검증을 통해 모델는 데이터 분할 간 일관된 결과를 보이며 강건성과 일반화 능력을 입증하였다.
- 본 연구는 기계학습, 특히 랜덤 포레스트가 데이터 부족 및 산업 영향을 받는 강 수계에서 환경 오염 예측에 실용적이고 효과적인 도구임을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.