Skip to main content
QUICK REVIEW

[논문 리뷰] The effect of dataset size and the process of big data mining for investigating solar-thermal desalination by using machine learning

Guilong Peng, Senshan Sun|arXiv (Cornell University)|2023. 07. 24.
Solar-Powered Water Purification MethodsEnergy인용 수 3
한 줄 요약

이 연구는 기계학습을 활용하여 태양열 담수화를 위한 최적화된 빅데이터 마이닝 파이프라인을 개발하였으며, 초수분산 냉각 커버를 통해 데이터 수집 시간을 83.3% 감소시켰고, 1,000개 이상의 고품질 데이터셋을 생성하였다. Random Forest 모델이 1,000개 이상의 데이터셋에서 다른 모델들을 능가하였으며, 외삽 예측에서 최소 평균 상대 예측 오차 4%를 달성하였고, 데이터셋 범위가 특성 중요도에 상당한 영향을 미치며, 가중치 값에 최대 115%의 변동을 보였음을 규명하였다.

ABSTRACT

Machine learning's application in solar-thermal desalination is limited by data shortage and inconsistent analysis. This study develops an optimized dataset collection and analysis process for the representative solar still. By ultra-hydrophilic treatment on the condensation cover, the dataset collection process reduces the collection time by 83.3%. Over 1,000 datasets are collected, which is nearly one order of magnitude larger than up-to-date works. Then, a new interdisciplinary process flow is proposed. Some meaningful results are obtained that were not addressed by previous studies. It is found that Radom Forest might be a better choice for datasets larger than 1,000 due to both high accuracy and fast speed. Besides, the dataset range affects the quantified importance (weighted value) of factors significantly, with up to a 115% increment. Moreover, the results show that machine learning has a high accuracy on the extrapolation prediction of productivity, where the minimum mean relative prediction error is just around 4%. The results of this work not only show the necessity of the dataset characteristics' effect but also provide a standard process for studying solar-thermal desalination by machine learning, which would pave the way for interdisciplinary study.

연구 동기 및 목표

  • 태양열 담수화 분야의 기계학습 응용에서 데이터 부족과 분석의 일관성 부족 문제를 해결하기 위해.
  • 실험적 태양식 담수기 연구에서 데이터셋 수집에 소요되는 시간을 줄이기 위해.
  • 태양열 담수화 연구를 위한 표준화되고 다학제적 빅데이터 마이닝 프로세스를 개발하기 위해.
  • 데이터셋 크기와 범위가 기계학습 모델 성능 및 특성 중요도에 미치는 영향을 조사하기 위해.
  • 학습된 모델을 활용해 훈련 데이터 범위를 초월한 담수화 생산성 예측을 정확하게 수행할 수 있도록 하기 위해.

제안 방법

  • 냉각 커버에 초수분산 처리를 적용하여 응축 효율을 향상시키고 데이터 수집 속도를 증가시키기 위해.
  • 기존 연구들보다 약 10배 많아지는, 1,000개 이상의 실험 데이터셋을 최적화된 데이터 수집 프로토콜을 통해 수집하기 위해.
  • 실험 설계, 데이터 전처리, 기계학습 모델 평가를 통합한 새로운 다학제적 프로세스 플로우를 구현하기 위해.
  • 다양한 데이터셋 크기에서 예측 정확도와 계산 속도를 평가하기 위해 Random Forest, XGBoost 및 기타 모델을 사용하기 위해.
  • 특성 중요도를 분석하기 위해 순열 기반 방법을 활용하여 데이터셋 범위가 가중 특성 기여도에 미치는 영향을 평가하기 위해.
  • 저 평균 상대 예측 오차를 보이는 독립 테스트 세트를 사용하여 외삽 작업에서 모델 성능을 검증하기 위해.

실험 결과

연구 질문

  • RQ1데이터셋 크기가 태양열 담수화 예측에서 기계학습 모델의 성능과 선택에 미치는 영향은 어떠한가?
  • RQ2데이터셋의 범위가 기계학습 모델 내 입력 요소의 중요도 측정에 얼마나 큰 영향을 미치는가?
  • RQ3기계학습 모델이 훈련 데이터의 범위를 초월한 예측을 높은 정확도로 수행할 수 있는가?
  • RQ4정확도와 속도 측면에서 대규모 태양열 담수화 데이터셋에 가장 적합한 기계학습 모델은 무엇인가?
  • RQ5데이터 수집 과정을 어떻게 최적화하여 시간을 크게 줄이면서도 데이터 품질을 유지할 수 있는가?

주요 결과

  • 초수분산 처리로 기존 방법 대비 데이터 수집 시간이 83.3% 감소하였다.
  • 1,000개 이상의 고품질 데이터셋을 확보하였으며, 기존 연구 대비 약 10배 증가한 수준이다.
  • 1,000개 이상의 데이터셋에서 Random Forest 모델이 높은 정확도와 빠른 추론 속도를 제공하여 최적의 모델로 부상하였다.
  • 데이터셋 범위가 특성 중요도 값에 최대 115%까지 영향을 미쳐 데이터 분포에 매우 민감함을 확인하였다.
  • 기계학습 모델은 외삽 작업에서 최소 평균 상대 예측 오차 4%를 기록하여 강력한 일반화 능력을 입증하였다.
  • 이 연구는 태양열 담수화 연구 분야의 기계학습 응용을 위한 표준화되고 재현 가능한 프로세스 플로우를 수립하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.