Skip to main content
QUICK REVIEW

[论文解读] Predicting Climate Variability over the Indian Region Using Data Mining Strategies

M. Naresh Kumar|arXiv (Cornell University)|Sep 23, 2015
Climate variability and models参考文献 5被引用 3
一句话总结

本文提出了一种结合期望最大化(EM)聚类与支持向量机(SVM)回归的数据挖掘框架,用于预测印度的气候变异性。该方法优于k-means和线性回归,在山地地区实现1.19的均方根误差(RMSE),在亚热带湿润地区实现0.89的RMSE,同时识别出传统柯本分类法未能涵盖的喜马拉雅山麓新气候区。

ABSTRACT

In this paper an approach based on expectation maximization (EM) clustering to find the climate regions and a support vector machine to build a predictive model for each of these regions is proposed. To minimize the biases in the estimations a ten cross fold validation is adopted both for obtaining clusters and building the predictive models. The EM clustering could identify all the zones as per the Koppen classification over Indian region. The proposed strategy when employed for predicting temperature has resulted in an RMSE of $1.19$ in the Montane climate region and $0.89$ in the Humid Sub Tropical region as compared to $2.9$ and $0.95$ respectively predicted using k-means and linear regression method.

研究动机与目标

  • 通过使用数据挖掘技术开发稳健的区域建模方法,提升印度气候变异性预测能力。
  • 利用EM聚类从长期网格化气候数据中识别气候区域,避免初始聚类偏差。
  • 在预测精度方面,将所提出的EM-SVM框架与传统的k-means和线性回归方法进行比较。
  • 通过10折交叉验证验证模型,并利用不同气候区域的RMSE评估性能。
  • 通过识别与标准柯本身份分类不一致的新气候区域,探究气候变化的影响。

提出的方法

  • 对1948–2012年长期(1948–2012年)2.5°×2.5°网格化气候数据应用EM聚类,以识别同质性气候区域。
  • 使用高斯分布混合模型对聚类中心进行建模,通过迭代优化均值、协方差矩阵和先验概率。
  • 执行10折交叉验证,以确保RMSE估计的稳健性,并减少聚类与建模阶段的过拟合。
  • 针对每个气候区域分别构建SVM回归模型,使用历史气候变量作为预测因子。
  • 在j−p年份的数据上训练模型,并利用实际观测值验证未来p年份的预测结果。
  • 在每个网格点上计算预测与观测气温值之间的RMSE,以评估模型性能。

实验结果

研究问题

  • RQ1EM聚类能否有效识别出与柯本身份分类一致或更优的印度气候区域?
  • RQ2EM-SVM框架在预测区域气温变异性方面,相较于k-means和线性回归表现如何?
  • RQ3数据维度与数值精度对高维气候数据集中EM聚类性能有何影响?
  • RQ4所提出的方法是否能检测到由于气候变化而出现的新兴气候区域,例如喜马拉雅山麓的新区域?
  • RQ510折交叉验证在多大程度上减少了气候预测模型中RMSE估计的偏差?

主要发现

  • EM聚类成功识别出七个气候区域,其中包括一个新区域,涵盖北阿坎德邦、锡金邦和阿鲁纳恰尔邦,该区域与传统山地气候区明显不同。
  • 所提出的EM-SVM模型在山地地区实现了1.19的RMSE,显著低于k-means和线性回归的2.9 RMSE。
  • 在亚热带湿润地区,EM-SVM模型实现了0.89的RMSE,优于k-means和线性回归的0.95 RMSE。
  • EM-SVM框架在山地和亚热带湿润地区表现出更优性能,但随着数据维度增加,性能出现下降。
  • 预测2012年气温的空间分布图与绝对误差图证实了模型的准确性,稳定气候区的误差集中度较低。
  • 结果表明,气候变化可能正在改变区域气候模式,表现为喜马拉雅地区出现新的气候聚类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。