[论文解读] Clustering Methods for Electricity Consumers: An Empirical Study in Hvaler-Norway
本文提出一种基于代表性负荷形态(RLPs)的数据驱动聚类方法,利用挪威黑瓦勒(Hvaler)地区细粒度的小时用电数据,自动对电力用户进行分类。自组织映射(SOM)与k-means结合的方法在有效识别异常值(如小木屋、路灯)并分组具有相似用电行为的用户方面优于其他方法,而内部有效性指数在评估聚类质量时存在误导性。
The development of Smart Grid in Norway in specific and Europe/US in general will shortly lead to the availability of massive amount of fine-grained spatio-temporal consumption data from domestic households. This enables the application of data mining techniques for traditional problems in power system. Clustering customers into appropriate groups is extremely useful for operators or retailers to address each group differently through dedicated tariffs or customer-tailored services. Currently, the task is done based on demographic data collected through questionnaire, which is error-prone. In this paper, we used three different clustering techniques (together with their variants) to automatically segment electricity consumers based on their consumption patterns. We also proposed a good way to extract consumption patterns for each consumer. The grouping results were assessed using four common internal validity indexes. We found that the combination of Self Organizing Map (SOM) and k-means algorithms produce the most insightful and useful grouping. We also discovered that grouping quality cannot be measured effectively by automatic indicators, which goes against common suggestions in literature.
研究动机与目标
- 为解决智能电网中基于人口统计特征的用户细分方法存在的误差多、过时等问题。
- 仅基于用户的用电模式自动分类电力用户,避免依赖问卷调查的人口统计数据。
- 评估多种聚类算法在识别有意义用户群体方面的有效性,尤其关注区分永久住户、小木屋用户和照明用户的能力。
- 评估常用内部有效性指数在选择电力消费数据聚类最优解时的可靠性。
- 为电力运营商提供一种实用、数据驱动的方法,以基于实际用电行为设计定制化电价和能源服务。
提出的方法
- 通过平均并归一化每位用户在24小时周期内的小时用电数据,提取代表性负荷形态(RLPs)。
- 应用八种聚类技术:不同链接方法的层次聚类(HC)(A2、AC、W2、S5)、自组织映射(SOM)、k-means(KM)及其变体稀疏k-means(SKM)。
- 使用四种内部有效性指数——卡林斯基-哈拉巴兹指数(CDI)、戴维斯-布尔丁指数(BDI)、邓恩指数(DI)和修正指数(MIA)——评估聚类质量。
- 通过分析聚类组成评估聚类结果,识别季节性变化、峰值时间及负荷大小等模式。
- 从视觉和定量两方面比较聚类结果,重点关注聚类的紧凑性、可区分性及可解释性。
- 在不同聚类数(K=20)下进行实验,评估所得群体的稳定性和意义性。
实验结果
研究问题
- RQ1基于RLPs的聚类能否有效从原始用电数据中识别出小木屋、永久住户和路灯等不同用户类型?
- RQ2在挪威黑瓦勒的真实用电数据集中,不同聚类算法(如SOM、k-means、层次聚类)在分组具有相似负荷模式的用户方面表现如何?
- RQ3标准内部有效性指数(CDI、MDI、BDI、MIA)在电力用户细分中在多大程度上准确反映聚类结果的质量?
- RQ4SOM与k-means结合是否能产生比独立方法或其他聚类变体更具可解释性和意义的聚类?
- RQ5自动聚类方法是否能相比传统基于人口统计的用户细分方法减少误分类错误?
主要发现
- SOM-k-means组合产生了最具洞察力的聚类结果,成功将异常值(如小木屋,例如第4、5、7类)和照明用户(第7类)分离为独立且可解释的聚类。
- HC-Sx方法倾向于将异常值孤立为单例或极小聚类,而KM、SKM和HC-W2方法则将相似模式混合于难以区分的聚类中,降低了可解释性。
- 内部有效性指数(CDI、MDI、BDI、MIA)强烈偏向于将异常值孤立的聚类解,未能充分惩罚大而嘈杂或重叠的聚类。
- SKM方法产生的聚类紧凑性差且难以区分,将相似行为的RLPs分散到多个无法区分的类别中。
- 结果表明,使用这些指数自动选择最优聚类数量或方法并不可靠;必须结合上下文进行人工验证。
- 本研究证明,基于RLP的聚类在识别季节性、行为模式及使用模式相关的用户群体方面是有效的,尤其在小木屋使用率较高的地区(如黑瓦勒)更具优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。