基于并行化K-means的综合能源服务客户识别
2021-04-08沈子垚袁晓玲
电力工程技术 2021年2期
沈子垚,袁晓玲
(河海大学能源与电气学院,江苏 南京 211100)
0 引言
随着综合能源服务的不断推广和互联网技术的高速发展,客户的档案信息与交易数据激增。传统的供电公司与综合能源服务企业积累了海量的营销数据。通过对营销数据的挖掘分析,能够获取客户的行为信息和状态数据,识别现有客户的特征与交易模式,预测综合能源服务需求,提高企业决策的前瞻性[1—3]。综合能源服务企业如想在激烈的竞争中保持优势,需要做好各类客户的识别与服务拓展工作。如企业能采取有效措施精准识别潜在客户,就能以较小的成本发展潜在客户,针对客户需求制定综合能源服务策略[4—8],提高投入产出比。文献[9]构建了数据仓库以整合数据资源并提取属性特征,通过信息匹配实现对潜在客户的识别。
传统的聚类算法在处理海量数据时,存在计算复杂度高和计算能力不足等问题。文献[10]优化了K-means聚类算法初始聚类中心的选取,并选用MapReduce并行编程方法,提高了传统聚类方法的计算效率。文献[11]将用户的用电行为数据按行保存于Hadoop分布式文件系统(Hadoop distributed file system,HDFS),将用电行为数据集划分为不同切片产生子数据集,利用MapReduce计算模块对各切片数据进行读取。Hadoop支持TB级别的数据和流式数据访问,但实时性较差,不适合大量小文件存储[12—13]。
在数据挖掘中,需处理大量数据,应构建简单有效的模型。数据挖掘是指通过对海量杂乱无章的数据进行挖掘,找到其中蕴含的规律和有价值的信息。……
登录APP查看全文
