基于模糊聚类的分布式Web日志挖掘方法
2020-08-13陈宝国
太原师范学院学报(自然科学版) 2020年3期
陈宝国,宋 旸
(淮南师范学院 计算机学院,安徽 淮南 232000)
0 引言
近些年来,随着搜索引擎、电子商务、社交媒体等互联网应用的飞速发展,使得Web信息系统已经成为目前规模最大的系统[1].在互联网中任一Web服务器上所进行的活动都会存储至日志文件中.随着现代信息技术的进一步发展,互联网中的信息已经呈现爆炸式增长,Web日志的分布也愈加广泛[2].对于互联网来说,特别是一些大型社交媒体网站与大型电子商务网站,分析分布式Web日志不仅可以明确网站运营情况,还可以挖掘用户的行为习惯,为营销计划的制定奠定基础,进而给用户推荐符合用户行为习惯的产品以及个性化服务等.为达到以上目标,需要进行分布式Web日志挖掘,因此相关的分布式Web日志挖掘和检索方法研究受到人们极大的关注[3].当前,对分布式Web日志挖掘方法主要有模糊C均值信息聚类方法和PSO进化方法等,但采用当前方法进行分布式Web日志挖掘的自适性不好,时间开销较大.为解决该问题,本文提出基于模糊聚类的分布式Web日志挖掘方法.最后进行仿真测试分析,展示了本文方法在提高分布式Web日志挖掘能力方面的优越性能.
1 分布式Web日志关联规则分布集及特征聚类
1.1 构造关联规则分布集
为了实现基于关联规则和模糊聚类的分布式Web日志挖掘,采用模糊特征检测方法进行分布式Web日志的语义特征分析,结合用户的偏好信息[4],建立分布式Web日志的关联规则分布集,表……
登录APP查看全文
