一种快速的Web用户和URL聚类算法
2015-07-21张线媚
科技资讯 2015年16期
张线媚


摘 要:本文提出一个基于Web日志的用户和URL聚类的快速算法。利用用户浏览行为建立用户事务矩阵,在此基础上综合考虑用户浏览时间以及点击频率来获取用户权值和页面权值,构建带权值的模糊聚类。为了缩小运算量,构造等价事务,进行事务约减;并针对于FCM算法簇数目初始化敏感的问题,提出了一种全局搜索的方法,搜寻最优的类中心数。实验证实,该算法在精度和效率上都获得了大大提高。
关键字:权值距离;等价事务;事务约减;全局搜索
中图分类号: TP274.2 文献标识码:A 文章编号1672-3791(2015)06(a)-0000-00
因为网站的内容及结构的组织形式是否合理直接决定了网站是否受欢迎,所以需要对Web访问信息进行有效的聚类,分析挖掘出合理有效的运行模式和隐含信息等知识,而在Web访问信息的聚类过程中,最常用到的方法是页面聚类和用户聚类。页面聚类方法主要是通过分析页面之间的关联知识来改进站点的组织结构,而用户聚类则是以相似访问喜好的用户作为集合进行聚类,为同一集合的用户提供针对性的服务。因此聚类算法研究在Web访问信息挖掘中起到决定性的作用。
目前多数日志聚类以Web站点的URL为行、以User-ID为列,建立关联矩阵,对用户的访问时间进行离散后用作矩阵的元素值,经过User-ID的相似性分析,得到相似客户群体,经过对URL的相似性度量获得相关Web页面。
本文首先清洗日志数据,然后根据用户的浏览行为建立矩阵,通过对矩阵的列向量和行向量进行模糊聚类,从而得到用户聚类和URL聚类。……
登录APP查看全文
