APP下载

一种基于用户兴趣的STC改进算法

2015-10-21骆绍烨

服装学报 2015年1期
关键词:用户

骆绍烨

(莆田学院信息工程学院,福建莆田351100)

一种基于用户兴趣的STC改进算法

骆绍烨

(莆田学院信息工程学院,福建莆田351100)

作为一种常用的在线文档聚类算法,STC算法聚类结果在用户个性化方面存在不足。改进后的算法结合用户兴趣模型,通过增加基类选择因子和改善基类合并规则来进行改进,实现基于用户兴趣特征的个性聚类效果。实验表明,改进后的算法具有较好的准确性和效率。

STC算法;用户兴趣模型;文本聚类

在浩大复杂的互联网中,各种资源信息充斥其间,搜索已成为不可或缺的最重要的网络应用之一。根据CNNIC的最新统计,搜索引擎的网民使用率达到了80.3%,仅次于即时通信排在了所有的网络应用中的第2位[1]。然而,搜索引擎仅只是对结果按照一定规则进行排序,用户一般只看搜索结果的前几条记录,无法全面了解搜索结果,而聚类技术则可以解决这一问题。

传统的文本聚类主要是对一个或若干个文档集进行离线的聚类分析,文档数量格式等相对固定。而在网页数据聚类分析时,网页的内容和格式等相对繁杂,并且要求在线完成聚类分析。目前, STC算法是WEB挖掘中使用最广泛的在线聚类分析算法之一。

1 经典STC算法

后缀树(Suffix tree)起源于Weiner在1973年提出的一种数据结构[2],主要用于字符串处理,能快速高效地解决字符串匹配和查询问题。后缀树的构造方法较多,比较常用的是Okkonen’s算法[3]。该算法具有较好的时间性和空间性,且容易理解。其基本……

登录APP查看全文

猜你喜欢

用户
雅阁国内用户交付突破300万辆
关注用户
关注用户
两新党建新媒体用户与全网新媒体用户之间有何差别
关注用户
关注用户
挖掘用户需求尖端科技应用
Camera360:拍出5亿用户
100万用户
如何获取一亿海外用户