基于信息熵和改进相似度协同过滤算法
2021-06-29黄皓,陈荔
计算机与现代化 2021年6期
关键词:用户
黄 皓,陈 荔
(上海理工大学管理学院, 上海 200240)
0 引 言
随着互联网的高速发展,信息的产生呈现了一种爆炸增长速度,造成了信息过载现象。信息过载是指数据过量,它导致的后果使得用户难以在短时间内接收到某一方面的全部相关信息,可能会使用户在信息接收不全面的情况下造成错误的决定。当今社会解决此问题的主流方法有以下2种:第一类是以推荐系统为代表的信息过滤技术;第二类是谷歌百度等搜索引擎主要使用的信息检索技术。但搜索引擎存在的最大问题是它很难提供个性化的推荐,它的主要方法是由用户提供精准的文字来进行查找。相反,推荐系统使用用户的历史信息(比如购买、评分信息等)来推荐用户潜在的需要信息,它能够为用户提供更加精准的服务。
协同过滤算法作为推荐系统最常用的方法,它也存在自己的问题:一是噪音数据,大规模地人为捏造数据等行为会造成数据的失真;二是数据稀疏性,随着现代互联网的发展,数据的数目一般是上千万,但用户评分的商品常常很少,导致评分矩阵中大量的空白,导致典型的类似数据集都相当稀疏。
国内外在改进相似度上进行了很深的研究。苏庆等[1]针对数据稀疏和准确率相对较低原因,提出了改进模糊划分聚类的协同过滤算法(GIFP-CCF+),使用了时间差因子、热门物品权重因子和冷门物品权重因子相结合的相似度计算结果,结合改进模糊划分的算法。……
登录APP查看全文
