基于协同训练与Boosting的协同过滤算法
2023-10-21杨晓菡郝国生张谢华杨子豪
杨晓菡,郝国生,张谢华,杨子豪
基于协同训练与Boosting的协同过滤算法
杨晓菡,郝国生,张谢华*,杨子豪
(江苏师范大学 计算机科学与技术学院,江苏 徐州 221116)( ∗ 通信作者电子邮箱6019980030@jsnu.edu.cn)
协同过滤(CF)算法基于物品之间或用户之间的相似度能实现个性化推荐,然而CF算法普遍存在数据稀疏性的问题。针对用户‒物品评分稀疏问题,为使预测更加准确,提出一种基于协同训练与Boosting的协同过滤算法(CFCTB)。首先,利用协同训练将两种CF集成于一个框架,两种CF互相添加置信度高的伪标记样本到对方的训练集中,并利用Boosting加权训练数据辅助协同训练;其次,采用加权集成预测最终的用户评分,有效避免伪标记样本所产生的噪声累加,进一步提高推荐性能。实验结果表明,在4个公开数据集上,所提算法的准确率优于单模型;在稀疏度最高的CiaoDVD数据集上,与面向推荐系统的全局和局部核(GLocal-K)相比,所提算法的平均绝对误差(MAE)降低了4.737%;与ECoRec(Ensemble of Co-trained Recommenders)算法相比,所提算法的均方根误差(RMSE)降低了7.421%。以上结果验证了所提算法的有效性。
推荐算法;协同过滤;数据稀疏;协同训练;Boosting
0 引言
面对网络中的海量信息,推荐系统能够帮助用户过滤信息,实现个性化推荐。协同过滤(Collaborative Filtering, CF)是构建个性化推荐系统的关键技术,它基于用户与物品的历史交互信息(包括显式的和隐式的)向用户推荐偏好物品。
在实际应用中,用户与物品的交互信息矩阵数据稀疏,改善数据稀疏性问题是推荐系统的一个重要内容。改善数据稀疏的方法主要有3种方法:偏好数据填补、基于多源信息的偏好预测和基于分歧的半监督学习。……
