基于大数据集的协同过滤算法的并行化研究
2012-05-04李章凤
计算机工程与设计 2012年6期
李 改,潘 嵘,李章凤,李 磊
(1.顺德职业技术学院 电子与信息工程系,广东 顺德528300;2.中山大学 信息科学与技术学院,广东 广州510006;3.中山大学 软件研究所,广东 广州510275)
0 引 言
协同过滤算法是推荐系统中运用最广泛的的推荐算法[1-3]。协同过滤算法的核心是分析用户兴趣,在用户群中找到与指定用户相似(兴趣)的用户,综合这些相似用户对某一信息的评价,形成系统对该指定用户对此信息的喜好程度预测[4-5]。最近几年提出了各种高效的CF算法,其中包括潘嵘等提出了基于ALS的协同过滤推荐算法[6-8],N.Srebro等提出了 MMMF[9-10],R.Salakhutdinov等提出了PMF和 RBM[11-12],Daniel D.Lee等提出了 NNMF[13],以及聚类模型等等。
当前对这些协同过滤算法的研究都侧重于单节点的算法设计与实现。但随着互联网的迅猛发展,推荐系统中用户及推荐对象的数量在呈几何倍数增长,使得实现在单节点机器上的这些算法要算出结果需要耗费大量时间,无法满足大数据集的运算需要。因此如果我们能对这些算法实现分布式计算,将会大大缩短计算所需时间,同时必将对大规模协同过滤算法的应用研究有较大的推动作用。
本文的主要贡献是:研究基于矩阵分解的Alternating-Least-Squares(ALS)协同过滤算法的并行化问题,并详细介绍如何在开源的云计算平台Hadoop[14]上实现该算法的并行化。同时对ALS算法在多个节点下的并行化算法与其在单节点上的串行算法运行的时间进行对比,进而对实验进行评估。实验证明了ALS算法的可并行性,并行后ALS算法的运算性能获得了极大提高。……
登录APP查看全文
