Apriori算法在高校图书馆图书推荐中的应用
2012-02-05陈锦吴扬扬
河南科技学院学报(自然科学版) 2012年4期
陈锦,吴扬扬
(1.华侨大学计算机科学与技术学院,福建泉州362000;2.泉州经贸职业技术学院信息系,福建泉州362000)
随着高校学生数量的不断增多,图书馆的藏书量也相应地剧增,为了让学生从浩瀚的馆藏资源中快速找到自己所需的图书,图书馆工作模式应该变“被动”为“主动”,可通过数据挖掘技术来挖掘大量的图书借阅记录,主动向学生推荐图书.关联规则用于分析隐藏在大量数据集中令人感兴趣的联系[1].Apriori算法是关联规则的经典算法,该算法的主要思想是首先寻找给定数据集中的频繁项集,然后通过频繁项集生成强关联规则[2].
1 Apriori算法
一个事物数据库中的关联规则可以描述如下:
设I={I1,I2,……In}是项的集合,D是任务相关数据数据库事务的集合,TID作为每个事务的标识符,每个事务T对应I上的子集.设A是项集,事务T包含A当且仅当A⊆T.关联规则是形如A⇒B的蕴涵式,其中A⊂I ,B⊂I,A∩B=∅.规则A⇒B在事务D中成立,具有支持度s,其中s是D中事务包含的百分比.规则A⇒B在事务D中具有置信度c,其中c是D中包含A的事务同时也包含B的百分比[3].即Suppor(tA⇒B)=P(A∪B),Confidence(A⇒B)=P(B|A).
Apriori算法将关联规则挖掘分解为两个子问题:
(1)找到频繁项集,即所有支持度大于最小支持度的项集;
(2)使用第一步找到的频繁项集找到强关联规则即D在I上满足最小置信度.
在实际应用中,发现Apriori算法存在如下一些主要的缺陷[4]:
(1)需多次扫描事务数据库;
(2)不适用于稠密集的关联规则挖掘;
(3)可能生成的关联规则过于庞大.
2 Apriori算法在图书推荐中的应用
图书推荐服务在图书
登录APP查看全文
