基于藏文网络信息的关键词抓取算法改进
2014-10-21戴玉刚杨南李佩
中文信息 2014年11期
戴玉刚++杨南++++李佩
一、引言
当今社会互联网信息产业发展迅速,网络藏文信息资源作为互联网信息资源的一部分,随着海量增长的网络信息资源也在大幅度的增长着。而藏文作为中国语言不可分割的一部分,其网络资源也承担着藏族人民与其他各族人民友好和谐共处及沟通的重大责任。对于近年来网络中藏文信息的搜索比例大量的增加,基于藏文的语言特点,对搜索策略进行改进,以达到精进网络藏文信息的搜索准确率。
二、OPIC算法简介
检索算法是搜索策略的核心之一。目前有几类经常使用的搜索策略:广度优先抓取策略,深度优先抓取策略,基于链接分析的抓取策略等策略。其使用的抓取算法包括图的广度搜索和深度搜索算法,PR算法,反向PR算法,OPIC算法等。
OPIC的字面含义是“在线页面重要性计算”,在算法开始之前,假设每个互联网页面都给予相同的现金,每当下载了某个页面P后,P就将自己拥有的现金平均分配给页面中包含的链接页面,自己的现金清空。而对于待爬取URL队列中的网页,则根据其手头拥有的现金金额多少排序,优先下载现金最充裕的网页。OPIC策略的优点是不需要迭代过程。所以计算速度快,适合实时计算使用。
由于本文主要研究对象为藏文信息资源,基于藏文的网络检索与中文有着不小的区别,而量较之中文信息资源又少了一些,为保证其准确率,应采用基于藏文与信息内容结合的改进的OPIC算法。
三、OPIC算法改进……p>
登录APP查看全文
