基于Web结构的网站新闻采集系统的设计与实现
2012-10-21陈建国
井冈山大学学报(自然科学版) 2012年2期
陈建国
基于Web结构的网站新闻采集系统的设计与实现
陈建国1,2
(1. 湖南大学软件学院,湖南,长沙 410082;2. 厦门理工学院,福建,厦门 361021)
在深入研究网络信息采集技术的基础上,提出一个基于Web结构的新闻采集模型。该模型加载采集入口地址后,通过信息采集和过滤算法确定新闻列表页,结合正则表达式技术自动识别新闻内容页的链接地址,访问目标新闻内容页,使用采集算法自动提取新闻信息数据。同时,它可以过滤在此页面中嵌入的广告等信息。实践结果表明,该模型工作良好,可以自动化、高效率地采集新闻信息。
信息采集;Web结构;正则表达式;数据挖掘;新闻采集
1 WEB信息采集和新闻采集
1.1 Web信息采集
Web信息采集是指通过Web页面之间的链接关系,从Web上自动地获取页面信息,并且随着链接,使用广度优先遍历算法不断地向所需要的Web页面查找、扩展的过程[1]。
1.2 新闻采集
新闻采集是Web信息采集在网络新闻领域的应用[2]。其核心实现过程如下:由采集入口URL开始,将这些URL放入一个采集队列,顺序读取URL以获取目标网页,调用采集和过滤规则在信息页面中进行信息识别和提取,最后将采集得到的新闻信息和相关数据保存到数据库或其他进一步加工。
1.3 研究现状
目前,国内外关于Web信息采集技术的研究已取得一定成果,总结如下:
基于自然语言处理[3]:主要适用于含有大量文本的Web页面,将Web文档视为文本进行处理的,抽取的实现没有利用Web文档独特于普通文本的层次特性.获得有效的抽取规则需要大量的样本学习[4]。……
登录APP查看全文
