基于中文网页的综合联系信息提取系统的设计与实现
2012-11-22郭威纪星
湖北汽车工业学院学报 2012年4期
郭威,纪星
(1.湖北汽车工业学院 经济管理学院,湖北 十堰442002;2.湖北省金蚂蚁网络有限公司,湖北 十堰 442000)
互联网的飞速发展使其成为全球信息传播与共享的重要资源,Web上的数据一直呈爆炸式增长,要想从Web上获取一条有用信息的难度却越来越大[1]。搜索引擎就是在这种条件下孕育而生的。而现有的搜索引擎只能提供URL集供用户浏览,但往往不能提供用户直接所需要的联系信息。基于此,本文系统地研究借助搜索引擎的结果,通过“实体”判断、正则表达式、网页分类、SV值算法结合完成提取和整合联系信息,例如电话、邮箱、QQ、地址、传真等信息。
1 提取关键信息实现过程
提取关键信息的思路就是借助于搜索引擎提供的经过处理的URL结果集,然后使用目前研究的Web信息提取技术,提取出目前指定的9个字段信息。这些信息基本上都是联系信息。本系统的实现可以分成3步:1)获取首页网址集;2)获取关键网址集;3)提取关键信息集。这3步是相互有影响的,每一步都是后一步的基础,如果没有前一步,后一步是没有任何意义的。在计算系统有效的时候,需要计算每一步之间的影响因数,只有这样,计算出来的才是最有说服力的。
1.1 获取首页网址集
这个过程分2步:1)获取搜索引擎TOP100结果集;2)处理TOP100得到TOP100中的首页结果集。
获取搜索引擎TOP100结果集:本研究所需的数据是来自于搜索引擎的结果集,所以把搜索引擎根据“查询句”得到的前100个左右的结果集,称之为“搜索引擎TOP100结果集”。
在第1)步中,通过输入查询句后,统计分析搜索引擎返回结果,发现一个有利于提高系统精度的规律,即对于某个单位。……
登录APP查看全文
