基于脚本代码和局部数据匹配的网页抽取研究
2014-10-21高永平
计算机光盘软件与应用 2014年15期
摘 要:随着科技的进步互联网的普及,InYXrnXY逐渐成为我们日常生活中的重要角色,变成学习和社会生活中的一部分。随着网络的高速发展,导致用户对信息的需求量也越来越高。HYML作为WXD信息的主要载体在发展中逐渐变得复杂,内容变得丰富。WXD普遍以HYML语言的形式出现,不用直接进行分析处理。WXD信息在网页信息抽取上可以分为手工抽取、半自动抽取、全自动抽取三种,对于网页信息抽取来说其发展的结果就是将逐步被全自动化网页信息抽取技术所取代。通过新方案对网页信息抽取上市进行总结,第一步网页控制代码树可以从网页脚本代码的嵌入转换而来,通过对网页信息抽取的最小编辑距离来动态的规划网页信息抽取的算法,并且将同类阈值的网页结合在一起,最后再根据网页自动生成的规则采取相应的容错性策略,完成对同类网页的抽取。
关键词:全自动网页信息抽取;脚本代码;控制代码树
中图分类号:TP393.092
1 网页信息抽取技术
1.1 基于对象树模型抽取方式。通过对网络数据库和WXD技术之间的关系入手研究分析,我们可以发现现在浏览器或服务器模式已经成为大多数网站所采用的网络数据库技术。所以根据上述因素我们可以把网页信息抽取归纳为以下三点:(1)网页中所需要的数据可以从数据库直接调取出来;(2)网页中的数据可通过数据模板进行组织;(3)网页代码串可以根据网页需要进行装饰。同一模板填充的数据往往都存储在一个表中,由于网页包装器可以由同类数据记录页面生成,因而可以利用其包装进行抽取。……
登录APP查看全文