基于DOM和神经网络的网页净化应用
2012-06-01李剑
电子科技 2012年1期
李 剑
(南昌陆军学院战斗实验室,江西南昌 330103)
互联网规模的几何级数增长和万维网的缺乏规范性,使网络信息检索与传统信息检索相比呈现出明显的不同之处:互联网络信息检索面向的对象为海量数据[1];互联网络信息检索所提供的信息内容包罗万象,形式多样。在这种情况下,网页净化技术成为网络信息检索特有的一个研究领域,受到越来越多研究人员的关注。对于有主题的网页,文中提出了基于DOM和神经网络的网页净化方法。
1 网页净化系统的模型
文中网页净化系统模型分为3个模块,分别对应系统处理网页的3个不同阶段:在第一个模块中,是把整个网页的文档分割成不同的内容块,然后对这些块进行分析;第二个模块是将内容块树中的按照给定标准选择出固定数量的子树,作为模块三的输入数据;模块三是神经网络的运行部分,能够选择出网页的主要内容块,模型图如1 所示[2-3]。

图1 整个模型框架图
2 网页净化方法
HTML文档是一种半结构化的文档,这里运用了HTML Parser工具对它进行解析。HTML DOM是一种树形的结构,通常被称为HTML DOM树。它的每个结点都代表一个块单元,这里把DOM树的结点分为两种[4]:(1)组织结点,例如:<table>,<tr>,<div>,<ui>等,是被用以划分整个网页的结构或组织网页的内容。(2)作非组织结点,展示网页内容,例如:<td>,<Ii>,<p>,<img>等。通常非组织结点包含在组织结点内。
2.1 建立内容块树
通过对大量带有主题的网页进行研究分析,发现这类的网页有着鲜明的特征,内容基本都是被按照所处位置不同被分割成几个内容块,几个内容块在视觉上都有区别,并且网页大部分都用 <table>或者<div>划分页面内容。……
登录APP查看全文
