APP下载

基于DOM和神经网络的网页净化应用

2012-06-01李剑

电子科技 2012年1期
关键词:内容实验

李 剑

(南昌陆军学院战斗实验室,江西南昌 330103)

互联网规模的几何级数增长和万维网的缺乏规范性,使网络信息检索与传统信息检索相比呈现出明显的不同之处:互联网络信息检索面向的对象为海量数据[1];互联网络信息检索所提供的信息内容包罗万象,形式多样。在这种情况下,网页净化技术成为网络信息检索特有的一个研究领域,受到越来越多研究人员的关注。对于有主题的网页,文中提出了基于DOM和神经网络的网页净化方法。

1 网页净化系统的模型

文中网页净化系统模型分为3个模块,分别对应系统处理网页的3个不同阶段:在第一个模块中,是把整个网页的文档分割成不同的内容块,然后对这些块进行分析;第二个模块是将内容块树中的按照给定标准选择出固定数量的子树,作为模块三的输入数据;模块三是神经网络的运行部分,能够选择出网页的主要内容块,模型图如1 所示[2-3]。

图1 整个模型框架图

2 网页净化方法

HTML文档是一种半结构化的文档,这里运用了HTML Parser工具对它进行解析。HTML DOM是一种树形的结构,通常被称为HTML DOM树。它的每个结点都代表一个块单元,这里把DOM树的结点分为两种[4]:(1)组织结点,例如:<table>,<tr>,<div>,<ui>等,是被用以划分整个网页的结构或组织网页的内容。(2)作非组织结点,展示网页内容,例如:<td>,<Ii>,<p>,<img>等。通常非组织结点包含在组织结点内。

2.1 建立内容块树

通过对大量带有主题的网页进行研究分析,发现这类的网页有着鲜明的特征,内容基本都是被按照所处位置不同被分割成几个内容块,几个内容块在视觉上都有区别,并且网页大部分都用 <table>或者<div>划分页面内容。……

登录APP查看全文

猜你喜欢

内容实验
记一次有趣的实验
内容回顾温故知新
内容回顾 温故知新
内容回顾温故知新
做个怪怪长实验
主要内容
NO与NO2相互转化实验的改进
实践十号上的19项实验
《实验流体力学》征稿简则