APP下载

基于Tag-Tree模板的结构化论坛信息提取

2017-09-08程倩楠

电子技术与软件工程 2017年14期
关键词:信息

文/程倩楠

基于Tag-Tree模板的结构化论坛信息提取

文/程倩楠

结构化的论坛网站多采用动态网页生成技术,将后台数据库的记录信息加入HTML模板,以动态地显示在网页上。与此过程对称,本文首先将不同BBS网站的大量网页解析为Tag-Tree,然后计算树的相似度与构建代价生成多类Tag-Tree模板,同时得到每个模板所对应的网页,寻找模板的重复模式确定记录边界。最后,利用模板解析相应网页得到非模板内容,进而采用启发式规则提取结构信息与记录内容。

相似度 构建代价 Tag-Tree模板记录边界 启发式规则

当今网页信息提取大多采用人工编制的Tag-Tree模板程序对网页进行解析,提取过程过于繁琐。本文针对传统方式的弊端,提出一种基于Tag-Tree模板的结构化论坛信息提取方法。

1 将网页解析为Tag-Tree

网页Tag-Tree包括标签、文本、注释三类结点。其中,文本只能作为Tag-Tree的叶子结点,而标签作为普通结点拥有子节点和属性集。一对标签内的文本与标签作为此标签的子结点,且这类标签具有结束标签。当网页中一个标签以“/>”结束时,我们认为该标签是自结束的。基于以上构造规则,我们将网页解析为Tag-Tree。

2 Tag-Tree模板的生成

定义Tag-Tree B,根节点为J,J的属性集为S,其子节点为X,表示为B(J,X,S)。

2.1 定义Tag-Tree模板

树B与模板B'的根节点相同,属性集S'为S的子集,子节点X'为X的子集,以X'中节点为根节点的树也是其对应X中节点为根节点的树的模板。Tag-Tree模板的集合表示如下:

2.2 提取两个Tag-Tree的模板

算法1:提取两个Tag-Tree的公共子树作为模板

输入:两个Tag-Tree

输出:公共子树

登录APP查看全文

猜你喜欢

信息
订阅信息
展会信息
信息超市
展会信息
展会信息
展会信息
展会信息
展会信息
信息
健康信息