APP下载

基于模板知识的带噪音半结构文本数据自动分词方法*

2015-09-21王晓英

网络安全与数据管理 2015年17期
关键词:文本

解 辉,王晓英,金 鑫

(青海大学 计算机技术与应用系,青海 西宁 810016)

0 引言

用特定语法结构的文本形式来记录原本结构化的数据信息依然是实际环境中常见的现象,而这种文本数据就是半结构化数据形式之一。关于半结构化数据的处理问题得到了广泛研究,参考文献 [1-3]分别研究对Web形式的半结构化数据进行提取的方法,其对应的数据依据相应的Web语言标准组织,其中有对应的参考节点(页面元素标记符号)。参考文献[4-6]根据不同应用背景,研究了具有半结构化特征的文本数据提取技术,其数据均是由机器依据固定语法规则自动生成,不会有错误输入干扰。

但是以人工为主要输入方式的半结构化记录中,却总会出现一些错误录入现象,比如字符错误、字符多余以及字符缺失等。将有错误输入的数据称为带噪音的半结构化文本数据,由于噪音可能是多余或缺失的分词标记符,也可能是字段值中的字符,且位置多变,从而导致上述文献中技术不再适用。因此需要提出具有一定容错能力的分词和数据提取方法,实现对带噪音的半结构化文本数据进行自动分词和数据提取功能。

鉴于此,本文在分析噪音对半结构化文本数据自动分词造成的影响基础上,提出一种基于语法模板结构知识的自动分词方法,可用来处理一定污染程度下的带噪音半结构化文本数据,从而可为类似问题提供处理及研究的参考和借鉴。

1 半结构化文本文件的概念

半结构化数据范围相对较广,广义上可认为其数据一般是按照某个固定的结构或格式进行组织或生成。……

登录APP查看全文

猜你喜欢

文本
重点:论述类文本阅读
重点:实用类文本阅读
初中群文阅读的文本选择及组织
作为“文本链”的元电影
在808DA上文本显示的改善
“文化传承与理解”离不开对具体文本的解读与把握
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
从背景出发还是从文本出发
如何快速走进文本