基于模板知识的带噪音半结构文本数据自动分词方法*
2015-09-21王晓英
网络安全与数据管理 2015年17期
关键词:文本
解 辉,王晓英,金 鑫
(青海大学 计算机技术与应用系,青海 西宁 810016)
0 引言
用特定语法结构的文本形式来记录原本结构化的数据信息依然是实际环境中常见的现象,而这种文本数据就是半结构化数据形式之一。关于半结构化数据的处理问题得到了广泛研究,参考文献 [1-3]分别研究对Web形式的半结构化数据进行提取的方法,其对应的数据依据相应的Web语言标准组织,其中有对应的参考节点(页面元素标记符号)。参考文献[4-6]根据不同应用背景,研究了具有半结构化特征的文本数据提取技术,其数据均是由机器依据固定语法规则自动生成,不会有错误输入干扰。
但是以人工为主要输入方式的半结构化记录中,却总会出现一些错误录入现象,比如字符错误、字符多余以及字符缺失等。将有错误输入的数据称为带噪音的半结构化文本数据,由于噪音可能是多余或缺失的分词标记符,也可能是字段值中的字符,且位置多变,从而导致上述文献中技术不再适用。因此需要提出具有一定容错能力的分词和数据提取方法,实现对带噪音的半结构化文本数据进行自动分词和数据提取功能。
鉴于此,本文在分析噪音对半结构化文本数据自动分词造成的影响基础上,提出一种基于语法模板结构知识的自动分词方法,可用来处理一定污染程度下的带噪音半结构化文本数据,从而可为类似问题提供处理及研究的参考和借鉴。
1 半结构化文本文件的概念
半结构化数据范围相对较广,广义上可认为其数据一般是按照某个固定的结构或格式进行组织或生成。……
登录APP查看全文
