一种基于词汇相关度的网络文本分类算法研究
2012-10-17邱前智刘忠
网络安全技术与应用 2012年5期
邱前智 刘忠
桂林理工大学 广西 541004
0 引言
随着信息技术的飞速发展特别是互联网的广泛普及,网络文本以指数级别增长,网络文本成为人们进行信息交流的重要方式。如何对浩如烟海的文档、资料和数据进行自动分类、组织、挖掘和管理,已经成为一个具有重要用途的研究课题。文本分类是在预定义的体系下与一个或者多个类别相关联的过程。文本分类作为信息检索和数据挖掘的基础技术和研究热点,从上个世纪50年代至今,已经取得长足发展。广泛应用于邮件分类、自动文摘、信息过滤、电话会议等。特征选择(Feature Selection,FC)作为文本分类的关键一步,具有降低向量空间维数、简化计算、以及去除噪声等作用,征提取的好坏将直接影响着文本分类的准确率和效率。特征选择一般是通过构造一个特征评分函数,把测量空间的数据投影到特征空间,得到在特征空间的值,然后根据特征空间中的值对每个特征进行评估,特征选择就成了选择值最高的若干个特征。常用的特征选择方法(如信息增益、互信息)采用统计方法处理词语与类别,忽略特征词之间的语义关系。本文提出一种基于上下文的词汇相关度的特征选择方法,通过计算词语与类别关键词词汇相关度,设定相关度阀值,进行特征取舍,降低特征空间的高维性,并有效减少噪声,得出最优特征空间,从而提高了分类精度和算法效率。
1 网络文本分类流程及相关技术
网络文本作为一种结构化的特殊文本,除了文本信息之外,还有其他描述信息,如标题、页面描述和超链接等标签(tag)。……
登录APP查看全文
