APP下载

基于多尺度的n-grams特征选择加权及匹配算法

2020-01-13刘世兴

智能计算机与应用 2020年1期
关键词:语义词汇分类

刘世兴

(辽宁机电职业技术学院 信息工程系, 辽宁 丹东 118009)

0 引 言

n-grams语言模型的基本思想是将文本按照词汇大小为n的滑动窗口进行操作,形成长度为n的词汇片段序列,具有拼写容错能力强、语种无关性[1-2]、不需词典规则[3]及特征维度低[4]等优点,因而广泛应用于大数据及人工智能领域,如:文本分类[5-6]、聚类[7]、拼音校验[8]、预测[9]、机器翻译[10]、语音识别[11]、情感分析[12]及恶意软件检测[13]等。

作为n-grams语言模型的应用前提,其选择、加权及匹配算法一直是研究人员关注的重点。Maipradit等人[14]提出一种基于逆文本频率的n-grams特征选择算法,用于解决情感分类问题。该算法仅注重特征的选择,没有加权过程,分类性能提升幅度较小。Zhou等人[15]将n-grams模型进行重构,以解决特征选择及加权问题。但重构后的n-grams特征语义结构遭到破坏,减少了原有特征包含的文本信息。Hwang等人[16]将n-grams特征的长度扩大到5,用于长文本及海量文本的分类。但该方法只能用于特定文本,在中、短文本中,5-grams特征会产生更多的稀疏数据。

为优化n-grams特征的选择、加权及匹配算法,在不破坏n-grams结构的前提下,增强n-grams特征的权值区分度,减少稀疏数据的产生,本文以词性、语义及词汇的内在偏序关系为基础,提出利用词性的类分布和语义近似度结合传统n-grams特征加权,达到区分特征权值的目的,通过权值过滤并选择n-grams特征,在匹配过程中引入语义近似度,减少匹配过程中产生的稀疏数据。在美国当代英语语料库和北京BBC汉语语料库中的实验结果表明,相比于引言中提到的3种算法,基于多尺度的n-grams特征选择加权及匹配算法得到的特征质量更高,并在分类器中的准确率大幅提升。……

登录APP查看全文

猜你喜欢

语义词汇分类
分类算一算
本刊可直接用缩写的常用词汇
一些常用词汇可直接用缩写
语言与语义
本刊可直接用缩写的常用词汇
教你一招:数的分类
“上”与“下”语义的不对称性及其认知阐释
认知范畴模糊与语义模糊
本刊一些常用词汇可直接用缩写
语义分析与汉俄副名组合