APP下载

信息相似性下网络对抗文本重复数据分级索引

2021-11-19曹福凯MuhdKhaizerOmar

计算机仿真 2021年10期
关键词:分类特征文本

高 晶,曹福凯,闫 明,Muhd Khaizer Omar

(1.华北理工大学冀唐学院,河北唐山063210;2.华北理工大学,河北唐山063210;3.Faculty of Educational Studies Universiti Putra Malaysia,PutrajayaUPM Serdang,Selangor,Malaysia,43400)

1 引言

处在大数据时代,互联网已经成为人们查找资料的重要检索平台,人类时时刻刻离不开互联网应用,因此必须保证网络数据的完整,确保检索结果十分全面,就这一问题展开研究[1-2]。

朱命冬[3]等人提出面向不确定文本数据的余弦相似性重复数据分级索引方法,该方法通过计算余弦距离并进行转换,改进索引结构MVP-tree,同时利用余弦相似度面向不确定性数据的相似度计算方法,并结合分布式环境下k NN和Rk NN查询算法精确分类数据,实现重复数据分级索引。该方法未将数据进行降维处理,导致运行空间维度较高,加长了时间消耗,降低了分级效率。韩英[4]等人提出云计算环境下具有相似性的重复数据分级索引方法。该方法将云终端作为重复数据的中转站,实时获取网络数据,计算历史数据的相似度,筛选出合适的数据块,经过训练生成基础分类器,利用KL散度计算权重系数,确定分类器的有效权值,以此为依据,构成一个集成分类器,实现重复数据分级索引,该方法在重复数据分级前没有对数据进行预处理,导致无法找出分类特征项,存在分级准确率低的问题。马晓慧[5]等人提出一种基于语义相似性的重复数据分级索引方法,该方法计算了待分类文本与词典之间的语义相似度,将语义距离和嵌入的特征结合起来进行分类,以解决语义特征利用不足的问题。……

登录APP查看全文

猜你喜欢

分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征