APP下载

MSDL-IEW:面向文本分类的密集度感知主动学习算法

2021-04-17TRANBaphan马菲菲明晶晶余秦勇李全兵王永利

数据采集与处理 2021年2期
关键词:分类文本模型

TRAN Baphan,马菲菲,明晶晶,余秦勇,杨 辉,李全兵,王永利

(1.南京理工大学计算机科学与工程学院,南京210094;2.中电科大数据研究院有限公司,贵阳550022;3.提升政府治理能力大数据应用技术国家工程实验室,贵阳550022;4.南京供电公司,南京210000;5.中国电子科技网络信息安全有限公司,成都610041)

引 言

随着互联网技术的迅速发展,信息数据呈指数趋势增长,更多的人可通过互联网进行消息的接收和传播,产生了越来越多的新闻标题、微博评论和产品评价等即时性文本信息,很难在短时间内得到大量的已标注数据,因此文本信息的自动分类成为当前的研究热点[1]。传统的文本分类算法依赖于已标注数据作为模型的训练集,其分类性能也会随着训练集规模增大而逐步提升,然而上述的即时性文本分类任务面临的重大问题是极少的已标注数据和大量的未标注数据[2],因此传统的文本分类方法不适于解决即时性文本分类任务。

为了解决无法即时标注及成本过高的问题,主动学习得到众多的国内外学者的广泛关注。主动学习算法可以从未标注样本集中选择最有价值的样本交由专家进行标注,从而在不损失训练精度的情况下减少标注样本的代价[3]。主动学习中常用的采样策略可以分为以下几种:基于不确定性的采样策略、基于版本空间缩减的采样策略、基于模型改变期望的采样策略以及基于误差缩减的采样策略[4]。聂嘉贺[5]基于主动学习算法采用RCNN模型作为分类器,提出了一种基于主动学习的文本分类框架,同时结合数据挖掘技术和深度文档向量模型,改进了初始样本选择算法,能从未标注数据集中选取出更能代表样本空间的样本。……

登录APP查看全文

猜你喜欢

分类文本模型
一半模型
分类算一算
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本