APP下载

基于宽度和词向量特征的文本分类模型①

2021-03-19李雪松

计算机系统应用 2021年3期
关键词:分类特征文本

李雪松

(中国银行总行 个人数字金融部,北京 100818)

1 引言

随着社交网络的发展,各种应用软件层出不穷,在吸引大量用户的同时,产生了大量的文本信息,如何从大量文本中抽取有价值的信息和知识是研究者持续关注的问题.文本分类作为一种信息获取的方法,在自然语言处理中发挥着重要的作用,如,信息检索、文档分类和排序等.上世纪50年代就有学者对文本分类进行研究,早期的文本分类主要依靠人工规则,后来转向基于统计的方法,又逐渐发展到通过深度学习、知识图谱等方式.

文本是知识的载体,本身就蕴含了大量的语义、词性和时态等隐含信息,随着通信技术的发展,文本的处理规模也越来越大.在此背景下,词向量技术应运而生,它通过大量语料的训练,将词映射到低维度的向量中,通过求余弦的方式,可以判断词之间的近似关系.词向量模型学习了词的上下文关系,具有良好的泛化能力,可以揭示海量数据里所承载的复杂而丰富的信息,因此得到广泛应用.在近些年,词向量被应用到文本分类模型中,其训练的准确性可以和深度学习分类器看齐.

通用搜索引擎面临的问题是如何获取记忆和泛化能力,一方面用户希望通过检索词可以准确知道包含检索词的文档,另一方面,用户也希望获取和检索词相关的文档.文本分类器也具有类似性,人们希望通过输入文本可以准确得到分类,并且通过一些相似的文……

登录APP查看全文

猜你喜欢

分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征