基于宽度和词向量特征的文本分类模型①
2021-03-19李雪松
计算机系统应用 2021年3期
李雪松
(中国银行总行 个人数字金融部,北京 100818)
1 引言
随着社交网络的发展,各种应用软件层出不穷,在吸引大量用户的同时,产生了大量的文本信息,如何从大量文本中抽取有价值的信息和知识是研究者持续关注的问题.文本分类作为一种信息获取的方法,在自然语言处理中发挥着重要的作用,如,信息检索、文档分类和排序等.上世纪50年代就有学者对文本分类进行研究,早期的文本分类主要依靠人工规则,后来转向基于统计的方法,又逐渐发展到通过深度学习、知识图谱等方式.
文本是知识的载体,本身就蕴含了大量的语义、词性和时态等隐含信息,随着通信技术的发展,文本的处理规模也越来越大.在此背景下,词向量技术应运而生,它通过大量语料的训练,将词映射到低维度的向量中,通过求余弦的方式,可以判断词之间的近似关系.词向量模型学习了词的上下文关系,具有良好的泛化能力,可以揭示海量数据里所承载的复杂而丰富的信息,因此得到广泛应用.在近些年,词向量被应用到文本分类模型中,其训练的准确性可以和深度学习分类器看齐.
通用搜索引擎面临的问题是如何获取记忆和泛化能力,一方面用户希望通过检索词可以准确知道包含检索词的文档,另一方面,用户也希望获取和检索词相关的文档.文本分类器也具有类似性,人们希望通过输入文本可以准确得到分类,并且通过一些相似的文……
登录APP查看全文
