基于词共现与图卷积的文本分类方法
2021-06-11申艳光贾耀清
计算机工程与应用 2021年11期
申艳光,贾耀清,2
1.河北工程大学 信息与电气工程学院,河北 邯郸056038 2.河北工程大学 河北省安防信息感知与处理重点实验室,河北 邯郸056038
文本分类是自然语言处理的基本任务,利用文本分类方法对海量的文本进行科学和有效的管理是亟待解决的问题。根据所属领域的不同,文本分类可以分为主题分类[1]、问题分类[2]、情感分类[3]等。文本分类有十分广阔的应用,如舆情分析、文章组织、意见挖掘、新闻分类、垃圾邮件过滤、决策过程、词性标注[4-7]等。
随着深度学习的兴起与发展,文本分类方法也不断演化与进步。现如今基于深度学习的文本分类方法已成为主流,这些深度学习模型可以较好地捕捉局部连续词序列的语义和句法信息。为了进一步提高文本分类的准确度,许多文本分类方法都需要大量的数据标注,而数据标注主要是人工标注与人机结合辅助标注两种方法。如果需要标注的数据量较小,可以采用人工标注的方法,但如果数据量较大,人工标注不能保证效率和准确率。考虑到半监督学习的深度学习文本分类方法中数据标注是不可避免的,可以使用尽可能少的标注数据来达到同样的模型性能。
图卷积神经网络是近年来的研究热点,它能够有效处理具有丰富关系结构的任务[8-10]。针对上述文本分类中数据标注量少的问题,提出一种基于词共现与图卷积相结合的半监督文本分类方法。首先,从整个语料库中构造一个大型文本图,其中包含作为节点的单词和文档;……
登录APP查看全文
