基于球面自编码器的文本分类
2021-03-11赵书安
赵书安
(1.江苏开放大学信息工程学院,江苏 南京 210065;2.南京理工大学电子工程与光电技术学院,江苏 南京 210094)
文本分类是自然语言处理社区的经典问题,旨在为句子、搜索查询、文档等指派类别标签,在自动问答、垃圾信息识别、情感分析、新闻归档、用户意图分类等领域有着广泛的应用前景[1]。由于海量数据在互联网时代的易获取性,以及基于数据驱动的机器学习、深度学习理论算法的发展和应用,文本分类始终是当前的研究热点。比如在电信邮件诈骗领域,自动检测出具有诱导性的垃圾邮件,防止用户遭受欺骗,从而规避风险,减少不必要的损失[2];在媒体信息处理领域,针对新闻文本内容自动实现归档,然后向关注特定领域新闻事件的用户精准推送,有助于提高用户体验,增强用户粘性等等[3]。
在文本分类过程中,提取能够有效表征文本的特征表示以及选择合适的分类方法至关重要。针对文本的特征表示,传统合理有效的方法,包括构建特定领域关键词字典(Domain-specific key-phrases dictionary,DSKD)、N 元文法(N-gram)、词性标签(Partof-speech,POS)和考虑语言学结构的句法依存解析树(Dependency parsing tree,DPT);而对于分类方法,研究表明有效且应用最广泛的包括逻辑斯蒂回归(Logistic Regression,LR)、朴素贝叶斯(Naive Bayes,NB)、支撑向量机(Support vector machine,SVM)以及决策树(Decision tree,DT)等等[4]。随着文本数据规模的增加,传统的特征提取方法,尤其是构建关键词字典需要花费大量人工成本,因此可行性逐渐降低。而词向量[5]的提出,结合包括卷积神经网络(Convolutional neural network,CNN)[6]、递归神经网络(Recursive neural network,RecNN)[7]、循环神经网络(Recurrent neural network,RNN)[8]、注意力机制(Attention mechanism,AM)[9]、记忆网络(Memory network,MN)[10]等神经网络模型,能够学习深层语义信息,支持大规模预训练语言模型,在文本分类任务上取得了优异的表现[11]。……
