基于深度学习的文本分类综述
2021-07-27贾澎涛
计算机与现代化 2021年7期
贾澎涛,孙 炜
(西安科技大学计算机科学与技术学院,陕西 西安 710600)
0 引 言
机器学习是一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科,是人工智能的核心,是使计算机具有智能的根本途径。机器学习主要应用在计算机视觉与自然语言处理等方面中,其中自然语言处理中的文本分类是近几年的研究热点[1]。文本分类是由Lunhn等人在1957年提出。在1961年,Maron[2]发表了第一篇关于自动文本分类的文章。文本分类是用电脑对文本集(或其他实体或物件)按照一定的分类体系或标准进行自动分类标记,文本分类技术有着广泛的应用前景[3],它是信息过滤、信息检索和文档分类等领域的技术支持。
近年来,国内外学者对文本分类问题做了许多的探索和研究,主要包括传统的机器学习算法和深度学习算法。基于机器学习的文本分类主要包括文本表示、特征选择和构造分类器。文本表示的主要方法有布尔模型(Boolean Model)、概率模型(Probabilistic Model)和向量空间模型(Vector Space Model)。特征选择的方法主要为:特征频率、文档频率、信息增益、互信息、CHI统计、期望交叉熵、文本证据权、优势率、低损降维法和频率差法等[4],其中CHI统计方法和信息增益法是最常用的2个特征选择指标。在基于机器学习的文本分类中,机器学习算法主要有朴素贝叶斯、逻辑回归、支持向量机和K-近邻算法,这些算法在文本分类的过程中存在一些优缺点[5]。基于朴素贝叶斯的文本分类,主要优点是执行速度快、算法简单且分类精度较高,由于对特征项之间的独立性假设,可能会使分类效果不好。……
登录APP查看全文
