结合深度学习与词性标注的网页分类算法研究
2018-08-21骆聪,王帅
计算机技术与发展 2018年8期
骆 聪,王 帅
(江南计算技术研究所,江苏 无锡 214083)
0 引 言
随着互联网的持续发展,网页数量获得了急剧增长,杂乱无章的网页不利于人们方便高效地查找感兴趣的内容。为了提高信息检索的精度和效率,准确的网页分类技术就显得尤为重要。
传统的网页分类技术主要使用机器学习方法进行特征选择和分类。深度学习是机器学习中一个全新的领域,本质是一种多层的神经网络学习算法,通过逐层初始化的方法来达到极高的准确率[1]。随着深度学习的发展,有必要借助深度学习理论来解决传统的特征选择方法容易导致特征项不明确、分类精度下降的问题[2]。
此外,传统的网页分类技术大都没有区分词性,而是将所有词语用于分类,容易导致分类效率不高,并且分类准确率也不够理想。所以有必要利用词性标注技术,在剔除部分对网页分类贡献较小的词语的同时,也为区分能力高的名词赋予较高的权重,以此来提高分类的效率和准确率。
文中提出使用深度学习和词性标注等技术进行网页分类。首先简要介绍了基于深度学习的文本分类和网页分类的研究现状,然后简要阐述了深度学习技术,提出了结合深度学习和词性标注等技术的网页分类算法,并通过实验进行相关验证。
1 基于深度学习的文本分类和网页分类研究现状
基于网页内容分析的网页分类技术主要参考文本分类技术,采用信息增益、互信息等进行特征选取,并使用kNN、朴素贝叶斯和支持向量机[3]等进行分类。……
登录APP查看全文
