一种基于主题模型与迁移学习的文本分类方法
2021-07-02汪满容刘桂锋
山东科技大学学报(自然科学版) 2021年3期
包 翔,汪满容,刘桂锋
(江苏大学 科技信息研究所,江苏 镇江 212013)
分类方法作为机器学习中的重要组成部分,其应用领域渗透到了各行各业。传统的分类方法要求满足两个条件:一是用于学习的训练样本和最终用来测试的样本必须符合独立同分布的条件;二是用于学习的样本量必须达到一定的规模才能得到一个较好的模型。但在实际情况中,同时满足以上两个条件非常困难。学术研究中,迁移学习放宽了传统分类方法的两个条件,被定义为:运用已有的知识对不同但相关的领域问题进行求解的一种新的机器学习方法[1]。在迁移学习领域,源领域和目标领域分别被称为训练集和测试集。源领域以及目标领域主题相关但不完全相同。
学者们对迁移学习在文本分类中已经开展了大量研究,跨领域文本分类方法大体上可以分为两种,基于示例权重的跨领域学习和基于特征选择的跨领域学习。基于示例权重的跨领域学习方法聚焦于如何确定源领域中示例的权重,使得能增加与目标领域分布相似的示例的权重,减少与目标领域不相似示例的权重,基于示例权重的跨领域学习方法主要的研究难点在于对不同领域间数据分布差异的衡量,文献[2]提出一种基于监督自适应转移概率潜在语义分析(supervised adaptive transfer probabilistic latent semantic analysis,SATPLSA)的跨域文本分类模型,该模型将原PLSA(probabilistic latent semantic analysis)扩展到有监督的学习范式,通过跨领域定义每个术语的标签信息,在源域中传输知识,自适应地修改了权重值,以控制模型学习过程中来自源域的知识使用比例;……
登录APP查看全文
