基于半监督学习的短文本分类方法
2012-07-23孙学琛高志强全志斌施嘉鸿
山东理工大学学报(自然科学版) 2012年1期
孙学琛,高志强,全志斌,施嘉鸿
(东南大学计算机科学与工程学院,江苏南京211189)
自20世纪50年代以来,人们对文本自动分类的研究获得了丰硕的成果,但这些研究都局限于长文本,对短文本分类问题涉及较少.短文本分类是一种特殊的文本分类任务,随着万维网(world wide web)的快速普及和发展,web上出现了大量短文本,例如科技文献摘要、微博和电子邮件.短文本内容短小,相互联系,已标注数据获得困难,传统分类方法已经不能适用于短文本分类场景.短文本分类对于获取数据的分布特征以及后续进一步的数据挖掘工作有重要的意义.
1 问题描述
短文本在日常生活中非常常见,例如数字化图书馆中的论文快照(包括标题、摘要、参考文献等,但不包括正文内容)、微博(少于140字)和搜索引擎片段等.本文的主要研究分类对象是论文快照(在没有特别说明的情况下,本文所指论文均指论文快照).短文本的特征主要有两个,一是内容短小,二是特征稀疏.这就导致使用传统的基于bag-of-words表示方法的分类器很难取得令人满意的效果.另外,短文本的规模一般很大,而已标注的数据却很少,利用手工方法对数据进行标注非常耗时耗力.如何利用少量的已标注数据和大量未标注数据进行学习,从而对短文本数据进行高效分类,是本文研究的主要问题.
2 相关研究
对短文本分类的研究在九十年代末才逐渐引起人们的注意,文献[1] 提出了一种使用作者信息和tweets内部……
登录APP查看全文