自编码网络短文本流形表示方法
2015-08-10罗森林潘丽敏
浙江大学学报(工学版) 2015年8期
魏 超,罗森林,张 竞,潘丽敏
(北京理工大学 信息与电子学院,北京100081)
近年来,微博、微信等新传媒的快速发展使得短文本信息比例急速增长,因此对人们有效获取信息具有积极意义的短文本分类技术正受到越来越多的关注.而短文本长度较短,包含字词信息较少,因此基于向量空间模型的短文本表示方法存在严重的特征稀疏和高维的问题.这些问题不仅会增加相似性计算成本、降低分类器的效率,而且容易引起过拟合现象[1],所以解决短文本表示存在的特征稀疏和高维性的问题对于短文本分类具有十分重要意义.
针对短文本表示存在的高维稀疏问题,目前研究方案主要有2种.
1)在不改变短文本语义的前提下,引入外源知识扩展短文本内容使近似为普通长文本,进而利用常规方法表示.基于知识库(wordNet、wiki、open directory project、WebKB)来扩展短文本信息是比较常见的方法[2-4].但是,在微博等实际应用中短文本信息更新快,词义丰富,而知识库构建和扩展的成本往往较高,因此该方法并不能很好地解决实际应用中同义,多义问题.此外,王蒙等[5]利用搜索引擎查询短文本,将返回的相关网页结果用于扩展短文本来弥补特征稀疏问题;Rudi等[6]提出Google Similarity Distance的概念,根据Google关于2 篇短文本检索结果中共现网页进行扩展.上述2种方法虽然在语义消歧等方面取得了不错效果,但实际应用中依赖搜索引擎的效果,仍存在一定局限性.
2)通过分析短文本特征项间内在关联性,挖掘短文……
登录APP查看全文