APP下载

自编码网络短文本流形表示方法

2015-08-10罗森林潘丽敏

浙江大学学报(工学版) 2015年8期
关键词:特征文本实验

魏 超,罗森林,张 竞,潘丽敏

(北京理工大学 信息与电子学院,北京100081)

近年来,微博、微信等新传媒的快速发展使得短文本信息比例急速增长,因此对人们有效获取信息具有积极意义的短文本分类技术正受到越来越多的关注.而短文本长度较短,包含字词信息较少,因此基于向量空间模型的短文本表示方法存在严重的特征稀疏和高维的问题.这些问题不仅会增加相似性计算成本、降低分类器的效率,而且容易引起过拟合现象[1],所以解决短文本表示存在的特征稀疏和高维性的问题对于短文本分类具有十分重要意义.

针对短文本表示存在的高维稀疏问题,目前研究方案主要有2种.

1)在不改变短文本语义的前提下,引入外源知识扩展短文本内容使近似为普通长文本,进而利用常规方法表示.基于知识库(wordNet、wiki、open directory project、WebKB)来扩展短文本信息是比较常见的方法[2-4].但是,在微博等实际应用中短文本信息更新快,词义丰富,而知识库构建和扩展的成本往往较高,因此该方法并不能很好地解决实际应用中同义,多义问题.此外,王蒙等[5]利用搜索引擎查询短文本,将返回的相关网页结果用于扩展短文本来弥补特征稀疏问题;Rudi等[6]提出Google Similarity Distance的概念,根据Google关于2 篇短文本检索结果中共现网页进行扩展.上述2种方法虽然在语义消歧等方面取得了不错效果,但实际应用中依赖搜索引擎的效果,仍存在一定局限性.

2)通过分析短文本特征项间内在关联性,挖掘短文……

登录APP查看全文

猜你喜欢

特征文本实验
记一次有趣的实验
如何表达“特征”
在808DA上文本显示的改善
做个怪怪长实验
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
NO与NO2相互转化实验的改进
实践十号上的19项实验
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本