一种改进的社交媒体文本规范化方法
2015-04-21宋亚军于中华丁革建
中文信息学报 2015年5期
宋亚军,于中华,陈 黎,丁革建,罗 谦
(1.四川大学 计算机学院,四川 成都 610065;2. 浙江师范大学 数理与信息工程学院,浙江 金华 321004;3. 中国民用航空总局第二研究所信息技术分公司,四川 成都 610042)
一种改进的社交媒体文本规范化方法
宋亚军1,于中华1,陈 黎1,丁革建2,罗 谦3
(1.四川大学 计算机学院,四川 成都 610065;2. 浙江师范大学 数理与信息工程学院,浙江 金华 321004;3. 中国民用航空总局第二研究所信息技术分公司,四川 成都 610042)
社交媒体具有文本不规范的特点,现有自然语言处理工具直接应用于社交媒体文本时效果不甚理想,并且基于关键词的算法和应用也达不到预期效果。因此,研究如何更好地规范化社交媒体文本是非常有意义和价值的。本文基于社交媒体文本中非规范词与其规范形式具有相似上下文的假设,引入词嵌入模型来更好地刻画上下文的相似性,提出了一种改进的基于图的社交媒体文本规范化方法,该方法是无监督并且语言无关的,可以处理不同类型语言的大规模无标注社交媒体文本。实验结果表明,该方法能够改进前人方法的不足,并且在与相关方法的对比实验中取得了最好的F值。
社交媒体;文本规范化;自然语言处理;词嵌入
1 引言
微博、Twitter等社交媒体网站每时每刻都在产生大量的短文本,这些用户实时产生的、数量众多的社交媒体短文本具有非常重要的研究和应用价值,它们被广泛用于疾病检测、情感分析和事件发现等。
然而,和普……
登录APP查看全文
