APP下载

结合语义和结构的短文本相似度计算

2018-08-21倪高伟

计算机技术与发展 2018年8期
关键词:语义单词文本

倪高伟,李 涛,刘 峥

(南京邮电大学 计算机学院,江苏 南京 210046)

0 引 言

短文本在移动短消息、即时消息、BBS标题、新闻标题、在线聊天记录、博客评论、新闻评论等领域中应用广泛。其主要特点是长度很短,不超过200个字符。如日常使用的手机短信,往往不超过70个字,以及BBS标题和新闻标题不超过30个字。短文本通常具有以下特征[1-2]:

(1)稀疏性:短文本通常只包含几个到十几个字,不能提供足够的共现词或共享上下文作为一个好的相似度度量,因此难以提取有效的语言特征。

(2)即时性:短文本立即发送并实时接收。此外,数据流量非常大。

(3)非规范性:短文本描述简洁,多为名词性短语拼接,包含大量的口头用语,同时有很多拼写错误,如非标准的词语。

(4)噪声和分布不平衡性:一些应用背景(如网络安全)需要处理大量的短文本数据。然而,在大规模的数据中,往往只关注其中的小部分(检测对象)。因此,在某些应用背景下有用实例是很有限的,同时大量的噪声数据也导致了训练样本的分布不平衡。

(5)大规模数据和标签瓶颈:很难手动标记所有的大规模实例,同时有限标记的实例只能提供有限的信息。

词袋(bag of words,BOW)和术语频率信息(term frequency-inverse document frequency,TF-IDF)是常见表示文档的方法。因短文本共现词很少,这些方法通常不适合计算文档距离,同时也不能捕获单个词之间的距离。有许多方法试图通过学习潜在的低维向量表示文档来规避这个问题,如潜在语义索引(latent semantic indexing,LSI)[3-4]特征化BOW特征空间,以及潜在狄利克利分布(latent Dirichlet allocation,LDA)[5-6]通过概率将相似词组合成主题,并将文档表示为这些主题的分布。……

登录APP查看全文

猜你喜欢

语义单词文本
语言与语义
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
看图填单词
看完这些单词的翻译,整个人都不好了
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本
语义分析与汉俄副名组合