APP下载

融合知识图谱和ESA方法的网络新词识别

2019-03-21刘申凯周霁婷朱永华高洪皓

计算机技术与发展 2019年3期
关键词:语义文本实验

刘申凯,周霁婷,朱永华,高洪皓,3

(1.上海大学,上海 200072;2.上海大学 计算机工程与科学学院,上海 200444;3.上海大学 计算中心,上海 200444)

0 引 言

在互联网的高速发展下社交网络随之兴起,微信、微博等文本形式的使用量日益增多。这类文本的大规模使用对研究自然语言处理带来了新的挑战。在社交网络中,由于这类文本的篇幅较小,包含的信息量较少,会导致语义信息的不完全。另一方面,网络文本常会包含许多新词,这些网络新词会直接影响分词的准确性,从而对理解网络文本的语义内容带来了一定的困难。目前针对这类新词识别的主要研究方法包括基于规则、基于统计以及融合规则与统计方法。

基于规则的方法对于特定领域有较高的正确率,但是制定规则需要大量人工成本,存在规则跨领域性适应能力薄弱等问题。该方法主要研究中文语法、组词规则、词性特点以及领域本体等方面,总结新词的构词规则和模式特点来建立规则库,进而通过匹配度来识别网络新词。例如,邹纲等[1]针对网页上的中文新词识别问题,提出一种从网页中自动检测新词的方法,并根据构词规则对自动检测的结果进行过滤,最终抽取新词语。该方法对高频新词有很好的识别效果。Ma等[2]针对网络新闻中的未登录词,提出一种自下而上的归并算法,同时引入一些基本语法规则,避免了过多的高频垃圾串的抽取。

统计方法有很强的领域适应能力和可扩展性,但具有需要大规模语料库和数据稀疏严重等问题。……

登录APP查看全文

猜你喜欢

语义文本实验
记一次有趣的实验
语言与语义
在808DA上文本显示的改善
做个怪怪长实验
基于doc2vec和TF-IDF的相似文本识别
NO与NO2相互转化实验的改进
实践十号上的19项实验
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊