APP下载

中文分词研究综述

2021-04-23王佳楠梁永全

软件导刊 2021年4期
关键词:方法模型

王佳楠,梁永全

(山东科技大学计算机科学与工程学院,山东青岛 266590)

0 引言

随着自然语言处理的发展,分词作为基础任务成为研究重点,中文因其复杂性和特殊性成为分词热点话题。中国知网和Web of Science 的相关论文显示,自2010 年分词研究达到小高峰后,中文分词研究热度再次缓步增长,见图1、图2。但是,作为自然语言处理的基础任务,分词究竟有没有必要,Li 等[1]在2019 年ACL 会议上提出此观点,并在机器翻译、文本分类、句子匹配和语言建模4 个NLP任务上验证分词的非必要性,但这并不说明分词研究不再有意义。词级别模型欠佳表现在数据稀疏、过拟合、OOV以及数据迁移能力缺乏等,要解决此类问题,提高分词性能仍有重大意义,例如谷歌提出的知识图谱概念。知识图谱强大的语义关联能力为网络搜索提供便利。知识图谱本质是一种语义网络,用图的形式描述客观事物,由边和节点组成。边一般指关系和属性,节点指概念和实体。现实中,书本和网页中的内容属于非结构化或半结构化数据,无法直接构建知识图谱,分词成为构建知识图谱的第一步。英文通过空格区分单词,中文则需要根据上下文信息理解分词,但这对于计算机而言相当困难。

Fig.1 Statistics on the number of word segmentation documents of CNKI图1 中国知网分词文献数量统计

Fig.2 Statistics on the number of word segmentation documents in Web of Science图2 Web of Science 分词文献数量统计

本文通过详细阅读近20 年文献资料,总结归纳中文分词的瓶颈和算法,提出新的瓶颈及改进方向。

1 中文分词瓶颈

1.1 粒度选择

由于中文的复杂性,分词时粒度的选择尤为重要。……

登录APP查看全文

猜你喜欢

方法模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
学习方法
3D打印中的模型分割与打包
用对方法才能瘦
FLUKA几何模型到CAD几何模型转换方法初步研究
四大方法 教你不再“坐以待病”!
赚钱方法
捕鱼
一个相似模型的应用