APP下载

一种基于特征迁移的跨领域中文分词模型

2021-10-27张韬政张家健

关键词:特征实验模型

张韬政,张家健

(中国传媒大学信息与通信工程学院,北京 100024)

1 引言

中文分词一直被视为是其他中文自然语言处理任务的前提,由于汉语不像英语一样在书写过程中天生带有空格来表明词与词之间的分界,所以许多自然语言处理技术在中文领域中不能正常运行,因此,如何将中文进行快速、准确的分词成为了大家共同所关注的问题。

2003年,隐马尔可夫模型[1](Hidden Markov Model,HMM)和最大熵模型[2](Maximum Entropy Model,ME)是主要的分词方法。2004年,Peng[3]提出了将条件随机场(Conditional Random Fields,CRF)和分词相结合,解决了输出关联之间的问题。近几年人工神经网络飞速发展,深度学习也开始应用于解决中文分词问题,学者们开始使用循环神经网络解决句子的长期依赖问题,Chen[4]将长短期记忆网络(Long Short-Term Memory Networks,LSTM)引入到中文分词,使分词的准确率有了很大突破。在之后的几年里,门控循环单元和LSTM网络等及其双向结构,结合CRF,便成了中文分词的经典方案,一直沿用至今。2019年,谷歌[5]发布并开源了一种新的语言表征模型:BERT,即来自Transformer的双向编码器表征,其性能使自然语言处理领域的各个任务都有突破性的进步。至此,中文分词在封闭数据范围内的成绩已经十分可观。

然而,随着互联网时代飞速发展,各种新词层出不穷,旧词新用的现象屡见不鲜,这对中文分词又提出了新的挑战。同其他序列标注类任务一样,中文分词对于专业性强的法律、新闻、医疗、文学作品等特有领域来说,未登录词很可能出现激增的可能;在微博等互联网平台上,一方面,每时每刻都有新词新意不断诞生,另一方面,这些文本的句式、格式、语言习惯也和其他领域有着很大的不同;……

登录APP查看全文

猜你喜欢

特征实验模型
一半模型
记一次有趣的实验
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
做个怪怪长实验
不忠诚的四个特征
3D打印中的模型分割与打包
NO与NO2相互转化实验的改进
实践十号上的19项实验
线性代数的应用特征