基于Transformer网络的中文单字词检错方法研究
2021-03-18曹存根
中文信息学报 2021年1期
曹 阳,曹存根,王 石
(1. 中国科学院 计算技术研究所 智能信息处理重点实验室,北京100190;2. 中国科学院大学,北京 10049)
0 引言
在日常使用计算机或手机等终端设备输入汉字时,人们在输入时的心理状态、输入习惯、误触按键或者文化水平等因素时常会造成文本中出现错别字。例如,在语句“黄金首饰带久了会发白”以及语句“我再这里等你好长时间了”中,“带”和“再”都是比较容易用错的单字词(称为中文单字词错误)。在此背景下,研究文本错误自动识别对于规范中文汉字的使用和提升用户感知体验具有重要意义。
针对多字词错别字情形,张仰森等[1]将多字词错别字分类为“非多字词错误”和“真多字词错误”。前者“非多字词错误”指由两个或两个以上的汉字构成的词中至少出现一个别字替换错误、缺字错误或者多字错误;该词也不是词典中的词。例如,“端庄”错写成“端壮”,而“端壮”在词典中无法找到。“真多字词错误”指一个多字词错成词典中的另一个多字词。根据错别字产生的替换、缺字以及多字这三种原因,刘亮亮等[2]将非多字词错误分类为“别字型非多字词错误”“缺字型非多字词错误”以及“多字型非多字词错误”。
虽然学术界对多字词检错方法研究较多,但据我们所知,对单字词检错方法的研究较少,本文重点研究中文单字词检错方法。
相比于中文多字词错误自动识别,中文单字词错误识别尤为困难,其原因主要体现在以下几个方面:
(1)单字词往往是多义词这些多义的单字词可以和不同的词组合,无疑增加了单字词错误识别难度。……
登录APP查看全文
