APP下载

基于感知器的中文分词增量训练方法研究

2015-04-21刘一佳车万翔

中文信息学报 2015年5期
关键词:模型

韩 冰,刘一佳,车万翔,刘 挺

(哈尔滨工业大学 计算机学院社会计算与信息检索研究中心,黑龙江 哈尔滨 150001)



基于感知器的中文分词增量训练方法研究

韩 冰,刘一佳,车万翔,刘 挺

(哈尔滨工业大学 计算机学院社会计算与信息检索研究中心,黑龙江 哈尔滨 150001)

该文提出了一种基于感知器的中文分词增量训练方法。该方法可在训练好的模型基础上添加目标领域标注数据继续训练,解决了大规模切分数据难于共享,源领域与目标领域数据混合需要重新训练等问题。实验表明,增量训练可以有效提升领域适应性,达到与传统数据混合相类似的效果。同时该文方法模型占用空间小,训练时间短,可以快速训练获得目标领域的模型。

中文分词;领域适应;增量训练

1 引言

词是汉语中的最小语义单元。由于汉语以字为基本书写单位,词与词之间没有明显的分割标记,中文分词成为中文信息处理的基础与关键,在信息检索、文本挖掘等任务中被广泛使用。近年来,基于统计的中文分词方法在新闻领域取得了很好的性能[1-4]。但随着互联网、社交媒体与移动平台的迅猛发展,当前中文分词方法处理的数据不单局限于新闻领域,不断增长的开放领域数据对中文分词方法提出了新的挑战。前人研究[5-7]表明,使用新闻领域资料训练的中文分词模型切换到诸如论坛、微博、小说等领域时,性能往往严重下降。

前人工作[6]将这种训练与测试领域的不一致导致模型性能下降的问题归纳为领域适应问题。……

登录APP查看全文

猜你喜欢

模型
一半模型
一种去中心化的域名服务本地化模型
适用于BDS-3 PPP的随机模型
函数模型及应用
p150Glued在帕金森病模型中的表达及分布
函数模型及应用
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用