APP下载

基于Active Learning的中文分词领域自适应

2015-04-21许华婷张玉洁杨晓晖徐金安陈钰枫

中文信息学报 2015年5期
关键词:方法模型系统

许华婷,张玉洁,杨晓晖,单 华,徐金安,陈钰枫

(北京交通大学 计算机与信息技术学院,北京 100044)



基于Active Learning的中文分词领域自适应

许华婷,张玉洁,杨晓晖,单 华,徐金安,陈钰枫

(北京交通大学 计算机与信息技术学院,北京 100044)

在新闻领域标注语料上训练的中文分词系统在跨领域时性能会有明显下降。针对目标领域的大规模标注语料难以获取的问题,该文提出Active learning算法与n-gram统计特征相结合的领域自适应方法。该方法通过对目标领域文本与已有标注语料的差异进行统计分析,选择含有最多未标记过的语言现象的小规模语料优先进行人工标注,然后再结合大规模文本中的n-gram统计特征训练目标领域的分词系统。该文采用了CRF训练模型,并在100万句的科技文献领域上,验证了所提方法的有效性,评测数据为人工标注的300句科技文献语料。实验结果显示,在科技文献测试语料上,基于Active Learning训练的分词系统在各项评测指标上均有提高。

中文分词;领域自适应;主动学习

1 引言

传统的中文分词方法是基于词典的方法,主要有正向最大匹配算法、逆向最大匹配算法、N-最短路径分词算法等。随着标注语料库的建立和统计机器学习的发展,基于统计的中文分词方法成为主流方法。常用的统计机器方法包括:基于隐马尔可夫模型(Hidden Markov Model,HMM)的中文分词方法[1]、基于最大熵模型(Maximum Entropy, ME)的中文分词方法[2]和基于条件随机场模型(Conditional Random Fields, CRF)的中文分词方法[3]等。

当中文分词任务的领域发生变化时,未登录词的比例会上升,导致中文分词系统的精度大幅下降。……

登录APP查看全文

猜你喜欢

方法模型系统
一半模型
Smartflower POP 一体式光伏系统
WJ-700无人机系统
ZC系列无人机遥感系统
重尾非线性自回归模型自加权M-估计的渐近分布
连通与提升系统的最后一块拼图 Audiolab 傲立 M-DAC mini
3D打印中的模型分割与打包
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼