基于深度学习方法的句子及语素边界划分研究
2017-09-20TolegenGulmira邬春学
电子科技 2017年9期
Tolegen Gulmira,邬春学
(上海理工大学 光电信息与计算机工程学院,上海 200093)
基于深度学习方法的句子及语素边界划分研究
Tolegen Gulmira,邬春学
(上海理工大学 光电信息与计算机工程学院,上海 200093)
针对哈萨克语的句子、单词及语素边界检测问题,文中提出了一种基于深度学习的边界检测方法:CNN-TSS模型。通过将边界检测问题视为序列标注任务,将句子、单词及语素的边界检测合并为一种任务完成。通过对CNN-TSS模型选取最优超参数,对不同语言进行了测试。实验结果表明,该模型在不使用额外特征的情况下,在性能上超过了基于传统方法的边界检测系统。
句子边界检测;语素边界检测;黏着语;深度学习
句子、单词及语素边界划分任务是词性标注[1]、机器翻译、篇章理解等自然语言处理(Natural Language Processing,NLP)任务的基础研究之一。该任务的主要目的是自动找出文本中句子、单词、语素的左右边界,使得处理后的文本可以用于其他的NLP任务当中。虽然在NLP研究中,所采用的语料都已经经过了人工标注和划分,当语料库添加其他新领域文本时,则首先需要对源文本做分句和分词等处理,如果分句和分词模型准确率比较高,则会有利于其他后续工作的开展。而且多数NLP应用在实际使用时,通常首先就需要对原文本进行分句和分词等处理。所以实现一种准确率较为理想的分句、分词模型是NLP任务的关键之一。
句子的边界通常由句号、问号、感叹号和省略号等符号来表示,然而这些符号使用会出现歧异,例如在英语的缩写词当中就会使用与句号等符号,这对句子边界的划分带来一定困难。……
登录APP查看全文
