基于Siamese循环神经网络的泰文句子切分方法*
2021-12-23线岩团张志菊王红斌文永华
计算机工程与科学 2021年12期
线岩团,张志菊,王红斌 ,文永华
(1.昆明理工大学信息工程与自动化学院,云南 昆明 650500;2.昆明理工大学云南省人工智能重点实验室,云南 昆明 650500)
1 引言
泰文很少使用标点符号,句子间没有明显的分隔符,为泰文词法分析、句法分析和机器翻译等自然语言处理任务带来了额外的困难。
泰文也有标点符号,Unicode甚至提供了特殊的零宽度空格符ZWSP(Zero-Width SPace)用于分隔泰语词。然而,与英语不同的是,在实际应用中泰文很少使用标点符号,词语间通常也不用分隔符,而是用空格符分隔句子、短语和特殊词语,如称谓和姓名之间、标号和内容之间、括号和内容之间等[1]。所以,泰文句子切分不能依靠标点符号,而必须充分考虑段落的上下文信息。
目前,针对泰文句子切分的研究工作比较少,相关工作主要有基于规则的方法和基于统计机器学习的方法。早期基于规则的方法,利用上下文中出现的动词和连接词定义切分规则完成句子切分,但效果并不理想[2]。基于统计机器学习的方法,通过从句子中抽取的特征构建分类器实现句子切分。Mittrapiyanuruk等人[3]以词性的三元组作为特征,利用viterbi算法实现泰语句子切分。词性三元组方法的主要缺点是只考虑了上下文中的词性特征,没考虑词组搭配特征。基于Winnow算法的方法,利用上下文窗口中左右2个词及其词性作为句子切分特征,获得了更好的切分效果[4]。Slayden等人[5]以上下文中的词和词性作为特征,构建最大熵分类器,通过扩展训练语料取得了更高的空格符精确率space-correct。……
登录APP查看全文
