汉语冒号标注与自动识别方法研究
2016-05-04谷晶晶周国栋
中文信息学报 2016年3期
谷晶晶,周国栋
(苏州大学 计算机科学与技术学院,江苏 苏州,215006)
汉语冒号标注与自动识别方法研究
谷晶晶,周国栋
(苏州大学 计算机科学与技术学院,江苏 苏州,215006)
随着对篇章分析研究的逐步加深,标点符号研究成为了篇章分析与消歧的一个重要切入点。有效识别标点符号在句子中的作用,将有助于句法分析、篇章分析以及其他自然语言处理技术的发展。该文主要任务是实现汉语冒号的人工标注与自动识别,其中自动识别采取了规则法和基于统计的最大熵法。基于规则的方法比较简单且易于实现,最大熵方法把规则融入到统计之中,在实验结果中具有更好的识别效果。
汉语冒号分类;最大熵;篇章分析
1 引言
近年来,标点符号在篇章分析中起到的作用逐渐引起相关研究者的关注。汉语中常用的标点符号有十几种,其中逗号、冒号、分号和句号为句子的分割符号。逗号是所有标点符号中的使用方法最多的,有大量学者已经展开了逗号的相关研究工作。汉语冒号作为句子的分割符号,使用方法之多仅次于逗号。如果能够有效识别冒号在句子中的作用,将有助于句法分析、篇章分析甚至其他自然语言处理技术的发展。
Hobbs[1]认为篇章单元可以小到句子,大到篇章本身。Mann 和Thompson的修辞结构理论[2-3]与Hobbs模型很相似,并认为篇章单元可以小到短语。在汉语中,乐明[4]把汉语篇章的基本单元定义为小句,形式上小句是由句号、问号、叹号、分号、冒号等分割开的文字串。……
登录APP查看全文
