面向中文文本的情感信息抽取语料库构建
2015-04-21李寿山周国栋
中文信息学报 2015年4期
戴 敏,朱 珠,李寿山,周国栋
(苏州大学 计算机科学与技术学院自然语言处理实验室, 江苏 苏州 215006)
面向中文文本的情感信息抽取语料库构建
戴 敏,朱 珠,李寿山,周国栋
(苏州大学 计算机科学与技术学院自然语言处理实验室, 江苏 苏州 215006)
情感信息抽取是情感分析中的一个重要子任务。虽然该任务已经开展有一段时间,但是面向中文文本的情感信息抽取任务研究才刚刚起步。目前中文文本的情感信息抽取面临的首要困难在于现有的相关中文语料库还非常有限。为了更好开展中文文本的情感信息抽取研究,该文重点研究了中文语料标注体系,构建一个规模较大、标注类型丰富的中文情感信息抽取语料库。除了常见语料库标注的情感倾向性、评价对象、情感词等信息外,重点标注了评价对象的省略、无情感词情感句表达及极性转移等情况。由语料信息统计可知,该文所指出的特殊现象(例如,评价对象的省略)在中文情感表达中是非常普遍的,开展这方面的研究很有必要。该文所构建的中文文本语料库将为中文情感信息抽取任务提供语料基础。
情感分析;情感信息抽取;中文语料库
1 引言
随着互联网技术的飞速发展,愈来愈多的人们从被动接受信息转变为主动发布信息。互联网用户可以通过处理这些富含情感色彩的文本来了解公众对于某个产品或某个事件的看法、评价等。但是,随着这类信息的迅速膨胀,单靠人工方法来处理无疑是非常困难的,情感分析便应运而生了[1-3]。……
登录APP查看全文
