基于主动学习的中文问题分类数据集构建
2012-09-02邱锡鹏缪有栋黄萱菁
哈尔滨工业大学学报 2012年5期
邱锡鹏,缪有栋,黄萱菁
(复旦大学计算机科学技术学院,201203上海)
问题分类(Question Classification,QC)是开放领域问题回答(Question Answering,QA)系统的基础和前提,问题分类准确性直接影响整个问答系统的性能[1].在NIST举办的TREC QA评测会议推动下,问题分类的研究已取得很大的进展.但目前大部分问题分类的研究还集中在英文语料上,在中文问题分类的研究上,由于缺乏大规模的公开中文问题分类数据集,以及中英文的语言区别,因此中文问题分类的性能还达不到英文的水平,这给中文问题回答研究带来了一个主要瓶颈.因此,标注一个大规模的中文问题分类数据集是中文问答系统研究中非常急迫的工作.
在语料标注中首先需要确定的是标注规范.目前问题分类语料主要是针对事实类问题进行答案类型的标注,这样无法处理非事实类问题.本文根据问题类型和答案类型两方面进行标注.问题类型是定义用户提问的意图,比如“事实类”、“评价类”、“比较类”等.不同问题类型对应不同的处理方式以及答案生成策略.答案类型是定义返回答案的类型,比如:“人物”、“歌名”等.答案类型和问答系统中的其他模块一起配合工作,比如:命名实体识别、文档摘要和答案抽取等.因此根据Z.Dong等[2]的实体分类体系来确定答案类型的标注规范.
在构建数据集的方法中,主动学习方法[3-4](Active Learning)已经被证明是一种有效的减少标注工作量有效方法.主动学习是一种增量式的标注方法,每次只需要人工标注……
登录APP查看全文
