基于SVM的生物医学事件触发词识别研究
2015-08-09魏培文段德全孙印杰毛文涛
信阳师范学院学报(自然科学版) 2015年3期
魏培文,段德全,孙印杰,毛文涛
(河南师范大学, 河南 新乡 453007)
0 引言
为了提高对海量文本信息管理的自动化程度,许多研究学者在事件抽取领域投入了大量的精力.在生物医学领域内,做好事件触发词的识别是事件抽取中比较关键的一步,有必要对生物医学事件触发词的识别进行深入研究[1-5].
在进行生物医学事件抽取研究中,针对通用的特征很难找到,且对语料的要求和依赖性对总体识别准确率的影响.本文通过对生物医学的领域知识进行学习,把事件抽取的过程简化为分类问题,经过文本信息的预处理、事件触发词的识别、事件元素识别、后处理,其中在事件触发词识别的过程中,采用支持向量机(SVM)多分类任务来处理.通过实验,该方法有效地实现了触发词的识别与抽取.
1 生物医学事件抽取的相关知识
1.1 信息抽取
面对海量的信息,能够对信息进行自动分类、提取和重构,使人们快速从中获得有价值的信息,这就称为信息抽取技术,传统的信息抽取系统在实现方法上与其他自然语言处理问题的研究方法类似[6],并且笼统地划分为基于机器学习的统计方法和基于分析的方法.
1.2 机器学习
机器学习是人工智能领域的一个重要研究方向,它能够让我们从数据集中受到启发,利用计算机来彰显数据背后的真实含义,是机器学习的目的.分类是机器学习的主要任务.
1.3 生物医学事件抽取
事件抽取实质上是指基于实体层面的……
登录APP查看全文