基于多分类器融合的防震减灾知识文本分类研究
2021-01-22李晓丽马龙龙
高原地震 2020年3期
李晓丽,马龙龙
(1.防灾科技学院应急管理学院,河北三河 065201;2.中科院软件研究所,北京 100190)
1 引 言
本文提出一种基于多分类融合的文本分类方法引入到防震减灾领域,从现有的科普宣传材料入手,围绕地震监测预报 、震害防御和紧急救援几个方面进行筛选甄别,充分保证电子宣传材料内容的科学性和规范性。
2 文本分类技术现状
文本分类是指通过一定的规则,将一篇或多篇文本划分为不同的类别,并根据这些类别进一步地使用或处理文本,比如发现用户潜在兴趣、信息推送、信息过滤、搜索引擎、信息整合、网站导航及数字图书馆等。文本分类方法主要包括词匹配法、基于规则的方法和基于统计学习的方法。
词匹配法是根据某些关键词是否在文本中来判断该文本是否属于特定的一类,而这个检索与匹配的过程可以使用一些常见的字符串匹配算法来进行,例如 Knuth-Moris-Pratt 算法[1]。对于字或者字符组成的模式的严格匹配,这种分类法相对比较简单且易于实现,在垃圾邮件过滤领域[2-3]比较常见,但是对于关键词及其变体的识别需要实行额外的策略进行判断,影响了其效率。
基于规则的方法是由专业人员为每个类别根据通用的原则和自身的经验,定义大量的规则,如果待分类的文本满足某个类别的部分或者全部规则,则可以判断它属于这一类别[4]。然而,基于规则的方法有着自身的弊端——过于依赖专家对于规则的定义。首先,聘用专家来编写分类规则意味着高昂的人力成本;……
登录APP查看全文
