采用多级特征的多标签长文本分类算法
2021-08-06王浩镔
计算机工程与应用 2021年15期
王浩镔,胡 平
1.西安交通大学 软件学院,西安 710000
2.西安交通大学 管理学院,西安 710000
随着互联网产业的变革和移动社交平台的飞速发展,问答社区凭借着良好的交互特性为知识传播提供了新的渠道和平台。与此同时,人们对知识的专业性、时效性以及获取知识的速度有着更高的要求,这些因素的累计推动了问答社区的飞速发展,问答社区的活跃用户数呈爆发式增长,随之增加的是大量的用户交互数据和文本数据。与普通文本相比,这些网络文本数据大都是未经规范化加工编辑的长文本,包含诸多新词以及网络词语,问答社区文本数据的这些特点无疑增加了研究的难度。根据研究目的对文本数据进行分类是数据挖掘的重要手段,目前的分类算法重要集中在二分类和多分类领域,这种分类算法只允许分配一个标签给文本对象,这类算法也被称为单标签分类。由于问答社区文本数据语义丰富,一个回答文本可能涉及多个标签,因此,未经处理编辑的非标准长文本的多标签分类是一个亟待解决的问题。
1 文本多标签分类算法研究综述
随着大数据时代的到来,多标签文本分类(Multilabel Classification)算法引起了更多学者的关注。Zhang等[1]认为有效利用标签相关信息是多标签分类技术成功的关键。现有标签相关性策略可以大致分为三大类:(1)一阶策略,多标签分类任务采用label-by-label 方式处理,从而忽略了其他标签的共存。(2)二阶策略,通过考虑标签之间的成对关系,来解决多标签分类任务。……
登录APP查看全文
