基于配对排序损失的文本多标签学习算法
2020-10-21顾天飞彭敦陆
小型微型计算机系统 2020年10期
顾天飞,彭敦陆
(上海理工大学 光电信息与计算机工程学院,上海200093)
1 引 言
文本分类是自然语言处理领域中的一项重要任务,是构建信息检索、对话机器人等复杂系统的基础.多分类假设类别之间是互斥的,即一篇文档有且只能归属于单个类别.而事实上,对象是多语义的,比如一篇新闻能同时标注上“体育”和“足球”标签.所以,多标签更适合用来对现实问题进行建模,并有其实际的应用背景和学术价值.
多标签学习存在多标签分类和标签排序两类任务[11],前者将标签集划分为与样本相关和不相关两部分,后者则预测标签之间的前后关系.上述两项任务存在共通性,多标签分类和标签排序之间是可以相互转换的,文献引入校准标签对排序的标签进行划分[14],而采用判别模型完成多标签分类时,样本对标签的后验概率天然具有可排序性[5].故而,学界和业界开始尝试将两项任务联合起来进行解决,并运用于不同的应用领域[6,9,16].大体上,这类方法基于以下思想,得分较高的标签更能体现样本的语义,模型应使正标签集排在负标签集之前,这样筛选出来的标签也更加精准[16],从这一角度看,标签排序考虑到了标签的相对关系.
对于文本处理,过去的研究普遍采用文本特征手工提取的方式[19,20].得益于深度学习的发展,端到端的深度表征模型已成为当今的主流[1-5,7,8,15].与此同时,深度模型的性能受到标注数据缺失和语义提取不足的限制.为此……
登录APP查看全文
