APP下载

基于配对排序损失的文本多标签学习算法

2020-10-21顾天飞彭敦陆

小型微型计算机系统 2020年10期
关键词:排序分类文本

顾天飞,彭敦陆

(上海理工大学 光电信息与计算机工程学院,上海200093)

1 引 言

文本分类是自然语言处理领域中的一项重要任务,是构建信息检索、对话机器人等复杂系统的基础.多分类假设类别之间是互斥的,即一篇文档有且只能归属于单个类别.而事实上,对象是多语义的,比如一篇新闻能同时标注上“体育”和“足球”标签.所以,多标签更适合用来对现实问题进行建模,并有其实际的应用背景和学术价值.

多标签学习存在多标签分类和标签排序两类任务[11],前者将标签集划分为与样本相关和不相关两部分,后者则预测标签之间的前后关系.上述两项任务存在共通性,多标签分类和标签排序之间是可以相互转换的,文献引入校准标签对排序的标签进行划分[14],而采用判别模型完成多标签分类时,样本对标签的后验概率天然具有可排序性[5].故而,学界和业界开始尝试将两项任务联合起来进行解决,并运用于不同的应用领域[6,9,16].大体上,这类方法基于以下思想,得分较高的标签更能体现样本的语义,模型应使正标签集排在负标签集之前,这样筛选出来的标签也更加精准[16],从这一角度看,标签排序考虑到了标签的相对关系.

对于文本处理,过去的研究普遍采用文本特征手工提取的方式[19,20].得益于深度学习的发展,端到端的深度表征模型已成为当今的主流[1-5,7,8,15].与此同时,深度模型的性能受到标注数据缺失和语义提取不足的限制.为此……

登录APP查看全文

猜你喜欢

排序分类文本
分类算一算
恐怖排序
在808DA上文本显示的改善
节日排序
基于doc2vec和TF-IDF的相似文本识别
刻舟求剑
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本