APP下载

基于相似度的半监督学习工业数据分类算法

2021-11-10孙栓柱杨晨琛

南京航空航天大学学报 2021年5期
关键词:分类监督模型

孙栓柱,陈 广,高 阳,孙 彬,李 逗,杨晨琛

(1.南京大学计算机科学与技术,南京 210023;2.江苏方天电力技术有限公司,南京 211102)

数据分类问题是数据挖掘领域的典型问题,一个表现良好的分类模型,往往离不开充分的有监督数据的支持。然而在现实的应用场景之中,受限于数据标记的难度以及正负样本分布比例等一系列问题,含标记的有监督数据往往十分有限,并且这有限的标记据还会存在类别标签分布不平衡的情况。所以对于此类数据,基于其数据特点,如果将传统的分类算法应用于此类任务之中,往往会过拟合于标记数据中的多数类,难以识别出少数类,从而无法取得让人满意的效果。

针对一组给定的数据Data={(X1,Y1),(X2,Y2),…,(Xn,Yn)},从而预测一个离散值的任务被称为“分类”,依照输出分类目标类别的不同,分类任务可以被分为“二分类”与“多分类”。数据分类任务的目标便是在于建立输入空间X到输出空间Y之间的映射f:X↦Y。

数据分类任务往往需要有监督数据的支撑,有监督数据质量的高低很大程度上影响着模型分类的效果。对于大多数常见的公开数据集,一般拥有着大量的数据标记样本,且样本在类别上的相对分布比较均匀。然而在现实的某一应用场景之中,数据的质量与数量往往是机器学习任务所要面临的第一个难题,这很大程度上制约了模型的效果。

现实场景下分类任务的的数据一般包含以下难题:

(1)数据的有监督信息有限。现实场景中的机器学习任务,很可能积攒了十分丰富的历史数据,然而这些数据中包含标记的数据十分有限,所以从有监督学习的角度来看,大量数据无法构造监督信息,从而造成模型仅能从有限的数据中学习特征。……

登录APP查看全文

猜你喜欢

分类监督模型
一半模型
分类算一算
突出“四个注重” 预算监督显实效
重尾非线性自回归模型自加权M-估计的渐近分布
教你一招:数的分类
监督见成效 旧貌换新颜
夯实监督之基
3D打印中的模型分割与打包
监督宜“补”不宜“比”