APP下载

一种基于均值的多维样本空间分类器的设计与实现∗

2021-03-22张燕红王卫玲王凤芹

计算机与数字工程 2021年2期

张燕红 王卫玲 王凤芹 杜 晶

(1.海军航空大学航空基础学院计算机教研室 烟台 264001)(2.烟台市地理信息中心 烟台 264003)

1 引言

分类算法是机器学习中的一个重点,是有监督的学习[1]。是一种利用一系列已知类别的样本来对模型进行训练,使其达到所要求的性能的过程。也就是说,先用一部分有种种特征的数据和每种数据归属的标识来训练分类模型,当训练完毕后,再让计算机用这个分类模型来区分新的“没见过”的、只有“特征”、没有类别标识的样本,完成该样本的分类,达到预测的目的[2]。分类算法有很多种,如朴素贝叶斯、决策树归纳、支持向量机SVM 等[5]。这些算法都有复杂的数学理论,没有数学基础的人很难理解,且算法复杂度较高。本文设计并实现了一种基于均值的多维样本空间分类器,简单易行,准确率高。

2 算法设计

本文假设N 维样本空间,即样本有N 个属性,一些被标记为类别X,一些被标记为非类别X。

2.1 分类器的训练

首先对每个训练样本,逐个考察其属性数据。其次,将每个训练样本的同一个属性数据组合起来构成一个决断值,用于对测试样本的单个属性进行区分。对训练样本的各个属性值,构建两组平均值:第一组是训练样本中所有类别X 的每个属性值的平均值;第二组是训练样本中所有非类别X 的每个属性值的平均值。训练完成后,得到了2N 个平均值,N个是类别X的、N个是非类别X的。

构建分类器的方法是:对每个训练样本属性,计算该属性的类别X 平均值和非类别X 平均值的中值,该中值就是类区分值,即决断值或分离值。……

登录APP查看全文