基于支持向量机的图书分类管理研究*
2021-02-25胡谦锋陈沁磊
计算机与数字工程 2021年1期
胡谦锋 陈沁磊
(1.南京中医药大学图书馆 南京 210000)(2.江苏省中医院 南京 210000)
1 引言
1.1 支持向量机的基本原理
Vapnik 提出的结构风险最小化原理指出要最小化期望风险必须同时最小化经验风险和VC 维,SVM 就是基于结构风险最小化的一种机器学习算法[1~2],其源自在线性且样本指标可分开情况下的最优划分面,结构如图1。

图1 SVM原理示意图
上图中,“●”符号和“○”符号表示两种不同的样本,H为假设最优划分线(所谓假设最优划分线,要求能将不同的样本划分出来,目标是0 错误,还要使两划分线中间间隔尽可能大,这样能使风险保持最小状态。使间隔尽可能大使推广性界中的置信范围最小,在实际应用中把风险降到最低,H1、H2分别为数据样本中距离最优划分线最近的平行划分直线,H1、H2和H中间的部分是分类间隔(margin)。从一维空间扩展到高维空间,假设最优划分线H就成为了最优划分面,而H1、H2上的训练样本点群,便成了距超平面最近的异类向量,我们称其为支持向量(Support Vector),如图1 中用圆圈标出的数据样本所示。一组支持向量可以确定一个超平面,且这个平面是唯一确定的。
1.2 支持向量机多类分类原理
给定训练子集{(x1,y1),…,(xl,yl)} ,其中,x∈Rn,yi∈{1 ,2,…,M},i=1,2,…,l。寻找Rn上的一个差别函数f(x),对于任一输入x给出相对应的y值。上述多类分类问题实质上就是找到一个把Rn上的点分成M部分的规则[4]。
下面是利用二值分类的方法构造一个n类分类器的方法与步骤。
1)构造n个二值分类规则,其中规则fk(x),k=1,…,n将第k类的训练样本与其他训练样本分开……
登录APP查看全文
