APP下载

基于K近邻算法的移动端个人信息分类研究

2021-02-11王波

中国新技术新产品 2021年22期
关键词:分类文本信息

王 波

(中金金融认证中心有限公司,上海 201210)

0 引言

随着信息网络的发展,大量个人用户及企业信息数据暴露在公众的视野中,这也暴露出互联网存在重大的安全隐患,为了保障数据的安全,如何对个人信息数据

进行分类保存是当下网络安全研究中具有实际意义的领域。2014 年,Verma 等人提出使用机器学习的文本分类(垃圾邮件)调查方法对传入的邮件进行分类,并删除不需要的信件。2012 年,王超学等人[1]利用 K-Means 算法对训练样本集进行聚类,得到了改进后的加权 KNN 文本分类算法。2019 年,邓晓衡等人[2]提出了一种基于词义和词频的向量空间模型改进方法,明显地提高了计算的效率和结果的准确性。

该文主要提出了一种基于K 近邻分类的个人信息分类算法,运用该算法对移动端隐私文本文件进行分类学习,以提升提取个人信息数据的效率以及分类的准确性,通过该分类方法对移动应用隐私文本进行多元化分类,并研究移动应用收集个人信息的情况,这个阶段的主要工作是对移动应用个人隐私文本进行分类、分析并给出可视化的结果。

1 个人信息数据分类

根据《App 违法违规收集使用个人信息行为认定方法》的相关规定,网络运营者收集、使用个人信息时应遵循合法、正当且必要的原则,公开收集、使用规则,明确收集、使用信息的目的、方式和范围,还必须经过信息所有者的同意。笔者对从互联网中依法收集的移动端应用的个人信息进行分类,将其分为8 类:位置信息、身份信息、财产信息、工作信息、交易信息、上网信息、教育信息以及车辆信息。……

登录APP查看全文

猜你喜欢

分类文本信息
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
订阅信息
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
如何快速走进文本
健康信息
健康信息(九则)