基于近邻传播聚类和TANE算法的高校数据中函数依赖的发现
2020-03-06黄永鑫唐雪飞
计算机应用 2020年1期
关键词:信息
黄永鑫,唐雪飞
(电子科技大学 信息与软件工程学院,成都 610054)
0 引言
高校信息化经过多年的发展,很多高校已积累了大量的业务和相关数据,数据不同于有形的产品,但同样具有质量这一概念,但是因为数据质量不高、冗余数据大量存在和数据可用性不高,使很多数据处理工作还需要通过人工来确保正确,浪费了大量的人力和时间[1]。
我国教育领域已初步解决数据的有无问题。然而,大量数据仍未得以充分应用,究其原因,除了教育工作者对数据价值重视不够等主观原因外,数据质量不高、数据状态不能适应当前教育发展也是重要的客观原因[2]。
数据缺失是数据质量问题的其中一种,在高校数据中,比如对于学工系统中的数据来说,造成数据缺失的原因可能是由于人工录入失误,也可能是在数据传输过程中造成了缺失。大量缺失值将使得从数据中发现出的数据质量检测规则不准确,使得领域专家无法根据发现出的数据质量检测规则有效修复数据集中存在的脏数据等问题。若直接将含有缺失值的数据删掉,会使得数据集中丢失的数据较多,进而使得基于该数据集所作出的数据分析结果产生较大偏差。
在高校信息化建设的过程中,通过开展高校数据治理以提高数据质量,可以有效提高数据价值,为组织决策的制定提供帮助。同时,通过对高校信息化建设中数据治理的研究,可以认清在高校信息化中存在的问题,有效促进我国高校信息化的建设[1]。……
登录APP查看全文
