基于近视筛查数据的近视影响因素分析和近视预测
2021-04-09黄峻嘉苏宇涵
黄峻嘉,张 琪,赵 娜,李 蓉,苏宇涵,周 涛
(1. 云南大学软件学院 昆明 650504;2. 小艾眼科诊所,艾视医疗科技成都有限公司 成都 610041;3. 电子科技大学大数据研究中心 成都 611731)
2010 年全球近视人群约有19.5 亿,占世界总人口的28.3%[1]。2018 年我国儿童青少年总体近视率为53.6%[2],远超国际水平[3]。目前美国[4-5]、新加坡[6-7]、澳大利亚[8]等国家已采用队列研究的方法对儿童近视影响因素展开研究。国内也有不少针对中国各城市青少年近视情况的分析,如上海[9-10]、安阳[11]、广州[12]、温州[13]、北京[14]等。文献[15]分析了来自Orinda 近视纵向研究的数据子集MYOPIA,认为父母近视情况、户外运动时间、阅读时间和性别等因素对近视有较大影响。Orinda近视纵向研究[15-17]、CLEERE 父母近视史的研究[18]以及近视影响因素研究[19]都认为青少年早期屈光度能够用于预测其未来近视的发生。文献[20]分析了长达10 年的临床屈光数据,发现机器学习方法可以有效预测高度近视发生的几率。
现有研究中使用最多的方法为队列分析和逻辑回归[21]。其中队列研究是探讨疾病病因的常用方法之一,能较好地揭示两事件间的因果关系。但设计和组织实施较难,收集与分析资料较复杂。逻辑回归分析其决策面是线性的,难以处理数据不平衡的问题。本文利用斯皮尔曼相关系数(spearman's rank correlation coefficient)[22]分析各影响因素与未来视力的相关性,并细分高度近视与普通近视随年龄的变化情况。斯皮尔曼相关系数是衡量两个变量的依赖性的非参数指标,利用单调方程评价两个统计变量的相关性,适用于总体分布未知或有序变量相关性分析。……
