基于机器学习的肺癌生存预测模型研究
2021-05-25王婧
黑龙江工业学院学报(综合版) 2021年3期
王 婧
(淮北师范大学 计算机与技术科学学院,安徽 淮北 235000)
全球范围内,肺癌是所有癌症中发病率和死亡率最高的癌症。近年来,我国肺癌的发病率和死亡率呈明显上升趋势[1]。为了尽可能掌握疾病的原理,预测并提升病人的生存能力,研究员们通过胸部X光、计算机断层扫描、病历等材料出发进行研究。
生存预测作为热门研究方向,一直有不同领域的学者对其进行研究,最初常利用Cox模型发现规律[2-3],也有部分是基于优化方法进行研究,文献[4]使用微分表达式来选择数据的特征,在训练初期使用排序算法选择筛选对预测结果有效的特征,该筛选在提高预测准确性的同时,也减少了后续模型的计算时间。但是计算复杂度非常高,里面有大量涉及精确优化步骤,只适合少量样本的学习。近年来机器学习方法以较高的预测精确度、较快的运算速度等优势逐渐成为主流方法之一。Jose F. Velez-Serrano等人[5]关注胰腺切除术后生存情况,通过医学知识来提取人口学特征、医院容量、诊断相关死亡编码和切除手术类型等参数建立boost模型,达到了91.6%的预测精度。
采用机器学习方法进行生存预测研究的主要难点有两个,第一是经典机器学习方法无法察觉不均衡数据中少量样本的特征,比如文献[6]通过利用聚类法来发觉较少的类别并对其进行欠采样处理。但是算法发挥不稳定,随机性太高;第二是特征对最终的结果影响重大,因此很多研究都集中在特征选取工程上。……
登录APP查看全文
