高度不平衡肠道图像数据集均衡策略
2022-06-21陈逸远古梦婷
科技创新与应用 2022年17期
陈逸远,古梦婷,李 胜
(浙江工业大学,浙江 杭州 310013)
医学图像数据蕴含了大量的生物特征信息,已经成为疾病诊疗中不可或缺的组成部分且日益重要。医学图像分类是医学图像分析中最重要的任务之一[1]。我国肠道疾病高发,严重危害人们身体健康,有效的肠道图像分类识别,对辅助医生进行肠道疾病的筛查、诊断、治疗方案制定等提供科学方法,对于提高疾病的诊断准确率、减少漏诊、提高医生工作效率等方面具有重要的实际意义。然而,医学图像数据经常面临数据不平衡和数据有限问题[2]。首先,由于疾病的多样化,发病概率不同,发病率低的病变集数量过少,每个病例中各种类别数据集分布不均衡。例如,肠道内窥镜的公开数据集Kvasir-Capsule[3]原始数据集中正常图像有34 606张,但是仅有肠道溃疡854张、出血446张,以及血红素12张等。其次,由于医学图像特别是对病例样本数据集的采集、标注和整理是一个繁琐及耗时耗力的过程。且由于病变差异很大,往往需要临床专家进行标注,另医院之间的数据共享和互通程度较低,获取用于大规模学习训练医学图像样本数据集非常困难,因此可用的标注数据规模相对较小[4]。
深度学习从样本数据中学习层次特征的特点,组合底层特征形成更加抽象的高层表示,最终提高分类或者预测的准确性,已在语音识别、自然语言处理、图像分类、人脸识别、目标检测等多领域取得突破性的好成绩[5-6]。深度学习特别是卷积神经网络已成为分析医学图像的首选方法,在医学图像分类应用取得显著的进步达到前所未有的精准度[7-8]。……
登录APP查看全文
