数据不依赖获取的质谱数据的深度学习分析方法
2021-02-02何情祖钟传奇帅建伟韩家淮
何情祖,钟传奇,李 翔,帅建伟,3*,韩家淮,3*
(1.厦门大学物理科学与技术学院,福建厦门361005;2.厦门大学生命科学学院,福建厦门361102;3.厦门大学健康医疗大数据国家研究院,福建厦门361102)
蛋白质谱仪的采集策略可以分为数据依赖获取(data-dependent acquisition,DDA)和数据不依赖获取(data-independent acquisition,DIA)两种.鸟枪(shotgun)法是一种典型的DDA采集模式[1].在鸟枪法实验中,质谱仪自动选择强度排名前N名的肽离子进行破碎,并记录所得的碎片离子质谱图.由于鸟枪法只选择强度排名靠前的肽段进行打碎,具有一定随机性,这使得鸟枪法检测到的肽段重复性较差.
为了解决DDA检测到的肽段重复性差的问题,2012年瑞士Gillet等[2]与AB-SCIEX公司联合开发出DIA相应的采集模式——全碎片离子顺序窗口化获取(sequential windowed acquisition of all theoretical fragment ions,SWATH).SWATH是一种典型的DIA模式,与传统的质谱数据采集方法相比,SWATH模式通过高速扫描每个荷质比窗口内所有的肽离子,并将其裂解成子离子,从而获得肽段和碎片完整的信息.相比于DDA,DIA模式具有通量高、特异性好、灵敏度高、定量结果重复性高等特点.但是DIA的质谱数据极其复杂,不同肽段的信号混合在同一张谱图内,加大了数据分析的难度.
为了分析DIA质谱数据,相关算法的开发一直是研究热点.2014年Rost等[3]提出一种文库依赖的SWATH质谱数据分析方法:OpenSWATH.该方法先使用DDA质谱数据进行数据库搜索,建立肽段的目标文库,然后根据目标文库对DIA质谱数据进行定量分析.2015年Tsou等[4]提出一款开源软件DIA-Umpire,直接分析DIA模式下的质谱数据,省去了DDA实验.在使用质谱技术研究生物学……