面向大数据处理应用的广域存算协同调度系统
2021-09-22张晨浩肖利民秦广军宋尧蒋世轩王继业
大数据 2021年5期
张晨浩,肖利民,秦广军,宋尧,蒋世轩,王继业
1. 软件开发环境国家重点实验室,北京 100191;2. 北京航空航天大学计算机学院,北京 100191;3. 北京联合大学智慧城市学院,北京 100101;4. 国家电网有限公司大数据中心,北京 100031
1 引言
传统高性能计算应用(如高能物理、气象预报、生物信息等)的计算和数据量大且跨域分布,而且随着移动互联网、物联网等新一代信息技术的蓬勃发展,新兴应用(如智慧城市、精准医疗等)也不断产生大量数据且这些数据分布更加广泛,从GB级、TB级发展到ZB级,甚至YB级。这促使数据密集型和计算密集型任务的数据规模和计算规模逐步增加[1-2],多中心协同处理海量数据正在成为发展趋势。高性能计算(high performance computing,HPC)平台也从传统的高性能计算领域逐步拓展到大数据处理领域,可有效满足大数据采集、过滤、索引、分析、处理所需的硬性要求[3]。为了满足数据处理的更大规模需求,国内外纷纷投入大量资源建立跨多超级计算中心(以下简称超算中心)的广域高性能计算环境,旨在提供规模更大、性能更强的数据处理平台,以支撑科学发现和科技创新。
美国国家科学基金会的极限科学与工程发现环境(XSEDE)[4]项目旨在将广域分散自治的多家机构互联,并实现广域资源共享,以提供更好的科学研发环境。XSEDE[4]可以存储、管理、处理海量的科学数据,为科学家提供一站式服务。作为一个集成了多种资源的单一虚拟系统,XSEDE[4]汇聚了超算、数据分析、数据存储等资源,可支持用户共享计算资源和数据,支持任务通过高性能计算机网络快速访问和检索数据,为多个领域的科学发现提供有力支持。……
登录APP查看全文
