APP下载

面向海量星表数据的高效的时序数据生成方法研究

2021-04-15熊聪聪付立艳

计算机应用与软件 2021年4期

熊聪聪 付立艳 赵 青

(天津科技大学人工智能学院 天津 300457)

0 引 言

时序数据生成是天文学家进行天体时域分析的基础,所谓时序数据生成是将来自不同拍摄时间、不同星表中数据,通过交叉证认方法对确定为同一星体的数据,按照时间顺序排序生成每个天体时间序列数据[1]的过程。

时序数据的生成的难点主要包括两点:(1) 随着时域观测设备的发展,数据的采集能力越来越强,具有在时间轴上频繁采样的特点,这导致数据量巨大[2]。如南极AST3望远镜,其每天数据采集量高达360 GB。再如兴建中的宽视场瞬变源巡天设备地面广角相机阵[3](GWAC),每15 s产生1.1 GB数据,每个观测夜入库仅星表数据高达2 TB。面对庞大的数据量,高效的时序数据生成方法成为难点,数据的存储、查询、证认计算等方面均需要优化设计[4]。(2) 时序数据生成需要对时间轴上每两次观测的数据进行证认计算,计算量高于普通天体交叉证认计算。为了实现大规模星表的交叉证认,高丹[5]提出了基于HTM索引和kd-tree的交叉证认方法,文献[6-7]针对漏源问题,采用基于HTM和HEALPix两种分区的混合证认计算算法,Zhao等[8-9]提出了基于MPI的多核并行交叉证认算法,通过基于位运算的快速相邻块编码推导算法高效地取得误差半径范围内全部需证认数据,解决了边缘漏源问题,但仍然无法满足批量多星表间的证认需求。徐洋等[10-11]提出基于等经纬分区二维空间网格的方法,万萌等[12]采用列存储内存数据库MonetDB提高数据访问性能,在关系型数据库方法中取得了较好的效率。……

登录APP查看全文