实时数据仓库中一种改进的数据流更新算法
2014-06-07潘郑冰戴牡红
计算机工程 2014年10期
关键词:实验
潘郑冰,戴牡红
(湖南大学软件学院,长沙410082)
实时数据仓库中一种改进的数据流更新算法
潘郑冰,戴牡红
(湖南大学软件学院,长沙410082)
为实现数据仓库中数据的高效集成,针对数据偏斜分布现象,提出一种改进的数据流更新算法EH-JOIN。该算法对传统散列连接方法进行改进,利用索引将部分频繁使用的主数据存储在内存中,解决了高速数据流下的磁盘频繁访问问题。实验结果表明,与MESHJOIN算法和R-MESHJOIN算法相比,EH-JOIN算法的服务速率在磁盘存储关系集保持适当大小时分别提高了96%和81%,在内存大小不同时提高了57%和48%。
实时数据仓库;数据转换;数据流更新;基于流的连接;哈希索引;偏斜分布
1 概述
为给企业提供及时有效的决策支持,实时数据仓库正在向数据新鲜度更高水平的方向发展,提供这些新的服务水平的工具和技术也正在迅速发展[1-2]。在实时数据仓库的环境下,数据更新中连接运算的选择主要取决于源数据的来源以及到达速率。源数据可能是突发性很强的大容量数据流,这会带来极大的磁盘I/O开销。由于存储在磁盘中查找表的访问速率相对缓慢,因此在连接操作中会出现瓶颈[3]。
为解决该问题,文献[4-5]提出一种MESHJOIN算法,特别针对一些如动态数据仓库的连续数据流和存储在磁盘中关系集的连接,但该算法对于连接组件之间的内存分配不够理想,而且访问磁盘存储关系采取的策略不够高效。文献[6]利用一种改进的算法解决了连接部件中内存的最佳分配问题。……
登录APP查看全文
