基于Hadoop 的大数据运营系统
2021-07-16高海超常祎雯杨文峰冯学伟
科学技术创新 2021年19期
高海超 常祎雯 杨文峰 冯学伟 邓 哲 白 涛
(延安大学 数学与计算机科学学院,陕西 延安 716000)
1 概述
当下正处于大数据时代,用户在网络中的各种操作都会留下数据,数据背后的价值性毋庸置疑。各行各业对挖掘数据价值的需求日益剧增。对于电商企业来说,用户的点击、分享、加购物车、收藏、购买等历史数据可以对电商企业的发展和规划起到极大地指导作用,能够提高用户黏度,增强用户购物体验,帮助企业实现更好的运营效果。
为了更好的利用数据背后的价值,可利用计算机对历史数据进行分析。由于数据庞大,需要算力极高。可考虑采用分布式计算,以PC 机集群来对大数据进行处理,来弥补小型企业计算机性能低下的问题。同时采用分布式存储,还能更好的对数据进行存储及备份,提高系统容错性。
为使用户在购物时,能够得到系统推荐的,更贴合用户需求的商品。则需要对用户的过往操作数据进行分析,通过历史数据得出规律,并为用户推荐合适的商品是大数据运营系统最重要的目的。本文以商品推荐为例,通过Hadoop 分布式大数据处理框架,对销售数据以及用户行为数据进行清洗及分析,同时还使用Spark 提供的机器学习库中的多种算法来训练模型,并通过模型计算得到推荐值。使得用户在购物时,能够从多种维度收到来自平台的个性化推荐。以实现增强用户的购物体验,提高用户黏度,进而增大平台销售量。
2 分布式存储
由于本项目需要根据大量历史数据进行分析,才能得到更好的推荐结果,面对大规模数据,采用分布式的存储是非常有必要的。……
登录APP查看全文
