APP下载

基于Q学习的能量自适应路由算法

2021-01-07黄庆东袁润芝

西安邮电大学学报 2020年4期

黄庆东,张 淼,袁润芝,陈 晨

(西安邮电大学 通信与信息工程学院,陕西 西安 710121)

Ad hoc网络已广泛应用在目标追踪和环境监测等场景中,但由于网络中没有固定的基础设施,节点能量、内存以及计算能力有限[1],需在Ad hoc网络路由设计中考虑节点能耗,从而延长网络生命周期。

Ad hoc 按需距离矢量路由协议[2](Ad hoc on-demand distance vector,AODV)和目的序列距离矢量[3](destination-sequenced distance vector,DSDV)通常以最短路由策略进行学习,而不能自适应地学习。当网络环境发生变化时,节点仍然会做出相同的路由策略,不能适应变化的网络负载和拓扑环境,且对最短路径节点过度使用会造成节点能量过早耗尽,使网络分割而降低网络生命周期。若将节点布置在虚拟网络拓扑中,虽然节省了路由能耗,但是基于假设条件的路由算法在实际路由应用中还是存在一定的局限性[4]。利用全网络能耗信息进行路由选择,在进行路径寻优时需要获取整个网络的能耗信息,不能及时反映网络的状态,而且会消耗大量的网络资源[5]。现有的路由算法还存在缺乏路由探索或需要以较高的通信开销代价进行探索等问题[6]。

针对现有路由算法的局限性,采用分布式人工智能算法可以解决复杂的分布式控制决策问题。强化学习(reinforcement learning,RL)是机器学习的一个分支,在控制包、内存和计算方面有着合理的开销[7]。其中,Q学习是一种常用的强化学习算法,Q学习经过有限步的迭代之后能够收敛到最优的动作值[8]。目前,已有许多基于Q学习的多Agent路由算法被相继……

登录APP查看全文