基于近端策略优化算法的频谱切换问题研究*
2021-08-30李淑丰于玉江
李淑丰,邵 尉,谢 然,于玉江
(1.陆军工程大学,江苏 南京 210000;2.31107 部队,江苏 南京 210000;3.江苏省生态环境监控中心,江苏 南京 210002)
0 引言
认知无线电(Cognitive Radio,CR)技术作为应对频谱资源短缺问题的有效手段,近年来备受关注。认知用户/次用户(Secondary User,SU)机会式地接入提前划分给授权用户/主用户(Primary User,PU)的空闲信道。为了不对主用户造成影响,当主用户返回信道时,次用户必须立刻中断传输让出信道。因此,频谱切换技术在认知无线网络(Cognitive Radio Network,CRN)中必不可少。频谱切换的目的是将次用户对主用户产生的影响最小化,同时通过适时和智能化的频谱切换,可以将次用户自身因中断受到的影响降到最低,最大程度上保证次用户的性能要求。
频谱切换问题一般可以转换成顺序决策问题,从而建模成马尔科夫决策过程(Markove Decision Process,MDP),通过优化方法得到最优解。强化学习(Reinforcement Learning,RL)可以提供一种稳健的方法,在不确定的动态环境下处理MDP问题,而难以优化的目标也可以在RL 框架中通过设计与最终目标相关的奖励得到很好的解决[1-2]。强化学习分为两类不同的算法:基于价值函数的最优价值(Optimal Value,OV)算法和基于策略的策略梯度(Policy Gradient,PG)算法。OV 算法在学习过程中不断更新值函数,策略的评估和改进都需要依赖值函数。常用的最优价值算法包括基于模型的动态规划方法、无模型的蒙特卡洛方法和时间差分方法(如SARSA、Q-Learning 算法)。PG 算法直接基于长期回报期望进行优化,使用的是基于梯度的优化方法,在学习策略模型过程中表现更稳定。常用的策略梯度算法包括REINFORCE 方法和演员-评论家(Actor-Critic,AC)类方法。……
