一种基于强化Q 学习的跳频交会算法*
2021-08-30朱桢以谢钊萍
彭 艺,朱桢以,魏 翔,谢钊萍
(昆明理工大学,云南 昆明 650500)
0 引言
随着电磁环境的复杂化和用户数量的急剧增加,频谱资源的重要性日趋明显。大量无线频段被分配给专用设备,当专用设备不能充分利用授权频段且其他设备也没有适时接入授权频段时,往往造成频谱资源的浪费。传统跳频通信方法的效率较低,造成了大量频谱资源的浪费。针对授权的频段并没有被授权用户(Primary User,PU)充分利用的问题,文献[1]将认知无线电网络(Cognitive Radio Network,CRN)与跳频通信相结合,提出了利用未使用频谱的机会动态频谱分配(Dynamic Spectrum Access,DSA)技术,使次要用户(Secondary User,SU)以随机方式访问信道。文献[2]重点研究了共存状况下的SU 在占用相同PU 资源时的公平性问题,将SU 互相检测并建立一个公共的链路(Common Control Channel,CCC)的过程称为交会。交会是SU 间进行频谱管理、数据通信以及交换控制信息的重要操作。由于SU 间不能相互感知信息,在CRN 网络中实现交会是一个很有挑战性的难题。文献[3]提出了一种基于认知跳频网络的短交会跳频算法,经过公共控制链路实现有保证的短交会跳频算法,大大减少了交会时间。文献[4]引入了差分跳频系统,将差分跳频与拉丁方理论结合,利用拉丁方理论分配频率子集,实现了频率集的优化和动态分配,同时增强了跳频图案的随机性,增强了网络的抗干扰性能。
强化学习也称增强学习,是目前人工智能领域最热门的领域之一。2016 年,DeepMind 团队推出的AlphaGo在围棋对战中击败世界围棋冠军李世石,震惊世界。2017 年,进化后的AlphaGo 新版本,在乌镇举办的三番棋对战中3:0击败了世界第一柯洁。……
