基于深度强化学习的蜂窝网资源分配算法研究
2021-08-04倪龙飞
数字通信世界 2021年7期
倪龙飞,白 倩
(黄河交通学院智能工程学院,河南 焦作 454950)
1 深度强化学习原理及影响要素分析
强化学习(Reinforcement Learning)的基本原理是,智能体在与环境的交互过程中,通过环境反馈的信息调整自身策略从而获得最佳对策的过程[1]。强化学习中一般包括:状态、动作、奖励、状态的转移概率、策略以及值函数。传统的强化学习在简单的场景中能取得好的结果,但是在现实中复杂问题较多,传统的强化学习不能满足需求,为了解决动作空间维数大的问题,谷歌团队首先将深度学习与强化学习有效结合,形成了人工智能的研究热点,深度强化学习由此产生。
1.1 智能体(agent)要素
智能体是在人工智能技术应用背景下能够与外界环境进行人机交互的实体,其作为一种能够自主活动的软件或者硬件实体,能够在环境中基于自身的意图或者算法来与其他智能体进行交互,并且在环境应用的过程中不断修改自己的行为,从而更好地适应智能化、信息化的环境需求[2]。其中,智能体的应用主要受到策略(Policy)、价值函数(Value Function)和模型(Model)三个方面的影响。从策略的角度看,其主要是作为一种方向性的经验指导来指挥智能体的操作,无论是作为确定性策略还是随机性策略,都是基于特殊的现状或者预测性现状而形成的一种方向性的指令。
1.2 状态(state)要素
状态是智能体执行一项指令过程中所存在的器械环境,其主要包括三个方面的内容,分别是外界环境状态(Environment State)、智能体状态(Agent State)和信息环境状态(Information State)。……
登录APP查看全文
