APP下载

带Q网络过滤的两阶段TD3深度强化学习方法

2023-10-21周娴玮包明豪余松森

计算机技术与发展 2023年10期
关键词:深度动作智能

周娴玮,包明豪,叶 鑫,余松森

(华南师范大学 软件学院,广东 佛山 528000)

0 引 言

深度强化学习是一种解决决策性问题的算法,在自动驾驶[1]、机器人控制[2]、无人机[3]等领域应用广泛。深度强化学习以“试错”的方式与环境进行交互,智能体通过学习这些交互过程产生的经验,以最大化环境中获得的累积奖励为目标,不断优化自身策略[4]。

常规的深度强化学习模型训练方式由“零”开始训练,即智能体的起始策略为随机初始化[5]。这种方式会导致智能体在与环境进行交互的前期阶段过程中,出现盲目性探索环境,样本学习率低,并没有良好、稳定的表现,这种现象也被有关学者定义为冷启动(Cold Start)[6]问题。

为解决冷启动问题,近些年来,有学者提出两阶段深度强化学习训练方式[7]。具体而言,使用A-C(Actor-Critic)演员-评论家模式的深度强化学习模型,通过采集专家演示数据[8],利用模仿学习对智能体进行预训练,而后采用深度强化学习进行下一步的训练。通过策略预训练,减少智能体前期盲目探索次数,提高学习效率,加快网络收敛速度,从而缓解训练前期的冷启动问题。

两阶段深度强化学习训练方式虽然能够缓和智能体冷启动问题,但是在智能体从模仿学习过渡至深度强化学习阶段后,可能出现专家演示动作被遗忘的问题,具体表现为性能和回报出现突然性回落的现象[2-3,9]。

造成该现象的主要原因有以下两个:

(1)若智能体在模仿学习阶段仅对Actor网络进行预训练,而Critic网络选择随机初始化[2,9]。……

登录APP查看全文

猜你喜欢

深度动作智能
深度观察
深度观察
智能前沿
智能前沿
智能前沿
智能前沿
深度观察
动作描写要具体
动作描写不可少
非同一般的吃饭动作