APP下载

基于改进深度强化学习的自动泊车路径规划

2021-08-06兰凤崇陈吉清

关键词:智能

陈 鑫,兰凤崇,陈吉清

(华南理工大学 机械与汽车工程学院/广东省汽车工程重点实验室,广州 510640)

自动泊车的运动规划采用的方法可以分为基于规则的方法[1]和基于学习的方法[2-3]。与上述规划方法相比,深度强化学习具有求解能力强、能够自主探索等优点,许多研究学者和机构利用深度强化学习解决控制问题[4-5],收到了良好的效果。虽然基于深度强化学习的自动泊车路径规划有着良好的应用前景,但是对其在理论和应用层次研究较少,尚未有投入产业化的成功案例,要想大规模的应用和推广,仍存在探索效率低下、收敛困难等问题[6-7]亟待解决。

强化学习算法能够自主探索获得样本,但由于训练初期策略随机,无效样本众多,成功样本对神经网络权值改变的贡献容易被淹没,导致样本的利用率不高,甚至无法收敛。Peizhi Zhang等[8]针对固定位置,不同航向角的起始位姿,利用人工泊车的控制序列,对智能体(本文中车辆、智能体、算法模型等名词视语境具有相同含义)进行预训练,让智能体在初期不需探索就获得高回报值的样本。张斌等[9]将失败和成功的探索经验分别存储,并设置随训练回合数变化的采样比例,让智能体始终能从成功样本学习经验。张继仁等[10]借鉴AlphaGo[11]中的蒙特卡罗树搜索方法,生成泊车数据,并用奖励函数评价数据质量,筛选出最优数据训练智能体,避免了随机探索时低质量数据对智能体的影响。Schaul T等[12]以TD误差作为样本的优先级,利用SumTree数据结构存储样本,基于优先级采样,使对梯度计算贡献较大的样本更容易被采样。……

登录APP查看全文

猜你喜欢

智能
智能与自主
让纸变得智能
一种智能微耕机的研发
智能制造 反思与期望
智能前沿
智能前沿
智能前沿
智能前沿
智能制造·AI未来
争渡智能石化