本发明涉及自动驾驶,尤其涉及一种基于深度强化学习的车辆最优控制方法。
背景技术:
1、自动驾驶已经被真实应用在我们的生活里面,并且其安全能和可靠性已经经过严格的测试。自动驾驶需要很多的关键技术的融合,如slam、路径规划等。然而自动驾驶面临复杂多变的道路环境条件,其规则难以抽象为公式或简单逻辑。随着深度表示学习的发展,强化学习领域已经成为一个强大的学习框架。强化学习作为机器学习的一个分支,旨在训练智能体在智能体与未知环境不断交互的过程中,通过强化和惩罚的方式完成任务。rl在移动车辆方面已经有很多优秀的研究工作,一些研者如使用rl进行局部的避障、端到端的自动驾驶、自动泊车。对车辆最优控制控制的较多侧重车俩的纵向速度或者车辆的横向控制。然而很少关注车辆整体最优控制问题,本专利讨论的是运动规划中的一个子问题,即在确保车辆的动态稳定性的前提下以近似最优速度控制车辆贴合规划路径进行移动,并最小化移动时间。
2、保证车辆的动态稳定性是最优控制的前提,动态稳定性指的是车辆不会发生侧移、倾翻、移动停顿等。mpc(model predict control)在车辆上的控制应用广泛,mpc目的是稳定车辆的行为,同时跟踪指定的路径,通过对车辆的运动学进行建模,优化约束目标函数,求解出最优控制数值。如在使用mpc沿着特定轨道高速驾驶赛车。预测系统未来动态、求解优化问题、控制是mpc在每一个时刻的循环计算过程。mpc在每个控制周期都需要重新利用未来n步的模型计算得到当前执行的控制指令,mpc利用了一个比原始空间模型大很多的模型(更高的计算成本)仅仅只得到当前一步的最优控制值,其对对计算硬件性能具有一定的要求。显然,对于搭载低性能处理器的车辆这种方法不适合,如automated guidedvehicle采用的往往是低性能的处理器。
3、与mpc相关的有pure pursuit control,纯追踪控制是简单的几何控制器,对计算能力要求很低,在树莓派这样的低性能单板机上也能高速运行,成为了一种流行的前轮转向车路径跟踪算法。pure pursuit是一种p类控制器,前馈距离过短会引起车运动的横向震荡,过长则会导致在路径弯曲点的拟合度不足。工程上常常让前馈距离随速度增大而增大。尽管如此,它们的性能相当受限于相对较低的速度,需要配合适合的速度控制器才能让pure pursuit适用在高速场合。因此,亟需一个对计算资源要求低、控制率高的最优化控制的模型。由于最优控制受车辆动态能力的影响,例如加速度、摩檫力、离心力等,还需要要求控制模型具有较强的鲁棒性来确保车辆在运动过程中稳定。
技术实现思路
1、为了解决上述技术问题,本发明提出一种基于深度强化学习的车辆最优控制方法,是在基于一定的先验知识下强化学习方法,确保车辆在动态稳定性的前提下以近似最优速度控制车辆贴合规划路径进行移动,并最小化移动时间。
2、为了达到上述目的,本发明的技术方案如下:
3、一种基于深度强化学习的车辆最优控制方法,包括如下步骤:
4、步骤1,建立策略网络和两个相互独立的价值网络,并初始化网络参数;
5、步骤2,在仿真系统中控制车辆以最优的速度沿已规划路径行驶,提取车辆当前状态st,将状态st输入到策略网络中得到t时刻的动作at,车辆根据所述动作与仿真系统交互获得t+1时刻车辆的状态st+1,根据奖励函数计算出奖励rt,将四元组(st,at,st+1,rt)作为数据样本;基于数据样本构建经验池;
6、步骤3,从经验池中随机抽取数据样本并将数据st、at分别输入两个价值网络中获取两个价值评分并取其中较小值来计算t+1时刻的预测得分;将状态st+1输入到策略网络中得到t+1时刻车辆做出的动作at+1,将数据st+1、at+1分别输入两个价值网络中获取t+1时刻的两个价值评分并根据t+1时刻的两个价值评分和预测得分来确定td误差,基于td误差对两个价值网络进行更新;
7、步骤4,每更新两次价值网络之后对策略网络进行一次更新;
8、步骤5,重复步骤2至步骤4,进行网络参数调优,直至达到最大迭代次数或策略网络达到预期的效果,输出最终更新得到的策略网络。
9、优选地,还包括如下步骤:将所述最终更新得到的策略网络作为最优策略用于智能车的部署。
10、优选地,所述状态、动作以及奖励分别定义如下:
11、状态定义:车辆行驶速度v,车辆转向角θ,并将已规划路径抽象为一系列距离相同的点p={p1,p2,p3,....pn},从中取前m个点记为p={p0,p1,p2,p3,....pm},3<m<n,车辆速度方向与车辆后轴连线中点分别与p0,p1,p2,p3,....pm连线的夹角集合记为a={α0,α1,α2,α3,....αm},车辆后轴中点到规划路径之间的距离记为derror,将v、θ、a、derror组成一个多维向量作为当前状态向量s;
12、动作定义:动作即为车辆根据当前情况选择的策略,由加减速和转向组成;
13、奖励定义:奖励公式如下:
14、r=rover+rspeedup+rlengthen+rdeviation+f1(α,v)+f2(v,ld)
15、rspeedup=-μv2+μ'v-150
16、rlengthen=-ωld2+ω'ld-150
17、
18、其中μ、μ'、ω、ω'、ρ、ρ'为预设常数,根据预先实验确定;rover为道路奖励;rspeedup为速度提高奖励;rlengthen为前视距离变长奖励;rdeviation为路径拟合奖励;f1(α,v)为速度奖励;f2(v,ld)为前视距离奖励,v为车速;ld为前视距离;α为路径曲率,f1(α,v)和f2(v,ld)均根据先验经验设定。
19、优选地,所述路径曲率采用平均曲率,公式如下:
20、
21、其中pi∈p为规划路径抽象点的前m个。
22、优选地,基于深度强化学习td3构建所述策略网络和两个相互独立的价值网络,其中,
23、所述策略网络,用于利用vq将夹角集合a进行离散化处理,获得离散向量;将离散向量输入时域卷积网络,获得卷积向量,所述时域卷积网络的激活函数采用lekereluactivation,并在每层的输入进行中心化处理;将卷积向量与[θ,v,derror]向量进行合并并输入全连接层,输出下一时刻的预测动作;
24、所述价值网络,用于利用vq将夹角集合a进行离散化处理,获得离散向量a;将离散向量a与[θ,v,derror,ld,speed]向量进行合并并输入全连接层中,输出价值评分。
25、优选地,将数据st、at分别输入两个价值网络中获取两个价值评分并取其中较小值来计算t+1时刻的预测得分公式如下:
26、
27、
28、
29、式中,qθ1和qθ2为价值网络,γ为折扣率,w1,now和w2,now是价值网络的参数,和分别是对当前数据st、at的价值评分。
30、优选地,将状态st+1输入到策略网络中得到t+1时刻车辆做出的动作at+1,将数据st+1、at+1分别输入两个价值网络中获取t+1时刻的两个价值评分并根据t+1时刻的两个价值评分和预测得分来确定td误差,基于td误差对两个价值网络进行更新,具体公式如下:
31、
32、
33、
34、
35、
36、
37、式中,β为学习率,为对当前策略的预测得分,δ1,j和δ2,j为预测得分与价值网络得分的差值,qθ1和qθ2为价值网络,表示对参数进行求导,w1,now和w2,now是价值网络的参数,w1,new和w2,new是更新过价值网络的参数。
38、优选地,所述策略网络更新,公式如下:
39、
40、
41、式中,τ为学习率,表示对参数进行求导,为策略网络,是策略网络的参数,是更新过策略网络的参数,qθ1和qθ2为价值网络,θ1和θ2分别为两个价值网络的参数。
42、优选地,还包括如下步骤:在策略网络中引入了噪声,噪声从截断正态分布中随机抽取,使得策略网络更加积极的去对未知动作进行探索,公式如下:
43、a←πθ(s)+ε ε~clip(n(0,σ),-c,c)
44、式中,ε表示噪声,n(0,σ)表示均值为0,方差为σ的正态分布,clip表示裁剪操作,-c和c表示裁剪的范围。
45、基于上述技术方案,本发明的有益效果是:本发明提出了一种结合pure pursuit算法的rl最优控制sq-pao(state quantize for pursuitapproximate optimal control)方法,用于沿着已知的任意路径以最优速度贴合路径驾驶车辆。我们根据先验线性知识设计奖励函数,指导智能体快速地进行学习;对输入智能体的序列状态使用vq进行稀疏离散化,以降低表征车辆状态的空间大,把无限的空间限定在了一定有限的空间内,智能体在有限空间里面输出动作,对相似的状态(包含训练之外的状态)也能做出近似行为。vq降低了状态微小变化带来的行为输出跃变,提高了模型的鲁棒性。智能体学习在加速(和减速),以及随速度自适应的的前馈距离大小,以使得在路径上的每一点能近似最优化,保证动态稳定性。
1.一种基于深度强化学习的车辆最优控制方法,其特征在于,包括如下步骤:
2.根据权利要求1所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,还包括如下步骤:将所述最终更新得到的策略网络作为最优策略用于智能车的部署。
3.根据权利要求1所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,所述状态、动作以及奖励分别定义如下:
4.根据权利要求3所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,所述路径曲率采用平均曲率,公式如下:
5.根据权利要求1所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,基于深度强化学习td3构建所述策略网络和两个相互独立的价值网络,其中,
6.根据权利要求5所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,将数据st、at分别输入两个价值网络中获取两个价值评分并取其中较小值来计算t+1时刻的预测得分公式如下:
7.根据权利要求6所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,将状态st+1输入到策略网络中得到t+1时刻车辆做出的动作at+1,将数据st+1、at+1分别输入两个价值网络中获取t+1时刻的两个价值评分并根据t+1时刻的两个价值评分和预测得分来确定td误差,基于td误差对两个价值网络进行更新,具体公式如下:
8.根据权利要求7所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,所述策略网络更新,公式如下:
9.根据权利要求8所述的一种基于深度强化学习的车辆最优控制方法,其特征在于,还包括如下步骤:
