本技术涉及交通线网优化,尤其涉及一种基于q-learning算法的公交线网优化的方法及装置。
背景技术:
1、公交车具有载客量大、资源利用率高、安全系数高、环境污染小等优势,在城市交通中扮演着重要角色。但随着城市化进程的发展,原有公交线路的不合理之处日益突出,急需对公交线网进行优化。
2、在以往线网优化的研究中,多是利用智能优化算法对公交线网整体进行优化。例如,在公开号为cn104217086a的专利中,综合考虑了乘客和运营者双方的利益,通过在od对之间搜索直流客流密度最大化的线路。这种方法虽然有效地提高了线路的利用效率,但是其优化还是针对整个线网进行优化的。公开号为cn113378337a的专利基于客流分析,建立了公交线网优化模型,并用遗传算法进行求解,制定出更加合理的公交线网,主要用以提高公交系统的运营效率。
3、上述两种公交线网优化方法虽然都针对不同的问题对公交线网进行了优化,但均是基于群体智能优化算法,并且对公交线网整体进行了较大范围的调整,且未结合具体的线路情况。这种整体优化的方法,成本投入较大,严重影响市民出行体验,还会造成较大的资源浪费。此外,在成熟的公交线网中进行大范围的调整,其可行性较低。
技术实现思路
1、本技术实施例通过提供一种基于q-learning算法的公交线网优化的方法及装置,解决了现有技术中的公交线网优化方法未结合线路具体情况,投入成本较大且可行性较低的问题。
2、第一方面,本技术实施例提供了一种基于q-learning算法的公交线网优化方法,包括:获取公交运行数据;其中,所述公交运行数据包括公交轨迹数据集、刷卡数据集与公交站点数据集;根据所述公交运行数据获取客流量;其中,所述客流量包括各所述公交站点的上客量与下客量;根据所述客流量与所述公交站点数据集得到待优化线路结果集;通过q-learning算法对所述待优化线路结果集进行优化得到优化公交线网。
3、结合第一方面,在一种可能的实现方式中,所述根据所述公交运行数据获取客流量,包括:根据所述公交运行数据进行线路匹配得到线路匹配结果;其中,所述线路匹配结果包括公交线路以及所述公交线路的线路刷卡数据;根据所述线路匹配结果做车辆匹配得到车辆匹配结果;其中,所述车辆匹配结果包括公交线路的排班公交与所述排班公交的公交刷卡数据;根据所述车辆匹配结果进行时间匹配得到所述排班公交的上客量与上车站点数据;根据所述上客量与所述上车站点数据确定下客量。
4、结合第一方面,在一种可能的实现方式中,所述根据所述上客量与所述上车站点数据确定下客量,包括:根据所述车辆匹配结果与所述上车站点数据获取每位乘客每天的乘车刷卡数据,筛选出有两条及以上所述乘车刷卡数据的乘客的刷卡记录,并对每位乘客的所述刷卡记录按时间排序得到刷卡顺序集;确定所述刷卡顺序集中首条刷卡数据的刷卡站点的所有下游站点,并分别计算各所述下游站点与所述首条刷卡数据的下条刷卡记录的刷卡站点的直线距离;筛选出所述直线距离中满足距离阈值的所述直线距离构成直线距离集,并确定所述直线距离集中各所述直线距离的步行时间;若所述步行时间满足时间阈值,则将所述下条刷卡记录的刷卡站点作为换乘点;否则,将其作为下车点;根据所述换乘点与所述下车点确定下客量。
5、结合第一方面,在一种可能的实现方式中,所述根据所述客流量与所述公交站点数据集得到待优化线路结果集,包括:对当前公交线网进行初始化,并设置最大种群规模与预设迭代次数;根据所述最大种群规模与所述预设迭代次数生成随机公交线路集合;迭代执行优化步骤,直至迭代次数达到所述预设迭代次数,得到所述待优化线路结果集;所述优化步骤,包括:确定所述随机公交线路集合中公交线路的目标函数;根据所述目标函数的目标函数值确定公交线路的非支配等级与拥挤度;根据所述非支配等级与所述拥挤度选择公交线路,并将其构建为第一线路集合;对所述第一线路集合进行交叉操作生成新公交线路;对所述随机公交线路集合进行遗传变异操作以引入新的变化;将引入新的变化的所述随机公交线路集合与所述新公交线路合并得到新生公交线路集合,并将所述迭代次数加一;将所述新生公交线路集合作为所述随机公交线路集合,执行所述优化步骤。
6、结合第一方面,在一种可能的实现方式中,所述目标函数包括异常线路目标函数、客流量目标函数、公交站点与线路长度目标函数以及客流量差异目标函数。
7、结合第一方面,在一种可能的实现方式中,所述通过q-learning算法对所述待优化线路结果集进行优化得到优化公交线网,包括:将所述待优化线路结果集、当前公交线网与所述客流量输入q-learning算法,并初始化q值存储表;迭代执行优化求解步骤直至达到最大迭代次数停止迭代,得到所述优化公交线网;所述优化求解步骤,包括:根据当前策略与当前q值选择初始公交线路,并执行所述初始公交线路得到即时奖励与下一个状态;根据所述即时奖励与所述下一个状态更新所述当前q值。
8、结合第一方面,在一种可能的实现方式中,所述即时奖励的奖励函数,如下:
9、;式中,r表示所述即时奖励,i表示最大迭代次数,m表示第m次迭代,表示起点,与分别表示从起点到下游公交站点j与下游公交站点j到起点的总上客量,表示从起点到下游公交站点j的线路长度,表示当前算法搜索出的公交线路非直线系数,表示经过下游站点到起点的公交线路条数,表示经过起点到下游站点的公交线路条数,与分别表示当前位置到下一个公交站点的距离的最小值与最大值,表示当前位置到下一个公交站点的距离,表示非直线系数,与分别表示生成的公交线路的长度的最大值和最小值。
10、第二方面,本技术实施例提供了一种基于q-learning算法的公交线网优化装置,包括:第一获取模块,用于获取公交运行数据;其中,所述公交运行数据包括公交轨迹数据集、刷卡数据集与公交站点数据集;第二获取模块,用于根据所述公交运行数据获取客流量;其中,所述客流量包括各所述公交站点的上客量与下客量;待优化线路结果集模块,用于根据所述客流量与所述公交站点数据集得到待优化线路结果集;优化模块,用于通过q-learning算法对所述待优化线路结果集进行优化得到优化公交线网。
11、第三方面,本技术实施例提供了一种设备,所述设备包括:处理器;用于存储处理器可执行指令的存储器;所述处理器执行所述可执行指令时,实现如第一方面或第一方面任一种可能实现的方式所述的方法。
12、第四方面,本技术实施例提供了一种非易失性计算机可读存储介质,所述非易失性计算机可读存储介质包括用于存储计算机程序或指令,当该计算机程序或指令被执行时,使如第一方面或第一方面任一种可能实现的方式所述的方法被实现。
13、本技术实施例中提供的一个或多个技术方案,至少具有如下技术效果或优点:
14、本技术实施例通过获取客流量能够了解各公交线路的客流压力与公交运力;根据客流量与公交站点数据集得到待优化线路结果集,能够分析出需要优化的公交线路;对待优化线路结果集进行优化,能够避免对公交线网整体优化导致的高成本与低效率。有效解决了现有技术中的公交线网优化方法未结合线路具体情况,投入成本较大且可行性较低的问题。能够节约经济成本,提高方案的可行性,平衡公交运力,缩短市民的出行适应期。
1.一种基于q-learning算法的公交线网优化方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,所述根据所述公交运行数据获取客流量,包括:
3.根据权利要求2所述的方法,其特征在于,所述根据所述上客量与所述上车站点数据确定下客量,包括:
4.根据权利要求1所述的方法,其特征在于,所述根据所述客流量与所述公交站点数据集得到待优化线路结果集,包括:
5.根据权利要求4所述的方法,其特征在于,所述目标函数包括异常线路目标函数、客流量目标函数、公交站点与线路长度目标函数以及客流量差异目标函数。
6.根据权利要求1所述的方法,其特征在于,所述通过q-learning算法对所述待优化线路结果集进行优化得到优化公交线网,包括:
7.根据权利要求6所述的方法,其特征在于,所述即时奖励的奖励函数,如下:
8.一种基于q-learning算法的公交线网优化装置,其特征在于,包括:
9.一种用于执行基于q-learning算法的公交线网优化的方法的设备,其特征在于,包括:
10.一种非易失性计算机可读存储介质,其特征在于,包括用于存储计算机程序或指令,当该计算机程序或指令被执行时,使如权利要求1至7中任一项所述的方法被实现。
