机械工程学报

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:11-2187/TH

国际刊号:0577-6686

机械工程学报杂志2023年第8期:TD3算法改进与自动驾驶汽车并道策略学习

发布日期:

作者:张志勇, 黄大洋, 黄彩霞, 胡林, 杜荣华

单位:1. 长沙理工大学机械装备高性能智能制造关键技术湖南省重点实验室 长沙 410114;2. 长沙理工大学汽车与机械工程学院 长沙 410114;3. 湖南工程学院汽车动力与传动系统湖南省重点实验室 湘潭 411104

关键词:自动驾驶汽车,强化学习,并道策略,Q值估计;

基金:国家自然科学基金(61973047); 湖南省自然科学基金(2021JJ30182,2022JJ50020); 湖南省教育厅科学研究(20A018); 机械装备高性能智能制造关键技术湖南省重点实验室(长沙理工大学)开放基金(2020YB02)资助项目

为提高自动并道策略的综合性能,改进了双延迟深度确定性策略梯度算法(Twin delayed deep deterministic policy gradient,TD3)的Q值估计方法和奖励函数。通过马尔科夫决策过程,将车辆并道过程建模为强化学习问题,分析TD3强化学习算法中Q值低估对并道决策的影响。对TD3算法的双评论家目标网络执行蒙特卡洛随机失活,在获得两个Q值估计样本的基础上,提出基于样本方差加权平均的Q值估计方法,提高TD3算法的Q值估计精度。在优先保证完成并道任务的前提下,充分考虑车辆并道过程中的安全性、舒适性和交通效率,建立完备的奖励函数。基于改进的TD3算法和奖励函数,通过BARK模拟器开展自动驾驶汽车并道策略学习和测试。结果表明,提出的改进TD3算法显著提高了Q值估计精度。结合建立的奖励函数,在保证交通效率的同时提高了车辆并道的安全性和乘坐舒适性。

来源:2023年第8期

《机械工程学报》期刊编辑部

查看机械工程学报杂志2023年第8期

联系我们

  • 地址:北京百万庄大街22号
  • 电话:010-88379907
  • E-mail:jme@cjmenet.com

咨询工作人员