国内刊号:11-2187/TH
国际刊号:0577-6686
发布日期:
作者:李文礼, 张祎楠, 石晓辉, 王梦昕
单位:1. 重庆理工大学汽车零部件先进制造技术教育部重点实验室 重庆 400054;2. 重庆长安汽车股份有限公司 重庆 400020
关键词:逆强化学习,强化学习,行人-车辆交互,博弈论,右转交叉口;
基金:重庆市自然科学基金(cstc2021jcyj-msxmX0183)、重庆市留学人员回国创业创新支持计划(CX2021070)、重庆市教委科学技术研究(KJQN202201170)和重庆市技术创新与应用发展专项重大(CSTB2022TIAD-STX0003)资助项目。
为逼真模拟行人-车辆交互的真实交通场景,融合博弈理论和数据驱动的思想,在逆强化学习和博弈论的基础上提出博弈—深度最大熵逆强化学习算法(Game-deep max entropy inverse reinforcement learning,G-DMIRL)。将行人建模为智能体,通过真实的行人-车辆交互轨迹获取不同博弈决策下的行人的奖励函数,并推断行人-车辆交互的博弈机制,利用获取的奖励函数和动作策略开发出行人行为模拟模型。仿真结果表明,开发的模型在有限状态下能够准确地模拟出不同决策下行人的行为动作,建立的行人-车辆交通场景能够为自动驾驶汽车的识别、预测与路径规划算法的开发验证提供支撑。
来源:2024年第10期
《机械工程学报》期刊编辑部