0 引言
1 超多车道分幅场景交通管控需求
1.1 分幅路段交通流运行现状
1.2 分幅路段管控需求分析
2 左侧硬路肩动态管控框架
2.1 影响因素分析
表2 左侧硬路肩动态开放影响因素 |
| 影响因素 | 作用机制与管控要点 |
|---|---|
| 交通流 运行状态 | 利用数字化设备实时监测流量、密度、速度等交通流的关键参数,动态评估高速公路交通状况,制定适应性硬路肩开放策略 |
| 高速公路 横断面设计 | 依据横断面设计的几何特征与功能属性,明确可通行车辆类型,为硬路肩的开放使用提供空间基础和安全保障,提升路段的交通承载能力 |
| 交通事故 严重程度及 影响范围 | 评估事故对交通流的影响范围和持续时间,根据事件严重程度及影响范围确定硬路肩开放时间和区间,建立分级管控机制 |
| 交通标志与 信息发布 设施 | 构建多层次交通引导体系,动静态设施高效配合,通过标志、标线、可变情报板、车道指示器等设施发布开放规则和适用车型,实时更新硬路肩开闭状态,提升交通信息的传递效率和准确性 |
| 天气与 环境条件 | 恶劣气象条件下能见度低、路面湿滑,驾驶员视距缩短,开放硬路肩会增加碰撞和侧滑风险,必要时应限制或禁止其使用,以保障交通安全 |
2.2 左侧硬路肩动态管控规则
3 左侧硬路肩动态控制模型
3.1 问题描述
3.2 模型构建
3.2.1 模型比选
表3 遗传算法与PPO算法差异性对比 |
| 对比维度 | 遗传算法 | PPO算法 |
|---|---|---|
| 范围 | 覆盖整个3 600 s的仿真周期,是全局、综合的评估 | 单步奖励针对当前步骤的交通状态做局部、即时反馈,核心优化目标为全周期累积奖励 |
| 策略生成方式 | 基于离线种群迭代搜索,依赖固定时间窗间隔,输出固定开放区间与时长的控制策略 | 基于实时交通状态动态决策,通过与环境交互持续调整开放策略 |
| 作用场景 | 遗传算法中驱动种群进化(选择、繁殖) | 强化学习中指导策略参数更新 |
| 动态响应能力 | 依赖预设迭代周期,无法实时适配事故引发的交通流波动 | 响应交通状态变化,通过时序决策应对拥堵扩散等动态场景 |
| 计算开销 | 需要评估整个种群,环境交互量远大于PPO算法,计算成本高,单轮训练时间长 | 基于神经网络实时输出策略,单次决策耗时低于0.1 s |
3.2.2 基于PPO算法的硬路肩管控模型
3.3 算法求解
3.4 训练流程
4 仿真实验设计
4.1 仿真条件
4.2 模型训练
表4 PPO算法模型训练参数设置 |
| 参数名称 | 参数取值 |
|---|---|
| 策略网络学习率(actor_lr) | 1×10-3 |
| 价值网络学习率(critic_lr) | 1×10-2 |
| 隐藏层维度 | 128 |
| 折扣因子 | 0.98 |
| 广义优势估计 (Generalized Advantage Estimation, GAE) | 0.95 |
表5 遗传算法训练参数设置 |
| 参数名称 | 参数取值 |
|---|---|
| 种群大小 | 10 |
| 交叉概率 | 0.8 |
| 变异概率 | 0.1 |
| 精英保留比例 | 0.2 |