Technology Frontier

Dynamic Control Method for Left Hard Shoulder of Super-Multilane Expressways

  • MA Lin , 1 ,
  • XU Tian , 2, * ,
  • YUAN Chenwei 2 ,
  • ZHANG Yuping 1 ,
  • HE Runjing 1 ,
  • LIN Siyu 2
Expand
  • 1 Guangdong Provincial Highway Construction Co., Ltd., Guangzhou 510600, China
  • 2 CCCC First Highway Consultants Co., Ltd., Xi′an 710075, China

Received date: 2025-06-20

  Online published: 2026-06-11

Abstract

To address the complex traffic control requirements of super-multilane expressways and mitigate the mismatch between insufficient road capacity and growing traffic demand, this study achieves road space resource optimization and traffic resilience enhancement through dynamic regulation of the left hard shoulder. Taking the Guangzhou-Shenzhen Expressway reconstruction and expansion project under Guangdong Province′s "One Axis, Two Networks" digital transformation initiative as the research object, this study proposes a novel dynamic control method for the left hard shoulder based on the Proximal Policy Optimization (PPO) algorithm, with a comparative analysis against the Genetic Algorithm (GA). Using the SUMO simulation platform to simulate accident scenarios under different levels of service, the strategy's effectiveness is evaluated from the perspectives of safety and efficiency. The results show that under service levels one to four, dynamically opening the left hard shoulder based on the PPO algorithm under incident conditions (compared with not opening it) can reduce total travel time by 28.8%, 32.2%, 31.3%, and 19.5%, respectively, and decrease the mean speed standard deviation by 25.3%, 28.1%, 33.6%, and 28.9%, respectively. This significantly improves traffic system efficiency and driving safety, and the PPO algorithm outperforms the traditional genetic algorithm, providing a new method for refined management and traffic flow resilience enhancement on super-multilane expressways.

Cite this article

MA Lin , XU Tian , YUAN Chenwei , ZHANG Yuping , HE Runjing , LIN Siyu . Dynamic Control Method for Left Hard Shoulder of Super-Multilane Expressways[J]. Transport Research, 2026 , 12(2) : 107 -119 . DOI: 10.16503/j.cnki.2095-9931.2026.02.009

0 引言

随着经济发展和城市化进程加快,机动车保有量持续攀升,交通流量增长与道路容量不足的矛盾日益凸显,数字化转型成为提升高速公路通行能力的重要路径[1]。京港澳高速公路广州至深圳段(简称“广深高速”)作为广东省“一轴两网”数字化转型重点路段,其改扩建工程面临车道多、断面宽、流量大、交通组织复杂等多重挑战,亟需通过智慧管控手段破解交通瓶颈。在事件条件下动态开放左侧硬路肩,构建兼具应急缓冲与通行扩容功能的弹性空间,是推动交通管理向数字化、智慧化转型的关键探索[2-4]
国外学者较早验证了硬路肩开放在效率与安全方面的价值:Guerrieri等[5]通过案例分析证实,合理开放硬路肩可在不增加事故风险的前提下显著提升通行效率,为硬路肩动态利用提供了基础理论支撑;Abdel-Aty等[6]构建了融合硬路肩运行与可变限速的实时事故预测框架,完善了安全评估体系。关于超多车道高速公路左侧硬路肩的研究尚处于探索初期,系统性成果较为匮乏。国内研究聚焦于左侧硬路肩特殊性,通过仿真、量化建模等方法证实其在降低事故风险方面的作用机理,为明确设置标准提供了依据[7-9]。这些研究虽从安全评估、风险量化等维度揭示了左侧硬路肩的基础特性,但多局限于单一特性分析,尚未形成左侧硬路肩运行的系统性管控框架。
硬路肩动态运行(Hard Shoulder Running, HSR)作为主动交通管理(Active Traffic Management, ATM)的关键措施[10],其管控方法已从传统启发式算法向动态控制方法演进。早期研究主要基于遗传算法、安全优先规则构建基础理论体系[11-13],但此类传统启发式算法依赖固定阈值与预设规则,在实时性与适应性方面存在不足。为此,学者们引入模型预测控制(Model Predictive Control, MPC)、强化学习(Reinforcement Learning, RL)等动态控制方法,初步证实了其在离散决策中的可行性及对交通波动的响应能力[14-15]。在此基础上,Yao等[16]提出基于隐马尔可夫模型(Hidden Markov Model, HMM)的动态管控策略,通过对交通流不确定性建模,识别交通状态演化规律,有效减少交通崩溃现象[17];Hu等[18]提出一种改进的多智能体深度确定性策略梯度算法,通过引入时空约束条件,构建了硬路肩开放决策机制,发现在严重拥堵情况下,缩小单个智能体的控制路段范围可提升管控精度。上述研究将“路段-智能体”映射粒度纳入优化目标,为硬路肩动态管控提供了关键思路,但离散的开闭区间框架在实际工程应用中仍存在局限性。
既有研究多以右侧硬路肩为对象,依赖静态规则或预设模型制定管控策略,难以适配复杂交通流的动态演化特征,并且缺乏针对超多车道分幅分行这一特殊交通组织模式的理论建模。鉴于此,本研究将以广深高速改扩建工程深圳至广州方向厚街南互通至太平互通段为研究对象,充分考虑超多车道分幅分行模式下的交通运行特性,构建左侧硬路肩动态管控理论框架,从HSR策略控制问题的数学建模切入,在事故场景及多服务水平约束下以强化学习方法优化HSR策略,并验证近端策略优化算法(Proximal Policy Optimization, PPO)对复杂交通动态环境的适配优势,旨在提升交通系统的稳定性与适应性。

1 超多车道分幅场景交通管控需求

1.1 分幅路段交通流运行现状

本研究聚焦超多车道高速公路交通运行场景,以广深高速厚街南互通至太平互通段为研究对象。该路段采用“2+3”分幅交通组织模式(见图1),内幅设2车道,供中长途小客车快速通行,外幅设3车道,实行客货混行。广深高速交通流量大,平均日交通量已超过12.3万pcu,面临交通需求与服务水平不匹配的问题。其2017—2019年双向10车道路段变道事故统计如表1所示,可看出内幅车道事故率较高[19],进一步加剧了交通组织的复杂性和冲突性。
图1 广深高速分幅分行交通组织模式
表1 2017—2019年广深高速公路双向10车道路段变道事故统计[19]
路段 距离
/km
内幅车道
变道事故数/起
内幅变道事
故发生率
/[起/(km·年)]
外幅车道变道事故数
/起
外幅变道
事故发生率
/[起/(km·年)]
厚街南
—虎门港
3.55 27 3.80 14 1.31
太平立交
—五点梅
5.05 65 6.44 42 2.77
鹤洲
—福永
3.65 10 1.37 8 0.73

1.2 分幅路段管控需求分析

开放左侧硬路肩对于提升交通韧性具有重要意义。一方面,内幅车道呈现“高速度、低缓冲”特性,车流速度高且连续性强,对突发交通事件的缓冲能力有限,一旦发生事故,通行能力会迅速下降,易造成局部拥堵并引发二次事故。另一方面,外幅车道呈现“高交织、高负荷”的特征,交通组织冲突严重。开放左侧硬路肩作为临时车道使用,是智慧扩容的重点应用场景,可有效提升路段交通容量,针对性解决事件条件下内幅车流疏散难题,缩短车辆疏散距离,减少变道次数,降低事故风险,实现主动交通流管控对突发事件的快速响应。

2 左侧硬路肩动态管控框架

2.1 影响因素分析

左侧硬路肩动态开放需要综合考虑多方面因素,科学确定开放的时间与空间要素,以确保策略的有效性与安全性。主要影响因素及其作用机制见表2
表2 左侧硬路肩动态开放影响因素
影响因素 作用机制与管控要点
交通流
运行状态
利用数字化设备实时监测流量、密度、速度等交通流的关键参数,动态评估高速公路交通状况,制定适应性硬路肩开放策略
高速公路
横断面设计
依据横断面设计的几何特征与功能属性,明确可通行车辆类型,为硬路肩的开放使用提供空间基础和安全保障,提升路段的交通承载能力
交通事故
严重程度及
影响范围
评估事故对交通流的影响范围和持续时间,根据事件严重程度及影响范围确定硬路肩开放时间和区间,建立分级管控机制
交通标志与
信息发布
设施
构建多层次交通引导体系,动静态设施高效配合,通过标志、标线、可变情报板、车道指示器等设施发布开放规则和适用车型,实时更新硬路肩开闭状态,提升交通信息的传递效率和准确性
天气与
环境条件
恶劣气象条件下能见度低、路面湿滑,驾驶员视距缩短,开放硬路肩会增加碰撞和侧滑风险,必要时应限制或禁止其使用,以保障交通安全

2.2 左侧硬路肩动态管控规则

1)安全优先原则
优先保障硬路肩的应急功能,仅在未被占用且无紧急需求时临时开放;结合事故严重程度与气象条件进行安全性评估,必要时禁止开放。
2)动态适配机制
基于实时交通流状态动态调整硬路肩的开闭状态及范围;当事故或事件引发内幅拥堵时,开放影响区域的左侧硬路肩,拥堵缓解后逐步关闭。
3)空间管控要求
左侧硬路肩临时开放时,需明确限速要求并通过信息发布设施实时提示;开放范围覆盖拥堵路段及其上下游延伸区域,起点应便于识别,终点结合道路线形、出入口等综合确定;保留右侧硬路肩作为应急车道,专供救援车辆使用。
4)协同发布规则
利用标志、可变情报板等动静态设施联动发布开闭信息及规则;关闭时采用“分阶段、渐进式”方式,提前引导车辆有序驶离,确保过渡平稳。发布方式见图2
图2 硬路肩开闭策略实时发布
5)差异化场景适配
整体式断面内幅拥堵时,开放对应的左侧硬路肩;分离式断面内幅发生突发事件时,左侧硬路肩仅作为应急救援通道。

3 左侧硬路肩动态控制模型

3.1 问题描述

在超多车道高速公路交通运行管理中,传统硬路肩开放策略的局限性愈发凸显。分幅分行模式下,交通流的强时变性与空间异质性特征,使得固定时段及区间的管控模式难以适配复杂的交通组织需求。当高速公路系统处于饱和运行状态时,突发事件引发的局部拥堵会随车流波动产生复杂的传播效应,而静态策略无法实现路网时空资源的动态最优配置。针对分幅分行模式下内幅车道发生突发事件进而引发的车流疏散难题,本研究建立基于实时状态感知的动态调控机制,引入强化学习算法,构建左侧硬路肩智能决策模型,动态优化硬路肩开放路段位置与区间,为提升交通系统突发事件韧性提供智能化解决方案。

3.2 模型构建

基于问题特性与算法优势的精准适配,选择遗传算法与强化学习模型协同解决左侧硬路肩动态控制问题。遗传算法在交通领域具有成熟的应用基础,可快速构建基准模型;强化学习的动态适应性和自学习特性,可应对交通流强时变性及复杂交通状态演化。

3.2.1 模型比选

遗传算法将硬路肩开放参数编码为个体,以时间窗口内的总行驶时间负向值为评价指标,构建兼顾交通效率与安全的适应度函数,通过选择、交叉、变异操作迭代进化种群,并结合滑动时间窗机制在固定周期内输出动态策略,最终收敛至最优解。而强化学习中,智能体通过与环境的交互,在“状态-动作-奖励-下一状态”的循环中学习可获得更高奖励的动作,并通过优化器更新策略网络参数,以改进后续决策。遗传算法与强化学习(PPO算法)在硬路肩管控中的差异主要体现在策略生成方式与动态适应性上,详细对比见表3
表3 遗传算法与PPO算法差异性对比
对比维度 遗传算法 PPO算法
范围 覆盖整个3 600 s的仿真周期,是全局、综合的评估 单步奖励针对当前步骤的交通状态做局部、即时反馈,核心优化目标为全周期累积奖励
策略生成方式 基于离线种群迭代搜索,依赖固定时间窗间隔,输出固定开放区间与时长的控制策略 基于实时交通状态动态决策,通过与环境交互持续调整开放策略
作用场景 遗传算法中驱动种群进化(选择、繁殖) 强化学习中指导策略参数更新
动态响应能力 依赖预设迭代周期,无法实时适配事故引发的交通流波动 响应交通状态变化,通过时序决策应对拥堵扩散等动态场景
计算开销 需要评估整个种群,环境交互量远大于PPO算法,计算成本高,单轮训练时间长 基于神经网络实时输出策略,单次决策耗时低于0.1 s
针对分幅分行模式下超多车道高速公路交通流强时变性、空间异质性及突发事件动态管控的需求,与依赖离线搜索与固定规则的遗传算法相比,PPO算法具有以下优势:其一,通过与环境持续交互,可实时响应交通状态变化;其二,依托经验回放与策略更新机制,可实现策略高效迭代;其三,通过神经网络拟合实现状态到动作的映射关系,具备较强的泛化能力;其四,采用梯度下降优化参数,可实现计算资源高效分配。
综上,PPO算法更适合解决动态、实时、复杂的交通控制问题,能在持续变化的环境中自主学习最优策略。

3.2.2 基于PPO算法的硬路肩管控模型

在交通系统运行过程中,各路段实时采集的车速、占有率及车辆数等参数,体现了交通流的实时运行状态。智能体基于实时交通运行状态,利用强化学习算法评估并生成硬路肩管控的优化策略。当实施管控策略时,该决策的影响直接作用于后续状态转移,即下一时刻状态仅依赖当前状态和决策,与更早的历史状态无关,满足马尔可夫性质。因此,硬路肩动态管控问题可以建模为马尔可夫决策过程(Markov Decision Process, MDP),其核心要素包括状态空间、动作空间、转移概率和奖励函数。
1)状态空间
状态空间由系统所有可能的运行状态构成,每个状态由一组状态变量表征。本研究定义的状态变量综合考虑了多个交通关键指标,以全面表征交通系统的实时运行状态。针对每个控制路段的每条车道,提取4个核心交通特征,构建三维状态张量作为t时刻的系统全局状态,表达式如下:
S t = ( M 1 ,   M 2 , ,   M N s e g )
式(1)中: S tt时刻系统全局状态张量,维度为 N s e g × N l a n e × 4,其中 N s e g为控制路段的总数量、 N l a n e为单个控制路段包含的车道数量; M k R N l a n e × 4为第 k个控制路段的车道特征矩阵,矩阵中每个元素都是实数,R为实数集,矩阵中每行对应一条车道的4项特征向量 [ q ,   v ,   o ,   w ] T,各特征的含义如下:
q:对应某一时刻车道内的车辆总数,单位为pcu,用于表征道路的交通压力;
v:对应控制路段内各车道的车辆平均行驶速度,单位为km/h;
o:对应观测周期内车辆占用车道时间占有率,无量纲,用于衡量车道内车辆的密集程度;
w:对应车道内处于缓行状态的车辆数量,单位为pcu。
2)动作空间
动作空间由智能体所有的管控动作构成,每个动作由一组动作变量表征。本研究将t时刻管控动作定义为二元组,表达式如下:
a t = ( i ,   n )
式(2)中: a t为智能体输出的硬路肩管控动作; i为硬路肩开放路段起始索引,索引区间为 [ 1 ,   N s e g ],表征管控决策的空间定位; n为硬路肩连续开放的路段数量,取值区间为 [ 1 ,   7 ],用于限定管控策略的空间影响范围。
智能体根据当前交通状态,通过策略网络输出 i n的概率分布,采样得到具体动作值,动态调整硬路肩开放策略,优化交通流量的疏导方案。HSR策略示意如图3所示。
图3 左侧硬路肩HSR策略示意
3)奖励函数设计
本研究的优化目标为最小化管控区域中单个车辆的行驶时间,提高高速公路运营效率。因此奖励函数要综合考虑车辆行驶时间与交通流量两项核心指标。交通流量 Q反映单位时间内通过控制区域的车辆数,函数表达式如下:
Q = ρ v -
式(3)中: ρ为控制区域内的平均车辆密度,由各车道占有率计算得到; v ¯为区域内车辆的平均行驶速度。
在此基础上,构建兼顾通行效率与管控效果的奖励函数 r t r t表达式如下[18]
r t = 1 l g 10 i = 1 N v e h t m / Q
式(4)中: t m为第 m辆车在管控区域内的行驶时间; N v e h为管控区域内的车辆总数, N v e h = k = 1 N s e g l = 1 N l a n e q k ,   l q k ,   l为第 k个控制路段、第 l条车道内的单位时间车辆总数。

3.3 算法求解

本研究采用的带截断替代目标的近端策略优化算法(Proximal Policy Optimization with Clipped Surrogate Objective, PPO-Clip)是PPO算法的一种实现形式,该算法通过引入信赖域机制,利用裁剪函数限制策略更新幅度,在解决传统策略梯度算法收敛不稳定问题的同时,兼顾了采样效率与策略收敛性,从而适用于交通流动态变化场景下的连续决策任务。PPO算法的目标函数旨在最大化智能体执行硬路肩管控策略时的长期累积奖励,目标函数表达式为[20]
J P P O ( θ ) = E t m i n r t ( θ ) A ^ t ,   c l i p r t ( θ ) ,   1 - ε ,   1 + ε A ^ t
式(5)中: J P P O ( θ )为PPO算法的目标函数,优化目标为最大化该函数值; E t为时刻 t对应轨迹分布的数学期望算子; r t ( θ )为新策略与旧策略对管控动作的概率比,表达式为 r t ( θ ) = μ θ ( a t | s t ) μ o l d ( a t | s t ) μ θ为以 θ为参数的当前策略概率密度函数, μ o l d为旧策略的概率密度函数; A ^ t为时刻 t的优势函数估计值,用于表征当前动作相对平均水平的优势程度; c l i p ( r t ( θ ) ,   1 - ε ,   1 + ε )为裁剪函数,用于将输入值限制在区间 1 ε ,   1 + ε ]内; ε为裁剪系数,用于限制策略更新幅度,保证智能体在优化通行效率的同时,维持策略训练的稳定性。

3.4 训练流程

智能体在SUMO仿真环境中持续交互,根据实时交通状态,结合策略网络生成管控动作,执行动作并获取环境反馈;利用存储交互经验,通过PPO算法特有的裁剪机制优化策略,同时更新策略网络和价值网络参数。此过程循环迭代,直至模型学习到最优的管控策略。具体训练框架见图4
图4 PPO算法训练框架

4 仿真实验设计

4.1 仿真条件

本研究依托广深高速,选取深圳至广州方向厚街南互通至太平互通之间的7 km路段作为仿真路段。仿真设计充分考虑双实线、实虚线、虚实线等标志标线设计对内外幅车辆转换的影响,模拟内幅车辆发生事故后车流的消散路径。结合可变情报板布设位置,以1 km为间隔将仿真路段划分为7个控制单元。
实验利用SUMO搭建仿真环境,以Python作为算法编程语言,在仿真环境中模拟不同服务水平下的交通量,通过TraCI接口实时获取仿真环境中车道级速度、占有率等信息,数据采样频率为1 Hz。在仿真环境中,按以下逻辑和顺序模拟应急处置周期:依据《高速公路应急救援服务规范》(T/ZSM 0012—2022)[21],救援车辆需要在20 min内到达现场。因此,在仿真中将救援到达时间设为1 200个仿真时间步(每步为1 s),并模拟从事故发生到应急救援到达再到拥堵完全消散的完整过程。事故位置在内侧两车道中随机选定,且自事故发生起,每5 min更新一次硬路肩管控策略。
根据《公路工程技术标准》(JTG B01—2014)[22],利用服务水平一至六级表示高速公路在不同交通状态下的运行质量和服务状况。其中五级和六级服务水平对应极端拥堵状态,已超出常规交通管理策略的有效调控范围,故本文仅采用前四级服务水平作为分析对象。根据广深高速的设计速度,计算得到不同服务水平对应的交通量分别为2 590、4 070、5 550、7 400 pcu/h。

4.2 模型训练

在模型训练中,遗传算法的适应度函数与强化学习(PPO算法)的奖励值虽共享单步计算逻辑,但功能定位存在本质差异:PPO算法设计中,奖励值为每30 s生成局部即时反馈,服务于参数更新;遗传算法的适应度函数则通过累加仿真过程中所有单步奖励形成全局评估指标,指导种群进化。
1)参数设置
综合考量算法稳定性、收敛效率及交通场景特性,PPO算法模型参数设置见表4
表4 PPO算法模型训练参数设置
参数名称 参数取值
策略网络学习率(actor_lr) 1×10-3
价值网络学习率(critic_lr) 1×10-2
隐藏层维度 128
折扣因子 0.98
广义优势估计
(Generalized Advantage Estimation, GAE)
0.95
遗传算法参数设置综合考量了滑动时间窗口的动态需求与计算效率。将管控周期划分为连续时间窗口,窗口长度为10 min,更新周期为5 min,各窗口内独立执行遗传算法优化。当空间占有率小于15%时,关闭该路段硬路肩[11]。遗传算法参数经多组对比实验调试确定,如表5所示。
表5 遗传算法训练参数设置
参数名称 参数取值
种群大小 10
交叉概率 0.8
变异概率 0.1
精英保留比例 0.2
2)训练过程
PPO算法模型训练过程中,智能体通过持续与仿真环境进行交互,逐步学习最优的左侧硬路肩动态管控策略。不同服务水平下的训练收敛情况存在差异,一级至四级服务水平的训练过程如图5所示。
图5 PPO算法模型训练过程
图5可知,智能体在不同服务水平下的训练难度随服务等级升高而增加:一级服务水平时,策略快速收敛,奖励值稳定提升;二级至三级服务水平时,奖励值波动加剧,智能体通过试错探索优化策略;四级服务水平下,因交通量逼近路网通行能力极限,奖励值在[-210, -140]之间剧烈波动,硬路肩开放策略的时空精度敏感性显著增强。尽管学习过程受到通行能力影响,奖励值仍呈现一定程度的提升趋势。
遗传算法在滑动时间窗机制下的优化表现随服务水平升级呈现显著衰减,如图6所示。
图6 遗传算法训练过程
图6可知,一级服务水平下, 适应度值先快速跃升,随后进入稳定的长平台期;二级至三级服务水平下,适应度值增长呈现出阶梯式跃升与平台期交替的特点,这是由于随着交通流复杂性提升,固定窗口间隔的迭代难以精准捕捉车流突变,进而导致策略更新存在滞后;四级服务水平下,适应度值优化幅度最小,且收敛后期出现平台期,表明极端负荷场景中,算法搜索能力受限。
综上,遗传算法虽通过滑动时间窗输出动态策略,但其本质仍依赖离线种群迭代与固定窗口更新,在复杂动态交通环境下,其优化效率与实时适应性仍显不足。PPO算法则通过持续环境交互实现策略动态生成,在各服务水平下均表现出更优的管控效果。

4.3 仿真结果分析

为全面评估策略效果,本研究从安全和效率两个维度选取评价指标:以总行驶时间、累计占有率作为效率评估指标,以车速标准差均值作为安全评估指标。在一至四级服务水平下,对比分析未开放左侧硬路肩(发生/未发生交通事故)、基于遗传算法开放左侧硬路肩及基于PPO算法开放左侧硬路肩4种场景对内幅车道行车安全和效率的影响。
场景1:未发生交通事故,车辆正常行驶;
场景2:内幅车道发生事故,左侧硬路肩全程保持关闭状态,事故后仅依赖常规车道疏散;
场景3:内幅车道发生事故,基于遗传算法控制左侧硬路肩的开闭;
场景4:内幅车道发生事故后,基于PPO算法控制左侧硬路肩的开闭。
1)效率层面
图7图8分别为不同场景下内幅车道总行驶时间及累计占有率的对比。
图7 不同场景下内幅车道总行驶时间
图8 不同场景下内幅车道累计占有率
图7图8可知,事故发生后,场景2、3、4的总行驶时间与累计占有率均显著高于未发生事故(场景1),表明事故对通行效率的负面影响显著。
与场景2相比,基于遗传算法的开放策略能在一定程度上降低总行驶时间和累计占有率,但优化效果随服务水平升高呈衰减趋势。尤其在三级、四级服务水平下,PPO算法对动态交通流的管控效果明显优于遗传算法。
基于PPO算法的开放策略优化效果更好(与场景2对比),总行驶时间分别降低28.8%、32.2%、31.3%、19.5%(对应一级至四级服务水平),累计占有率亦大幅下降,表明动态策略能实时响应事故后的交通流波动,通过灵活调整开放区间与时长,精准匹配车流疏散需求。然而,在四级服务水平条件下,事故发生后开放硬路肩对通行效率的提升效果呈衰减趋势,这可能归因于极端拥堵状态下硬路肩的分流能力已趋近饱和。
2)安全层面
内幅车道车速标准差均值见图9。结果表明,场景3虽能降低车速标准差,但优化幅度有限,且在交通量较大的三级、四级服务水平下,由于无法实时适配车流波动,对车速稳定性的改善效果较弱。场景4在各服务水平下均能显著降低车速标准差,与场景2相比,其降低数值分别为25.3%、28.1%、33.6%、28.9%(对应一级至四级服务水平)。尤其在二级、三级服务水平下,通过实时调整开放策略平衡车流分布,有效减少了车辆速度差异,提升了行车安全性。
图9 不同场景下内幅车道车速标准差均值
综上,基于遗传算法的管控策略可作为基础方案缓解事故拥堵,但基于PPO算法的动态管控策略在效率与安全的综合优化上表现更优,在动态交通环境下展现出更强的实时响应能力与自适应能力。

4.4 PPO算法模型管控策略生成

在事故发生后的不同阶段,通过动态调整硬路肩开放策略应对实时交通需求。图10呈现了不同服务水平下PPO算法生成的动态管控策略。m1~m7为7个长度为1 km的控制路段。为保证策略执行的稳定性,每5 min发布一次管控策略。
图10 动态管控策略图

注: “⚫”表示开放; 空白表示关闭。

随着高速公路服务水平从一级到四级的变化,智能体生成的左侧硬路肩动态管控策略呈现开放路段范围扩大、开放时长延长的趋势。在高服务水平时,通过动态开放硬路肩扩大通行空间,可使车流疏散更加顺畅;而在低服务水平时,虽然开放硬路肩缓解拥堵的效果受限,但模型通过生成精细的动态管控策略,精准调整开放区间与时长,仍能实现对交通流的有效疏导,在有限条件下提升道路利用率和交通系统的运行效率与韧性。
图11~图14对比了在不同服务水平下,措施实施前后内幅车道主线交通流密度的时序变化。由不同服务等级下的交通流密度变化可知,动态开放左侧硬路肩能有效抑制密度过度增长。由图11~图13可知,一级至三级服务水平中,密度峰值显著降低且持续时间缩短,硬路肩开放对拥堵扩散的阻断作用明显。图11中m₃~m₅路段高密度区消除,图12中m₂~m₅路段峰值降低,图13中拥堵蔓延减缓,动态管控策略随负荷增加自适应调整开放时段与区段。
图11 一级服务水平下内幅车道优化措施实施前后交通流密度对比
图12 二级服务水平下内幅车道优化措施实施前后交通流密度对比
图13 三级服务水平下内幅车道优化措施实施前后交通流密度对比
图14 四级服务水平下内幅车道优化措施实施前后交通流密度对比
四级服务水平下,密度整体虽较高,但优化策略有效平抑密度剧烈起伏,增强交通流稳定性,印证了动态管控在不同交通负荷下的有效性。

5 结论

本研究依托广东省“一轴两网”交通基础设施数字化转型升级中的广深高速改扩建工程,针对分幅分行模式下超多车道高速公路的交通特性,将PPO算法应用于左侧硬路肩动态管控,构建了适配实际交通场景的智能决策框架,为路网精细化管理提供了技术支撑。所得结论如下。
1)基于PPO算法的动态管控策略显著提高了内幅车辆的通行效率和行车安全性。与不开放左侧硬路肩(场景2)相比,动态开放使总行驶时间在一级至四级服务水平下分别降低了28.8%、32.2%、31.3%、19.5%,车速标准差分别降低了25.3%、28.1%、33.6%、28.9%。
2)PPO算法的管控效果优于遗传算法,其生成的动态管控策略能更精准捕捉交通流的实时变化,在不同服务水平及复杂场景中均保持稳定的优化表现,体现了强化学习在动态交通环境下的自适应优势。
3)基于PPO的动态策略在各服务水平下均展现出优异的动态适配能力,能有效响应交通流的时空演化特征;即使在高负荷场景中,仍能维持稳定且有效的优化能力,保障交通系统持续高效运行。
本研究验证了左侧硬路肩动态管控在智慧扩容中的重要作用,研究成果可直接应用于广深高速及具有类似交通特征的超多车道高速公路。建议在工程实施中结合路侧感知设备与通信系统,建立感知、预测、决策、控制的管控机制,实现管控策略与交通状态的实时交互,协同平衡安全与效率目标。
[1]
陈敬松, 闫栋, 车思亮, 等. 高速公路智慧扩容的概念、思路与方法[J]. 公路, 2025, 70(5):260-266.

[2]
张虢宁, 党海龙, 康星亮. 论多车道高速公路路基左侧硬路肩设置的必要性[J]. 公路与汽运, 2020(2):52-55.

[3]
孙明玲. 多车道高速公路左侧硬路肩设置的必要性及设置方法[J]. 公路交通科技, 2023, 40(S2):115-121.

[4]
林小媛, 朱顺应, 李维吉, 等. 基于成本-效益的超多车道高速公路左侧硬路肩设置条件[J]. 公路工程, 2022, 47(5):63-70.

[5]
GUERRIERI M, MAURO R. Capacity and safety analysis of hard-shoulder running (HSR): A motorway case study[J]. Transportation Research Part A: Policy and Practice, 2016, 92: 162-183.

[6]
ABDEL-ATY M, HASAN T, ANIK B. An advanced real-time crash prediction framework for combined hard shoulder running and variable speed limits system using transformer[J]. Scientific Reports, 2024, 14(1): 26403. DOI: 10.1038/s41598-024-75350-z.

[7]
李博, 刘春林. 超多车道高速公路设置左侧硬路肩的安全性研究[J]. 广州建筑, 2023, 51(3):101-104.

[8]
林小媛, 朱顺应, 李维吉, 等. 基于Logistic模型的多车道高速公路左侧硬路肩设置判据[J]. 武汉理工大学学报(交通科学与工程版), 2022, 46(2):219-224.

[9]
何润景, 杨林, 刘玮蔚, 等. 基于面板模型的多车道高速公路左侧硬路肩运行风险分析[J]. 交通与运输, 2024, 40(4):31-36.

[10]
GEISTEFELDT J. Hard Shoulder Running[M]// VICKERMANR. International Encyclopedia of Transportation. Oxford: Elsevier, 2021: 508-513.

[11]
李瑞敏, 叶朕, 李斌. 高速公路临时路肩使用措施优化控制与仿真[J]. 系统仿真学报, 2018, 30(3):1036-1045.

[12]
孙凌峰, 俞山川, 王树兴, 等. 高速公路硬路肩动态运行管理研究[J]. 公路, 2023, 68(4):377-382.

[13]
YANG F, WANG F, DING F, et al. Identify optimal traffic condition and speed limit for hard shoulder running strategy[J]. Sustainability, 2021, 13(4): 1822. DOI: 10.3390/su13041822.

[14]
ZHOU W, YANG M, LEE M, et al. Q-learning-based coordinated variable speed limit and hard shoulder running control strategy to reduce travel time at freeway corridor[J]. Transportation Research Record, 2020, 2674(11): 915-925.

[15]
ARORA K, KATTAN L. Operational and safety impacts of integrated variable speed limit with dynamic hard shoulder running[J]. Journal of Intelligent Transportation Systems, 2023, 27(6): 769-798.

[16]
YAO J, QIAN Y, FENG Z, et al. Hidden Markov Model-based dynamic hard shoulders running strategy in hybrid network environments[J]. Applied Sciences, 2024, 14(8): 3145. DOI: 10.3390/app14083145.

[17]
ELEFTERIADOOU L, KONDYLI A, BRILON W, et al. Enhancing ramp metering algorithms with the use of probability of breakdown models[J]. Journal of Transportation Engineering, 2014, 140(4): 04014003. DOI: 10.1061/(ASCE)TE.1943-5436.0000653.

[18]
HU L, TANG J, ZOU G, et al. Simulation optimization of highway hard shoulder running based on multi-agent deep deterministic policy gradient algorithm[J]. Alexandria Engineering Journal, 2025, 117: 99-115.

[19]
熊文磊, 马天奕, 李卓智. 高速公路改扩建左侧硬路肩设置影响因素探讨[J]. 中外公路, 2021, 41(1):310-313.

[20]
LIU B, CAI Q, YANG Z, et al. Vancouver, Neural trust region/proximal policy optimization attains globally optimal policy[C]// Canada: Curran Associates, Inc., 2019: 10564-10575.

[21]
浙江省计量与标准化学会.高速公路应急救援服务规范:T/ZSM 0012—2022[S]. 杭州: 浙江省计量与标准化学会, 2022.

[22]
交通运输部.公路工程技术标准:JTG B01—2014[S]. 北京: 人民交通出版社股份有限公司, 2014.

Options
Outlines

/