理论与方法

自动驾驶事故数据挖掘与典型危险场景构建

  • 王秀杰 , 1, 2 ,
  • 田浩浩 , 1, *
展开
  • 1 广西科技大学 机械与汽车工程学院,广西 柳州 545616
  • 2 广西科技大学 智能车辆(制造)与新能源汽车产业学院,广西 柳州 545616
* 田浩浩(2000—),男,江西九江人,硕士研究生,研究方向为智能网联汽车测试与评价。E-mail:

王秀杰(1977—),女,天津人,博士,副教授,研究方向为智能网联汽车测试与评价。E-mail:

收稿日期: 2024-11-04

  网络出版日期: 2025-06-02

基金资助

广西科技大学博士基金项目(校科博24Z03)

Autonomous Driving Accident Data Mining and Typical Dangerous Scenario Construction

  • WANG Xiujie , 1, 2 ,
  • TIAN Haohao , 1, *
Expand
  • 1 School of Mechanical and Automotive Engineering, Guangxi University of Science and Technology, Liuzhou 545616, China
  • 2 Industry College of Intelligent Vehicle (Manufacturing) and New Energy Vehicle, Liuzhou 545616, China

Received date: 2024-11-04

  Online published: 2025-06-02

摘要

为构建科学合理的城市道路自动驾驶测试场景,基于美国加利福尼亚州机动车管理局(California Department of Motor Vehicles, DMV)2021—2023年公开的280起自动驾驶汽车(Autonomous Vehicle, AV)碰撞事故报告,挖掘典型危险场景并完成测试场景转化。首先,通过多元Logistic回归分析提取人员受伤情况的显著影响因素。其次,引入独热编码(One-Hot Encoding)对分类变量进行二进制向量转换,消除传统标签编码的数值顺序偏差。然后,采用二阶聚类算法挖掘典型危险场景组,并进一步通过交叉表分析场景组与事故结果变量、道路环境变量间的关联性。最后,将危险场景转化设计为自动驾驶测试场景。结果显示,独热编码处理后的变量,聚类质量较传统方法提升50%;聚类分析共识别出12类典型危险场景,且交叉表分析表明场景组与事故结果及道路环境变量显著相关;进一步结合事故机理与测试需求,将这12类危险场景归纳为6类代表性测试场景,其中“AV停止或减速状态下被后方直行车辆追尾”的场景最为典型,在全部场景中占比46.1%。研究表明,独热编码方法显著提升了聚类分析的准确性,基于真实事故数据的场景聚类方法能识别AV在城市道路的事故模式,并为自动驾驶测试场景库的优先级划分与标准化设计提供数据驱动支撑。

本文引用格式

王秀杰 , 田浩浩 . 自动驾驶事故数据挖掘与典型危险场景构建[J]. 交通运输研究, 2025 , 11(2) : 65 -80 . DOI: 10.16503/j.cnki.2095-9931.2025.02.006

Abstract

To construct a scientific and reasonable urban road autonomous driving test scenario, based on 280 AV (Autonomous Vehicle) collision reports published by the California DMV (Department of Motor Vehicles) from 2021 to 2023, typical dangerous scenarios were excavated and converted into test scenarios. Firstly, multivariate logistic regression analysis was conducted to extract significant influencing factors of personnel injury. Secondly, One-hot encoding was introduced to transform categorical variables into binary vectors, eliminating numerical order bias inherent in traditional label encoding. Subsequently, a two-step clustering algorithm was applied to mine typical dangerous scenario clusters, with cross tabulation further analyzing the correlations between scenario clusters and accident outcomes as well as road environment variables. Finally, the identified dangerous scenarios were systematically converted into autonomous driving test scenarios. Results demonstrated that, One-hot encoding improved clustering quality by 50% compared with conventional method; cluster analysis identified 12 typical dangerous scenarios, with cross-tabulation analysis revealing statistically significant associations between scenario clusters and both accident outcomes and road environment variables. Further combining accident mechanisms and testing requirements, these 12 dangerous scenarios were consolidated into 6 representative test scenarios, with "rear-end collisions occurring when AV was in stationary or decelerating state struck by following vehicles" being the most typical, accounting for 46.1% of all scenarios. The findings indicate that One-hot encoding significantly enhances the accuracy of clustering analysis, and the scenario clustering method based on real accident data can effectively identify urban road accident patterns for AV, and provide data-driven support for prioritizing and standardizing autonomous driving test scenario libraries.

0 引言

自动驾驶汽车(Autonomous Vehicle, AV)的发展融合了高性能计算、人工智能和车联网等前沿技术,为现代交通带来了深刻变革。有研究表明,AV较传统汽车可有效避免约1/3的交通事故[1]。尽管自动驾驶技术不断进步,但与AV相关的事故仍频繁发生。AV事故风险的复杂性和隐蔽性远超传统汽车,因此构建科学合理的自动驾驶测试场景对于验证AV在复杂交通环境中的潜在风险具有重要意义。
自动驾驶测试场景构建的数据来源主要包括真实数据、模拟数据和专家经验数据3类[2],其中真实数据因其高度还原实际交通环境而备受关注。当前,用于AV测试场景构建的主要真实数据包括道路交通事故数据和自然驾驶数据[3],但这2类数据存在显著局限:传统交通事故数据主要反映人类驾驶员的操作失误,难以直接用于AV的事故特性分析;自然驾驶数据记录的是车辆正常行驶工况,危险场景发生率低,无法充分验证AV在危险场景下的安全性。针对这些限制,部分研究通过重构传统车辆交通事故场景的方式开展研究。如,Utriainen等[4]选取40个行人死亡车祸案例展开研究,在还原事故现场的基础上,将涉事车辆替换为AV,以评估自动驾驶技术的安全性;Scanlon等[5]对91个事故案例进行了模拟分析,通过将常规车辆替换为Waymo公司的自动驾驶系统Waymo Driver,对比Waymo AV与人类驾驶员的事故表现。然而,AV的事故模式与传统车辆不同,基于传统事故数据构建的测试场景可能导致风险评估偏差[6]。相比之下,AV事故信息直接记录了其在真实道路环境下的碰撞情况,能更精准地揭示自动驾驶系统的安全隐患,是构建典型危险场景的关键数据来源。国际上,基于AV交通事故数据的自动驾驶及高级驾驶辅助系统(Advanced Driving Assistance System, ADAS)测试场景研究已相对成熟[7-8],Nitsche等[9]通过分析英国的事故数据,提取出13类T形交叉口和6类十字交叉口自动紧急制动系统(Autonomous Emergency Braking System, AEB)典型场景,优化了系统响应策略;Sander等[10]通过分析德国事故研究数据,提取了德国的AEB路口测试场景。相比之下,国内针对AV事故测试场景的研究则主要聚焦于AV-两轮车、AV-行人的交互场景,如Hou等[11]基于某城市368例AV自然驾驶数据和90起事故案例,总结出3类我国典型的AV与两轮车冲突场景,并提出了针对AEB系统的优化策略;Sui等[12]通过提取“中国交通事故深度调查(China In-Depth Accident Study, CIDAS)”中AV与两轮车碰撞案例进行聚类分析,得到6类AEB两轮车测试场景;胡越宁等[13]基于北京市和宁波市的AV交通事故数据,构建了在三枝路口环境下的8类AV与两轮车等非机动车和2类AV与行人的危险场景。虽然国内针对AV与行人和两轮车交互的测试场景研究已相对完善[14],但对于城市道路上AV与汽车交互的危险场景仍缺乏系统研究。在场景构建方法上,现有研究多采用层次聚类或K-means聚类处理事故数据[15-16],前者对异常值敏感,后者依赖人工预设簇数;同时,特征变量数字化处理普遍采用标签编码,容易人为引入特征间顺序关系,影响模型判断。
综上,现有研究在自动驾驶测试场景构建方面虽已取得一定进展,但仍存在以下不足:一是数据来源方面,传统交通事故数据难以准确反映AV的事故特性,而自然驾驶数据的危险场景覆盖率较低,导致构建的测试场景无法全面刻画AV在复杂交通环境下的潜在风险;二是研究对象方面,国内尚缺乏针对城市道路中AV与汽车交互的危险场景的系统研究;三是方法论方面,现有聚类分析方法存在对异常值敏感或依赖人工设定参数的问题,同时特征变量的编码方式可能影响分类准确性。鉴于此,本文基于AV真实交通事故数据,采用独热编码数字化处理特征变量,结合多元Logistic回归分析筛选关键特征,并运用二阶聚类算法构建城市道路环境中的AV交通事故典型危险场景,以期为完善AV测试场景库提供数据支撑和方法参考,为城市道路中AV与人工驾驶车辆碰撞场景的研究提供实证支持。

1 事故数据来源与筛选

美国加利福尼亚州(以下简称“加州”)自动驾驶汽车碰撞事故报告自2014年起由加州机动车管理局(California Department of Motor Vehicles, DMV)通过其官方网站公开发布,为研究自动驾驶车辆的实际道路安全性提供了重要的数据来源[17]。这些报告详细记录了事故的基本信息、车辆详情、驾驶状态以及事故过程等关键要素。2017年度加州自动驾驶汽车碰撞事故报告完成内容更新,新增了事故损伤等级、发生位置等信息,并补充了天气条件、光照强度、地表状态及道路环境等多项指标数据。
考虑到加州自动驾驶汽车碰撞事故报告在获取便利性、数据结构规范性等方面具有优势,因此本文选取加州DMV于2021年1月—2023年12月发布的400份自动驾驶车辆交通事故报告,逐一审阅报告内容,提取关键字段(如驾驶模式、碰撞类型),确保样本的代表性与数据的准确性。经筛选后仅保留适用于本研究的280起案例。样本筛选的标准与原则为:
1)事故参与方界定:事故必须是发生在AV和商用车或乘用车之间的碰撞,剔除AV与其他车型发生碰撞的案例;
2)案例有效性标准:剔除数据缺失或者不明的事故案例,同时排除存在违反通行法规(如闯红灯)等违法行为的事故案例;
3)驾驶模式界定:剔除AV发生事故时处于传统模式(手动驾驶)的事故案例,仅保留事故发生时AV处于自动驾驶模式的案例。

2 变量数字化处理与聚类方法

2.1 变量类别编码和标准化

事故信息提取后,特征要素间的量纲差异较大,会降低聚类分析效率。因此,聚类分析前需对场景特征变量进行数字化处理。根据变量特性,可进行静态定义处理和动态定义处理[18]
静态定义处理体现为状态固定化策略,即用特定常数精确标识某一状态。为避免传统标签编码可能引入的偏差,本文采用独热编码方式,通过SPSS软件创建虚拟变量(Dummy Variables)实现数据转换。对于具有 k个分类的变量,创建 k-1个取值为0或1的虚拟变量,并将比例最高的类别设为参考类(基组)以避免共线性问题。例如,事故位置变量可转换为长度为3的二进制向量,如表1所示。
表1 标签编码转换为独热编码
事故
位置
标签编码
(Label Encoding)
独热编码
(One-Hot Encoding)
4值变量 是否为
十字路口
是否为
T形路口
是否为
停车场
十字
交叉口
1 1 0 0
T形
交叉口
2 0 1 0
停车场 3 0 0 1
直行
道路
4 0 0 0

注:1.独热编码中,1代表“是”,0代表“否”。2.“直行道路”为参考类。

数据处理过程中,先对变量进行标签编码,以便与独热编码聚类结果进行对比。为精简样本,对低频同类项进行合并并赋予新编码。新编码值通过加权平均法计算[16],计算公式如下:
X n - c o d e = i = 1 n w i x i - c o d e i = 1 n w i
式(1)中: X n - c o d e为新编码值; x i - c o d e为第 i个变量类别编码; w i为第 i个变量类别的权重; n为需要合并的类别数量。
编码简化示例如表2所示。
表2 编码简化示例
特征 原始值 新值
类别 编码值 数量 类别 编码值 数量
天气
条件
晴天 1 248 晴天 1 248
阴天 2 19 阴天 2 19
雨天 3 12 雨天等恶劣天气 3.077 13
雾天 4 1
动态定义处理涉及更复杂多变的状态描述,不能仅用常数表示。对于车速等间隔尺度变量,可采用极差标准化方法处理。该方法是对原始数据的线性变换,使结果落到[0,1],转换函数如下[19]
y i = X i - m i n x j m a x x j - m i n x j         1 i n ,   1 j n
式(2)中: y i为第 i个样本的标准化值; X i为第 i个样本的原始值; m i n x j为所有样本中的最小值; m a x x j为所有样本中的最大值。
表3展示了聚类参数(变量)、参数特征(类别)的初始数值表示和转换/标准化后的数值表示。转换/标准化后的数值将在聚类分析中代表变量特征。图1(a)展示了车辆碰撞部位划分,图1(b)展示了碰撞车辆双方的划分,其中 v 1是自动驾驶汽车(AV), v 2是碰撞方(乘用车或商务车)。
表3 事故数据样本总体统计及编码值
类型 特征 类别 数量 占比(%) 初始数值表示 转换/标准化后数值表示
名义 天气
条件
晴天 248 88.6 1 0,0
阴天 19 6.8 2 1,0
雨天等
恶劣天气
13 4.6 3.077 0,1
名义 照明
条件
白天 175 62.5 1 0,0,0
晨昏 9 3.2 2.778 1,0,0
夜间
(有路灯)
95 33.9 3 0,1,0
夜间
(无路灯)
1 0.4 4 0,0,1
名义 路面
干湿
缺失值 8 2.9 1 1,0
干燥 260 92.9 2 0,0
潮湿 12 4.2 3 0,1
名义 事故
位置
直行道路 127 45.4 1 0,0,0
十字交叉口 141 50.4 2 1,0,0
T形交叉口 5 1.8 3 0,1,0
停车场 7 2.5 4 0,0,1
名义 车型
(v 1/ v 2)
乘用车 280/169 100/60.4 1 0,0,0
商用车 0/76 0/27.1 2 1,0,0
两轮车 0/17 0/6.1 3 0,1,0
固定物 0/18 0/6.4 4 0,0,1
名义 运动
状态
(v 1/ v 2)
直行 81/174 28.9/62.1 1 1(0), 0, 0,
0, 0, 0
减速 24/8 8.6/2.9 2 0(1), 1(0),
0, 0, 0, 0
停止 136/42 48.6/15.0 3 0, 0(1),
0, 0, 0, 0
右转 13/7 4.6/2.5 4 0, 0, 1, 0, 0, 0
左转 14/12 5.0/4.3 5 0, 0, 0, 1, 0, 0
变道 3/16 1.1/5.7 6 0, 0, 0, 0, 1, 0
倒车 9/21 3.2/7.5 7 0, 0, 0, 0, 0, 1
名义 碰撞
部位
(v 1/ v 2)
右侧 41/27 14.6/9.6 1 1, 0, 0, 0
后围 141/27 50.4/
9.6
2 0, 0(1), 0, 0
左侧 54/27 19.3
/9.6
3 0, 1(0),
0(1), 0
前围 44/180 15.7/64.3 4 0, 0, 1(0), 0
其他 0/19 0/6.8 5 0, 0, 0, 1
名义 碰撞
方向
前/后碰撞 159 56.8 1 0, 0, 0, 0, 0
前/前碰撞 13 4.6 2.154 1, 0, 0, 0, 0
侧碰撞 51 18.2 4 0, 1, 0, 0, 0
前/侧面
碰撞
35 12.5 5 0, 0, 1, 0, 0
后/侧面
碰撞
3 1.1 6 0, 0, 0, 1, 0
19 6.8 7 0, 0, 0, 0, 1
名义 碰撞
类型
正面碰撞 30 10.7 1 1, 0, 0, 0, 0
侧面碰撞 22 7.9 2 0, 1, 0, 0, 0
侧面刮擦 67 23.9 3 0, 0, 1, 0, 0
追尾碰撞 136 48.6 4 0, 0, 0, 0, 0
撞固定物 19 6.8 5 0, 0, 0, 1, 0
其他 6 2.1 6 0, 0, 0, 0, 1
标度 车速 AV车速 0~42 极差标准化
计算
碰撞方
车速
0~64 极差标准化
计算

注:1. v 1表示自动驾驶汽车(AV), v 2表示碰撞方。2. 转换/标准化后的数值表示中以“运动状态”中“直行”为例,“1(0), 0, 0, 0, 0, 0”中的“1, 0, 0, 0, 0, 0”表示AV“直行”编码,“0, 0, 0, 0, 0, 0”表示碰撞方“直行”编码。3.类别中的“前/后碰撞”表示“前围与后围碰撞”,“前/前碰撞”表示“前围与前围碰撞”,“前/侧面碰撞”表示“前围与侧面碰撞”,“后/侧面碰撞”表示“后围与侧面碰撞”。

图1 碰撞车辆部位划分与车辆划分示意

2.2 二阶聚类算法

聚类分析是一种无监督机器学习方法,其目标是将相似数据归为同一簇,并最大化簇间异质性。传统K-means算法需预先指定簇数,结果易受初始中心点影响;层次聚类虽能自动生成簇结构,但需人工截断树状图以确定最终分类。二者均依赖主观干预,限制了聚类结果的客观性。本文采用二阶聚类算法,该算法能基于统计准则自动确定最优类别数,有效克服上述局限性,从而更准确地识别数据中的聚类结构。

2.2.1 算法流程

首先,将分类变量和连续变量作为聚类的依据;然后,选择合适的聚类准则和距离度量方法以评估聚类效果。本文选择贝叶斯信息准则(Bayesian Information Criterion, BIC)作为模型选择的标准统计量,用于确定最佳聚类数,并使用对数似然(Log-Likelihood)作为聚类变量相似度的度量方法。BIC通过平衡模型的拟合优度与复杂度来避免过拟合,其值越小,表明模型在拟合优度与复杂度之间的权衡越优。通过比较不同聚类数对应的BIC值,可客观选择最优的簇数。BIC值计算公式为[20]
B = k l n N - 2 l n L
式(3)中: B为BIC值; k为模型参数数量(在聚类中与簇的数量相关); N为观测值的数量; L为模型的最大似然估计值。
在设置相关变量和参数后,构建分类特征空间,将观测样本分配到特定节点,并评估后续观测点与该节点的相似性。如果不相似,则创建1个新节点。该过程重复进行,直至所有观测样本被正确分配到相应的节点。最终,生成聚类结果的透视表和图表等。

2.2.2 样本距离测量

在聚类分析中,样本间的相似度通常通过距离来量化。本文采用对数似然法评估样本相似性,该方法建立在变量遵循特定概率分布的前提之上。具体而言,连续变量假定服从正态分布,而分类变量则假定遵循多项分布。相应的度量公式如下[20]
对于连续变量,假设其服从正态分布 N μ ,   σ 2,则给定两个样本 X i X j,对数似然距离 d i j c o n t可表示为:
d i j c o n t = k = 1 p X i k - μ k 2 σ k 2 + X j k - μ k 2 σ k 2 - X i k - μ j k 2 σ k 2
式(4)中: d i j c o n t为样本 X i和样本 X j之间的对数似然距离(连续变量); X i k X j k分别为样本 X i和样本 X j在第 k个变量上的取值; μ j k为样本 X i在第 k个变量上的均值; μ k σ k分别为第 k个变量的总体均值和总体标准差; p为变量的数量。
对于分类变量,假设其服从多项分布,则给定两个样本 X i X j,其对数似然距离 d i j c a t可表示为:
d i j c a t = - k = 1 q l = 1 L k X i k l l o g X i k l θ k l + X j k l l o g X j k l θ k l - X i k l + X j k l l o g X i k l + X j k l 2 θ k l
式(5)中: d i j c a t为样本 X i和样本 X j之间的对数似然距离(分类变量); θ k l为第 k个分类变量中第 l类别的概率; X i k l X j k l分别为样本 X i X j在第 k个分类变量中第 l类别上的指示变量,取值为0或1; q为分类变量的数量; L k为第 k个分类变量的类别数。
对于包含连续变量和分类变量的混合数据,可以综合上述两种距离,构造出混合数据的对数似然距离:
d i j = λ d i j c o n t + 1 - λ d i j c a t
式(6)中: λ为权重系数(根据连续变量和分类变量的数量比例确定,本文取0.1),反映连续变量和分类变量的重要性程度。
此方法在处理包含分类变量的数据集时尤为适用,因为在这种情况下,传统的欧氏距离度量可能无法有效应用。此外,对数似然度量假设所有变量相互独立,这一前提对于确保聚类分析的精确性至关重要。通过运用这种统计方法,可以在复杂的数据结构中揭示出更为精准的聚类模式。

3 事故特征变量的选取

事故特征变量的选择将决定聚类分析中的聚类参数,并影响典型危险场景提取结果。因此,采用合理的方法选择自动驾驶测试中的关键要素,对于场景提取尤为重要。
现有研究中,事故特征变量的选择多依赖主观分析,缺乏量化依据。为此,本文提出一种基于事故人员受伤情况影响因素的事故特征变量选取方法,通过多元Logistic回归分析,量化各种事故变量与人员受伤情况之间的显著相关性,从而将对人员受伤情况有显著影响的变量确定为特征变量。该方法不仅能在大量事故数据中自动筛选出与受伤情况高度相关的变量,还能减少人为因素的干扰,提高分析的客观性和精确性。

3.1 事故人员受伤情况影响因素

3.1.1 回归分析变量的选取

回归分析中因变量为事故人员受伤情况。根据加州自动驾驶汽车碰撞事故报告中的细节描述,对人员受伤情况按不同程度划分为无受伤、轻微受伤、中度受伤和重度受伤。考虑到涉及重度受伤的报告样本占总样本的比例极小,故将此类与中度受伤合并为一类。
基于既有研究[14],本文遴选出一些可能对交通事故中人员受伤情况有显著影响的潜在因子作为自变量,分别为交通环境变量中的天气条件、照明条件、路面干湿和事故位置,以及事故结果变量中的碰撞类型和碰撞方向,采用SPSS数据分析软件进行多元Logistic回归分析。因变量及自变量的参数取值如表4所示。
表4 Logistic回归分析变量取值
变量
类型
变量名 数学表示 变量值 量化值


人员
受伤
情况
y 0
轻度受伤 1
中(重)度受伤 2
自变量 交通环境 天气
条件
x 1 晴天 0,0
阴天 1,0
雨天等恶劣天气 0,1
照明
条件
x 2 白天 0,0,0
晨昏 1,0,0
夜间(路灯) 0,1,0
夜间(无路灯) 0,0,1
路面
干湿
x 3 缺失值 1,0
干燥 0,0
潮湿 0,1
事故
位置
x 4 直行道路 0,0,0
十字交叉口 1,0,0
T形交叉口 0,1,0
停车场 0,0,1
事故结果 碰撞
类型
x 5 正面碰撞 1,0,0,0,0
侧面碰撞 0,1,0,0,0
侧面刮擦 0,0,1,0,0
追尾碰撞 0,0,0,0,0
撞固定物 0,0,0,1,0
其他 0,0,0,0,1
碰撞
方向
x 6 前/后碰撞 0,0,0,0,0
前/前碰撞 1,0,0,0,0
侧碰撞 0,1,0,0,0
前/侧面碰撞 0,0,1,0,0
后/侧面碰撞 0,0,0,1,0
0,0,0,0,1

3.1.2 多元Logistic回归分析模型

在交通事故分析中,事故人员的受伤情况通常是一个离散的多分类变量,这类数据不适用于传统的线性回归模型,原因如下:首先,因为受伤情况是分类变量,而线性回归主要用于预测连续变量;其次,线性回归可能会产生超出合理范围的预测值(如负值或大于1),不符合概率的定义;再次,本文需考虑不同类别间的相对概率关系,而不仅仅是获得1个连续输出值。因此本文采用多元Logistic回归模型来预测事故人员受伤情况。
当因变量 y(事故人员受伤情况)有 J个类别(无受伤、轻微受伤、中/重度受伤)时,需建立 J-1个Logit变换,以某一类别作为参考类别,确定其他类别相对于该类别的对数几率比(Odds Ratio)[21]
l n p y = j x p y = J x = α j + i = 1 n β j i x i
式(7)中: x为包含所有对事故人员受伤情况有显著影响的自变量向量, x=(x 1, x 2, …, x n); n为有显著影响的自变量的数量; y为因变量(事故人员受伤情况); j为因变量 y的各种可能的结果, j=1, 2, …, J-1; x i为第 i个自变量; α j为类别 j的截距; β j i为自变量 x i对类别 j影响的回归系数。
若事故人员受伤情况分为 y=0(未受伤), y=1(轻微受伤), y=2中(中/重度受伤),模型构建时可以选择“未受伤”(y=0)作为参考类别,建立两个Logit模型: l n p y = 1 x p y = 0 x = α 1 + i = 1 n β 1 i x i l n p y = 2 x p y = 0 x = α 2 + i = 1 n β 2 i x i这两个方程分别建模了轻微受伤(y=1)和中/重度受伤(y=2)相对于未受伤状态的对数几率关系。这种模型能说明不同因素对不同受伤程度的差异化影响,例如,某些因素可能对轻微受伤影响显著,但对重度受伤影响有限。
为更直观地表示该模型,定义线性预测值 η j x为:
η j x = α j + i = 1 n β j i x i
式(8)中: η j x为在给定自变量 x情况下,第 j种受伤情况的线性预测值。
每个 j的概率可以表示为:
P y = j x = e η j x 1 + k = 1 J - 1 e η k x
式(9)中: η k x为第 k种受伤情况的线性预测值,由式(8)计算得出。
而参考类别 y= J的概率则为:
P y = J x = 1 1 + k = 1 J - 1 e η k x
在多元Logistic回归中,对每个Logit模型分别建模,共 J-1个模型。因变量 y各种可能结果均与最后一个模型(y= J)进行对比。

3.1.3 回归分析结果

多元Logistic回归分析采用最大似然法来估计模型参数,其核心思想是通过调整参数值,使观测数据与估计值相同的概率最大[22]。本文设定显著性水平为0.05作为阈值。当显著性水平 p值小于或等于该阈值时,认为自变量对因变量具有显著影响。
模型拟合信息如表5所示,显著性水平p<0.05,表明模型拟合效果良好。Logistic回归分析结果如表6所示。
表5 模型拟合信息
模型类型 模型拟合条件 似然比检验
-2对数似然值 卡方 自由度 显著性水平p
截距模型 84.924
拟合模型 50.042 34.882 19 0.014
表6 Logistic回归分析结果
变量 模型拟合条件 似然比检验
-2对数似然值 卡方 自由度 显著性水平p
截距 50.042 0 0
天气条件 50.764 0.722 2 0.697
照明条件 50.784 5.743 3 0.043
路面干湿 50.294 0.253 2 0.881
事故位置 50.173 7.131 3 0.026
碰撞类型 72.243 22.201 4 <0.001
碰撞方向 54.191 6.150 4 0.038

3.2 危险场景特征变量

经多元Logistic回归分析表明,照明条件、事故位置、碰撞类型和碰撞方向与事故人员受伤情况存在显著相关性。相比之下,天气条件和路面干湿与事故人员受伤情况相关性不明显(p 0.05)。因此,将对事故人员受伤情况有显著影响的照明条件、事故位置、碰撞类型和碰撞方向作为特征变量。鉴于自动驾驶与手动驾驶模式在环境感知上存在显著差异:手动模式下,驾驶员能迅速适应天气变化,而自动驾驶依赖的车载传感器(如毫米波雷达、激光雷达、摄像头等)在复杂天气中容易受限或被干扰[23]。因此,本文将天气条件纳入特征变量,以全面评估自动驾驶的安全性。
此外,AV与碰撞方的运动状态、速度和碰撞部位是事故的关键影响因素,而车型对系统感知能力也有显著影响[23]。因此,本文选取碰撞双方的车型、运动状态和车速作为事故主体变量;天气、照明条件和事故地点作为事故环境变量;碰撞部位、碰撞类型和碰撞方向作为事故结果变量。自动驾驶危险场景涉及上述9类特征变量,如图2所示。
图2 自动驾驶典型危险场景特征变量

4 典型危险场景挖掘与结果分析

4.1 典型危险场景挖掘与分析

在聚类分析中,轮廓系数(Silhouette Coefficient)是评估聚类质量的关键指标。其值域范围为[-1, 1],值越接近1,表明聚类效果越理想,即簇内凝聚度高且簇间分离度也高。如图3所示,同样采用二阶聚类,经独热编码处理后得到的轮廓系数为0.3,比经标签编码聚类后的轮廓系数提升50%,表明独热编码处理后的聚类质量更好。
图3 轮廓系数和聚类质量
经独热编码处理后的聚类分析识别出12类典型危险场景,其概率分布如图4所示。
图4 12类典型危险场景概率分布
表7总结了这12类场景的事故数据情况。为更好地理解每类场景中车速的整体分布,使用箱线图进行直观呈现,具体结果如图5图6所示,图7解释了箱线图的各部分构成。
表7 聚类结果数据集统计
场景类型 1 2 3 4 5 6 7 8 9 10 11 12
天气条件 晴天 20* 16* 12* 30* 12* 15* 20* 42* 41* 15* 12* 13*
阴天 0 2 0 0 2 1 0 3 7 0 4 0
雨天等恶劣天气 1 1 0 2 0 0 0 1 0 4 3 1
照明条件 白天 12* 15* 5 17* 11* 11* 11* 32* 45* 0 10* 6
晨昏 1 0 0 2 1 1 0 0 3 0 0 1
夜间(有路灯) 8 4 7* 13 2 4 9 13 0 19* 9 7*
夜间(无路灯) 0 0 0 0 0 0 0 1 0 0 0 0
事故位置 直行道路 5 14* 9* 5 5 8 8 46* 8 2 9* 8*
十字交叉口 13* 3 1 25* 9* 8* 12* 0 40* 17* 7 6
T形交叉口 0 1 2 2 0 0 0 0 0 0 0 0
停车场 3 1 0 0 0 0 0 0 0 0 3 0
AV车型 乘用车 21* 19* 12* 32* 14* 16* 20* 46* 48* 19* 19* 14*
商用车 0 0 0 0 0 0 0 0 0 0 0 0
两轮车 0 0 0 0 0 0 0 0 0 0 0 0
固定物 0 0 0 0 0 0 0 0 0 0 0 0
碰撞方
车型
乘用车 10 10* 8* 20* 8* 10* 11* 43* 29* 12* 1 7
商用车 11* 8 3 7 4 4 6 0 19 7 0 7*
两轮车 0 1 1 5 2 2 3 3 0 0 0 0
固定物 0 0 0 0 0 0 0 0 0 0 18* 0
AV运动
状态
直行 1 7 11* 19* 0 16* 13* 0 0 0 13* 1
减速 0 0 0 0 0 0 1 15 5 3 0 0
停止 18* 9* 1 5 0 0 3 31* 41* 15* 0 13*
右转 2 0 0 1 7 0 0 0 0 1 2 0
左转 0 0 0 7 0 0 2 0 2 0 3 0
变道 0 1 0 0 0 0 1 0 0 0 1 0
倒车 0 2 0 0 7* 0 0 0 0 0 0 0
碰撞方
运动状态
直行 16* 3 7* 21* 4 12* 12* 39* 43* 17* 0 0
减速 0 0 0 0 0 0 1 3 4 0 0 0
停止 0 7* 2 1 8* 0 5 0 0 0 19* 0
右转 3 0 0 1 1 0 0 0 0 2 0 0
左转 0 0 0 9 0 1 2 0 0 0 0 0
变道 1 3 3 0 1 3 0 4 1 0 0 0
倒车 1 6 0 0 0 0 0 0 0 0 0 14*
AV碰撞
部位
右侧 0 19* 0 13 4 0 0 0 0 0 5 0
后围 0 0 0 0 7 15 0 46* 48* 19* 4 2
左侧 21* 0 12* 19* 0 0 0 0 0 0 2 0
前围 0 0 0 0 3* 1 20* 0 0 0 8* 12
其他 0 0 0 0 0 0 0 0 0 0 0 0
碰撞方
碰撞部位
右侧 13* 0 12* 0 2 0 0 0 0 0 0 0
后围 0 2 0 0 2 0 9 0 0 0 0 14*
左侧 8 17* 0 0 0 0 1 0 1 0 0 0
前围 0 0 0 32* 10* 16* 10* 46* 47* 19* 0 0
其他 0 0 0 0 0 0 0 0 0 0 19* 0
碰撞方向 前/后碰撞 0 0 0 1 10* 15* 9 46* 47* 19* 19* 12*
前/前碰撞 0 0 0 0 0 1 10* 0 0 0 0 2
侧碰撞 21* 17* 12* 0 1 0 0 0 0 0 0 0
前/侧面碰撞 0 0 0 31* 3 0 1 0 0 0 0 0
后/侧面碰撞 0 2 0 0 0 0 0 0 1 0 0 0
碰撞类型 正面碰撞 0 0 0 3 0 0 17* 0 0 0 0 10*
侧面碰撞 0 2 4 14* 1 0 0 0 0 1 0 0
侧面刮擦 19* 16* 8* 13 5 1 1 0 1 0 0 1
追尾碰撞 1 0 0 2 6* 15* 2 45* 47* 18* 0 2
撞固定物 0 0 0 0 0 0 0 0 0 0 19 0
其他 1 1 0 0 2 0 0 1 0 0 0 1
场景数量 21 19 12 32 14 16 20 46 48 19 19 14
场景图示 图8(a) 图8(b) 图8(c) 图8(d) 图8(e) 图8(f)
图8(g) 图8(h) 图8(i)
图8(j)
图8(k) 图8(l)

===注:“*”标记的数据所对应的特征为该类场景的特征。

图5 AV速度箱线图
图6 碰撞方速度箱线图
图7 箱线图示例图
然而,由于车速普遍集中在某一范围内,很难确定每类场景的具体车速值,这会对实际自动驾驶测试造成不便。为满足自动驾驶测试的需求,本文基于以下两点原则确定最终车速值。
1)采用中位数作为代表性车速,以准确反映数据集中趋势。
2)将车速调整为5或10的整数倍,便于实车测试。采用以下圆整规则:①如果中位数车速接近5的倍数(如13、17、22等),则将其圆整为最接近的5的倍数;②如果中位数车速接近10的倍数(如28、32、48等),则将其圆整为最接近的10的倍数。
根据表7,从每类场景的特征变量中选取占比最大的特征作为该类事故的特征。以表8所确定的车速值作为相应场景车辆的速度。最终,构建出12类自动驾驶汽车事故典型危险场景,场景图示见图8
表8 车速值分析结果
场景类型 1 2 3 4 5 6 7 8 9 10 11 12
AV碰撞车速(中位数)
/(km/h)
0 5 18 17 5 6 8 0 0 0 27 0
AV车速
(测试)
/(km/h)
0 5 20 15 5 5 10 0 0 0 30 0
碰撞方碰撞车速(中位数)
/(km/h)
12 6 21 19 8 27 10 12 10 12 0 5
碰撞方车速
(测试)
/(km/h)
10 5 20 20 10 25 10 10 10 10 0 5
图8 12类典型危险场景示意图

4.2 交叉表分析

为评估所构建的12类典型危险场景与事故结果变量及交通环境变量之间的关联程度,本文采用交叉表和卡方检验方法进行了统计分析。
图9分析了AV损坏程度与危险场景的关系。结果表明,在第4、6、7、10、11类场景中,AV表现出较高的损坏程度。卡方检验结果(χ 2 = 17.125 p = 0.756)显示,各类危险场景中AV的损坏程度差异不具有统计学显著性。
图9 场景组-AV损坏程度分布
图10分析了碰撞类型与危险场景的关系。结果显示,侧面刮擦、追尾碰撞和侧面碰撞是出现频率最高的3种碰撞类型。其中第4、5、12类场景包含了多样化的碰撞结果,参考表7可知每类场景均涉及4种不同的碰撞类型。卡方检验结果(χ 2 = 17.125 p 0.001)表明各类危险场景与碰撞类型间存在显著关联。
图10 场景组-碰撞类型分布
图11分析了事故人员受伤程度与危险场景的关系。结果显示,第3、4、6、7、10类场景人员受伤的概率比较高,其中第3类具有最高的比例,达到了25%。卡方检验结果(χ 2 = 15.797 p = 0.149)表明各类危险场景的人员受伤情况没有显著差异。
图11 场景组-受伤程度分布
图12图13分析了各类危险场景与交通环境变量间的关联程度。由图12可知,第8类和第9类事故在日间呈现较高的发生概率,第4类和第9类事故在晨昏时段表现出较高的发生倾向。在夜间(有路灯)环境下,第4、8、10类事故的发生概率相对较大。由于夜间无路灯环境下的样本数据较少,相关分析结果的可靠性受限,故未纳入本文的分析结果中。卡方检验结果(χ 2 = 91.137 p 0.001)表明不同照明条件下的场景分布存在显著差异。
图12 场景组-照明条件分布
图13 场景组-事故位置分布
图13可知,直行道路包含的场景类型最为丰富,涉及12类场景,且第8类事故在此类道路上的发生概率最大(36%)。十字交叉口则以第9类事故为主要类型(发生概率为28%),卡方检验结果(χ 2 = 169.122 p 0.001)表明事故位置的场景分布存在显著差异。

5 测试场景设计与分析

5.1 测试场景设计

根据上文聚类出的12类典型危险场景,本文结合事故机理、碰撞类型与测试需求,将其归纳设计为6类测试场景,以期为AV安全性能评估提供参考。测试场景概率分布如图14所示,对应的场景描述如表9所示,示意图如图15所示。
图14 测试场景概率分布
表9 6类测试场景描述
测试场景类型 具体描述
(编号1~12代表各类危险场景)
占比及重要性
A类 1.晴天十字交叉口商务车与停止AV侧面刮擦
2.晴天直行道路乘用车与停止AV侧面刮擦
3.夜间直行道路AV与乘用车行驶时侧面刮擦
占总样本18.6%,
发生较为频繁
B类 4.晴天条件下双方在路口直行引发侧面碰撞 占总样本11.4%
C类 7.晴天条件下双方在路口直行引发正面碰撞 占总样本7.1%
D类 6. 乘用车高速追尾低速行驶的AV
8.~10.乘用车低速追尾停止AV
占总样本46.1%,
高频发生,AV碰撞测试场景设计需重点
关注
E类 11. AV与路障碰撞 占总样本6.8%,虽
占比小,但对AV
安全至关重要
F类 5. AV略微倒车与乘用车发生追尾碰撞
12.商务车略微倒车与AV发生正面碰撞
占总样本10%
图15 6类测试场景示意图

5.2 分析与讨论

针对占比最高的D类事故,结合加州自动驾驶碰撞事故报告细节描述,其主要成因包括:①AV执行保守驾驶策略:AV在不确定情况下倾向于谨慎驾驶,如提前减速或停车,要求后方车辆迅速反应,易导致追尾;②人机驾驶差异:AV在紧急情况下的制动策略可能与人类驾驶员的预期不符,增加事故风险;③复杂交通环境:在车流密集、信号灯附近或合流区,AV的速度变化增加了追尾风险;④低速行驶风险:在交通拥堵或需减速以便在红绿灯前排队等低速行驶时,车辆间距较近,轻微速度变化可能引发追尾。低速行驶风险在D类事故中尤为常见,说明AV在低速行驶时的策略和人机交互需进一步优化,以减少追尾风险。
本文基于美国加州的自动驾驶碰撞事故报告数据展开分析,加州作为全球自动驾驶技术发展最为活跃的地区之一,其开放的自动驾驶政策、丰富的测试场景和高水平的技术积累为自动驾驶车辆提供了真实而复杂的测试环境。相比之下,我国当前的自动驾驶发展阶段与加州存在以下差异。
1)政策监管差异:加州采取较为宽松的自动驾驶测试管理政策,例如允许无安全员的完全自动驾驶车辆上路测试;我国现阶段在特定城市和区域内也已允许无安全员的完全自动驾驶车辆(L4/L5级)进行上路测试,但总体政策推进仍相对谨慎。
2)道路交通环境差异:加州城市路网结构较清晰、交通参与者行为相对规范,交通设施标准化程度高;而我国城市交通环境更为复杂,存在机动车与非机车、行人混行等现象,对自动驾驶系统提出更高挑战。
3)场景类型与数据分布差异:加州的自动驾驶事故中,高速公路和郊区场景占比较大,典型场景以直线跟车、车道保持为主;而我国城市交通中,频繁的变道、交叉口场景、非标识车辆参与等情况更为突出,危险场景类型呈现出一定的地域特征。
因此,本文所提炼出的6类测试场景在风险模式识别和测试框架构建方面具有方法层面的借鉴意义,但在实际应用于我国AV测试场景库建设时,需结合我国交通行为特征、典型事故数据进行调整与验证。

6 结束语

本文基于DMV于2021—2023年公开的自动驾驶汽车碰撞事故报告数据,通过多元Logistic回归模型探究事故影响因素,采用独热编码和二阶聚类算法挖掘典型危险场景,并通过交叉表分析所构建的场景组与各事故变量间的关联性,最终构建了12类典型危险场景并转化成6类测试场景,探讨了AV交通事故危险场景的构建方法,并针对AV与人工驾驶车辆在城市道路中的特定碰撞模式(如追尾、侧面刮擦等)提出了针对性测试场景。研究结果表明,基于AV事故数据的二阶聚类分析能识别出典型危险场景,场景组与事故结果及道路环境变量显著相关,独热编码方法显著提升了场景聚类的准确性,可为自动驾驶测试场景库的构建提供参考。然而,由于本文涉及的事故数据样本量相对较少,所构建的测试场景存在一定的局限性。此外,本文仅关注了城市道路场景,未能涵盖高速公路等其他道路类型的测试需求。未来研究可扩大数据样本量,纳入更多地区和年份的事故数据。同时,可拓展研究场景,将高速公路、乡村道路等多种道路类型纳入考虑范围。另外,可引入深度学习等算法,进一步提升场景识别和分类的准确性,为自动驾驶测试场景库的完善和优化提供更科学的技术支撑。
[1]
MUELLER A, CICCHINO J, ZUBY D. What humanlike errors do autonomous vehicles need to avoid to maximize safety?[J]. Journal of Safety Research, 2020, 75: 310-318.

[2]
朱冰, 张培兴, 赵健, 等. 基于场景的自动驾驶汽车虚拟测试研究进展[J]. 中国公路学报, 2019, 32(6):1-19.

[3]
王润民, 朱宇, 赵祥模, 等. 自动驾驶测试场景研究进展[J]. 交通运输工程学报, 2021, 21(2):21-37.

[4]
UTRIAINEN R. The potential impacts of automated vehicles on pedestrian safety in a four-season country[J]. Journal of Intelligent Transportation Systems, 2021, 25(2): 188-196.

[5]
SCANLON J, KUSANO K, DANIEL T, et al. Waymo simulated driving behavior in reconstructed fatal crashes within an autonomous vehicle operating domain[J]. Accident Analysis and Prevention, 2021, 163: 106454. DOI:https://doi.org/10.1016/j.aap.2021.106454.

[6]
AYDIN M, AKBAS M. Identification of test scenarios for autonomous vehicles using fatal accident data[J]. SAE International Journal of Connected and Automated Vehicles, 2021, 4(1): 119-132.

[7]
NITSCHE P, WELSH R, GENSER A, et al. A novel, modular validation framework for collision avoidance of automated vehicles at road junctions[C]// Proceedings of the 2018 21st International Conference on Intelligent Transportation System (ITSC). Maui, USA: IEEE, 2018: 90-97.

[8]
ATALAR D, THOMAS P. Powered two-wheeler crash scenario development[J]. Accident Analysis and Prevention, 2019, 125: 198-206.

[9]
NITSCHE P, THOMAS P, STUETZ R, et al. Pre-crash scenarios at road junctions: A clustering method for car crash data[J]. Accident Analysis & Prevention, 2017, 107: 137-151.

[10]
SANDER U, LUBBE N. The potential of clustering methods to define intersection test scenarios: Assessing real-life performance of AEB[J]. Accident Analysis & Prevention, 2018, 113: 1-11.

[11]
HOU L, DUAN J, WANG W, et al. Drivers′ braking behaviors in different motion patterns of vehicle-bicycle conflicts[J]. Journal of Advanced Transpor-tation, 2019, 2019, (Pt.1): 565-581.

[12]
SUI B, LUBBE N, BARGMAN J. A clustering approach to developing car-to-two-wheeler test scenarios for the assessment of automated emergency braking in China using in-depth Chinese crash data[J]. Accident Analysis and Prevention, 2019, 132: 105242. DOI:https://doi.org/10.1016/j.aap.2019.07.018.

[13]
胡越宁, 赵丹, 牛学军. 面向自动驾驶汽车的三枝路口典型危险场景构建方法[J]. 中国人民公安大学学报(自然科学版), 2022, 28(4):47-53.

[14]
徐向阳, 周兆辉, 胡文浩, 等. 基于事故数据挖掘的AEB路口测试场景[J]. 北京航空航天大学学报, 2020, 46(10):1817-1825.

[15]
廖静倩, 张道文, 高立, 等. 基于NAIS事故数据聚类的丁字路口危险场景研究[J]. 汽车安全与节能学报, 2021, 12(3):336-345.

[16]
任立海, 夏环, 蒋成约, 等. 基于交通事故数据的自动紧急制动系统测试场景构建[J]. 科学技术与工程, 2022, 22(24):10737-10747.

[17]
California Department of Motor Vehicles. Autonomous Vehicle Collision Reports[EB/OL]. [2024-11-03]. https://www.dmv.ca.gov/portal/vehicle-industry-services/autonomous-vehicles/autonomous-vehicle-collision-reports/.

[18]
曾德松, 高琛, 谭北海, 等. 自动驾驶仿真测试场景库构建研究[J]. 现代计算机, 2021, 27(31):1-12,32.

[19]
孟德顺, 郭满才. 对应分析方法的注记[J]. 西北林学院学报, 1996(3):80-83.

[20]
钟异莹, 陈坚, 邵毅明. 基于二阶聚类的城市交通弱势群体细分算法[J]. 计算机应用研究, 2020, 37(S1):132-134.

[21]
胡林, 方胜勇, 黄晶, 等. 基于逻辑回归的二轮车-汽车碰撞事故深度分析[J]. 汽车工程, 2016, 38(11):1288-1293.

[22]
刘晨. 基于NAIS的交通伤严重程度影响因素研究[D]. 北京: 清华大学, 2015.

[23]
何仁, 冯海鹏. 自动紧急制动(AEB)技术的研究与进展[J]. 汽车安全与节能学报, 2019, 10(1):1-15.

文章导航

/