基于RetinaNet的电动自行车骑乘人员安全头盔佩戴行为检测模型

  • 王雅妮 , 1 ,
  • 汤天培 , 1, 2 ,
  • 刘希文 1 ,
  • 王熹薇 1 ,
  • 高华 1
展开
  • 1.南通大学 交通与土木工程学院,江苏 南通 226019
  • 2.南通大学 江苏长江经济带研究院,江苏 南通 226019
汤天培(1987—),男,江苏南通人,博士,副教授,硕士生导师,研究方向为交通安全与行为。E-mail:

第一作者:王雅妮(2000—),女,浙江台州人,研究方向为计算机视觉。E-mail:

收稿日期: 2022-07-29

  网络出版日期: 2023-03-08

基金资助

国家自然科学基金项目(72101128)

江苏省社会科学基金项目(20GLC015)

江苏省高等学校大学生创新创业训练计划(202210304061Z)

Detection Model on Electrical Bike Riders′ Safety Helmet Wearing Based on RetinaNet

  • WANG Ya-ni , 1 ,
  • TANG Tian-pei , 1, 2 ,
  • LIU Xi-wen 1 ,
  • WANG Xi-wei 1 ,
  • GAO Hua 1
Expand
  • 1. School of Transportation and Civil Engineering, Nantong University, Nantong 226019, China
  • 2. Jiangsu Yangtze River Economic Belt Research Institute, Nantong University, Nantong 226019, China

Received date: 2022-07-29

  Online published: 2023-03-08

摘要

为提高对电动自行车骑乘人员安全头盔佩戴行为检测的准确性和实时性,构建了一种基于RetinaNet的电动自行车骑乘人员安全头盔佩戴行为检测模型。首先,采用Keras框架对RetinaNet预训练模型进行微调,设计残差网络(ResNet-50)作为主干网络提取输入图像的特征;然后,利用特征图金字塔(Feature Pyramid Networks, FPN)和聚焦损失函数(Facal Loss)分别进行特征融合和解决正负样本失衡问题;接着,面向小目标对象对候选框选取进行优化,并选用Adam优化器进行参数学习;最后,以江苏省南通市为例,采用典型城市道路不同视角和光线状况下的电动自行车交通流视频图像数据,训练优化检测模型。结果表明,优化后的检测模型可对图像中远(小)、近(大)电动自行车骑乘人员的安全头盔佩戴行为进行同步检测;检测模型的AP值达93.29%,mAP值达88.40%,在不同角度和光线下检测效果稳定;相较于SSD, Fast R-CNN模型,优化后的检测模型对安全头盔佩戴行为检测的综合性能最优。

本文引用格式

王雅妮 , 汤天培 , 刘希文 , 王熹薇 , 高华 . 基于RetinaNet的电动自行车骑乘人员安全头盔佩戴行为检测模型[J]. 交通运输研究, 2023 , 9(1) : 115 -126 . DOI: 10.16503/j.cnki.2095-9931.2023.01.012

Abstract

To improve the accuracy and real-time detection of electrical bike (e-bike) riders′ safety helmet wearing, a detection model based on RetinaNet for e-bike riders′ safety helmet wearing was developed. Firstly, Keras framework was used to fine-tune the pretraining model of RetinaNet, and residual network (Resnet-50) was designed as the backbone to extract the features of input images. Secondly, Feature Pyramid Networks (FPN) and Facal Loss function were used to carry out feature fusion and solve the imbalance of positive and negative samples, respectively. Thirdly, the anchor was optimized for small targets, and Adam optimizer was adopted for parameter learning. Finally, taking Nantong city, Jiangsu Province as an example, the detection model was trained and optimized using the video image data of e-bike flow on typical urban roads under different perspectives and light conditions. The results showed that the optimized detection model could detect remote (small) and near (large) e-bike riders′ safety helmet wearing synchronously; the AP and mAP values of the proposed detection model was 93.29% and 88.40%, respectively; the detection effects were stable under different perspectives and light conditions; compared with SSD and Fast R-CNN models, the optimized detection model had the best comprehensive performance for safety helmet wearing detection.

0 引言

据公安部交通管理局统计,摩托车、电动自行车骑乘人员死亡事故中,约80%为颅脑损伤致死,正确佩戴安全头盔能将交通事故死亡风险降低60%~70%[1]。2020年4月,全国开展的“一盔一带”安全守护行动,将电动自行车安全头盔平均佩戴率从行动前不足20%提升至54%[1]。然而,相较于发达国家,我国目前的佩戴率仍处于较低水平,例如2019年美国的平均头盔佩戴率为70.8%[2]。在我国庞大的电动自行车保有量基数下,单纯依靠交通警察监督电动自行车骑乘人员是否佩戴安全头盔是不切实际的。为有效监督电动自行车骑乘人员的安全头盔佩戴行为,实现安全头盔佩戴行为的智能检测尤为迫切。
现阶段,关于行人、骑行人(普通自行车、电动自行车和摩托车)和汽车等目标的检测模型算法成熟,在实际应用中已经达到很高的精度[3-7]。安全头盔佩戴行为检测方法相关研究主要聚焦于工人安全头盔的佩戴行为检测,探索出了基于神经网络[8]、Faster R-CNN[9-10]、SVM[11]、改进Faster R-CNN[12-13]、改进YOLO v3[14]等的自动检测方法,平均检测精确度达85.5%~90.9%。随着自行车和摩托车骑行安全问题的日益突出,国内外学者也开始进行骑乘人员安全头盔佩戴行为检测方面的研究。如Dahiya[15]和Vishnu[16]等采用Fast R-CNN目标检测算法,分别实现了对自行车和摩托车骑乘人员安全头盔佩戴行为的自动检测,但算法在应对复杂应用场景时检测效率较低。为了提高检测效率和实时性,刘琛等[17]将RFB Net模块融入SSD算法,基于余弦衰减学习率优化网络学习能力,提出了一种适用于国内场景的摩托车骑行人安全头盔佩戴行为自动检测方法。这些安全头盔佩戴行为检测模型均采用基于卷积神经网络的目标检测方法,主要包括两类:两阶段目标检测算法和单阶段目标检测算法[18]。采用两阶段目标检测算法时,网络需先通过预处理方法在预测图片上生成若干目标候选框,再采用常用的卷积神经网络训练参数进行样本分类,训练和检测精确度高,但计算成本也较高,会影响网络训练和检测效率,如R-CNN[19], Fast R-CNN[20], Faster R-CNN[21], Cascade R-CNN[22]等算法。采用单阶段目标检测算法时,直接将目标边框定位问题转化为回归问题,从而实现端到端检测,无需候选框,网络训练和检测效率高,但精确度有所降低,如YOLO[23], SSD[24], RetinaNet[25] 等算法。以上两类算法均采用基于锚框(anchor-based)的算法,能有效提高网络目标召回能力,但同时会产生大量冗余框,引进的超参数如尺度、长宽比和阈值设定都需大量先验知识。由此,Law等[26]提出基于关键点的CornerNet目标检测算法,Zhou等[27]等提出基于中心表示检验框的CenterNet目标检测算法,均大幅提升了信息的收集速度、处理能力及传递速度,为电动自行车骑乘人员安全头盔的智能检测提供了新的技术和理论支撑。
整体上,现有研究能基本实现对骑乘人员安全头盔佩戴行为的自动检测,但仍存在以下不足:无法兼顾骑乘人员安全头盔佩戴行为检测的准确性和实时性;采用的目标检测算法无法有效处理多尺度特征,容易检测到大目标,而忽略小目标,导致检测范围和精确度减小。为提高对电动自行车骑乘人员安全头盔佩戴行为检测的准确性和实时性,进一步增强对小目标对象的检测精度,本文将基于RetinaNet目标检测算法,利用多尺度特征金字塔和聚焦损失函数克服单阶段目标检测算法精确度低的问题,通过候选框选取优化克服小目标对象漏检问题,构建一种电动自行车骑乘人员安全头盔佩戴行为自动检测模型,并通过实验测试检测模型的综合性能及对多种实际交通场景的适应性。

1 基于RetinaNet的电动自行车骑乘人员安全头盔佩戴行为检测模型

1.1 检测模型框架

电动自行车骑乘人员安全头盔佩戴行为检测的实时性要求高,考虑到RetinaNet算法检测效率高,但检测精度略低于两阶段目标检测算法,本研究对RetinaNet算法进行改进,构建安全头盔佩戴行为检测模型框架,如图1所示。RetinaNet由4个模块组成,其中ResNet-50与FPN组成主干网络(Backbone)。首先,输入一张骑乘人员佩戴或未佩戴头盔的图像,经过ResNet-50下采样后与FPN上采样对应层进行特征融合,可得P3 ~ P7的特征金字塔。然后,分别采用分类子网络和框回归子网络对每层特征金字塔进行预测(Head),其中分类子网络输出检测框是否佩戴安全头盔及其置信度,框回归子网络用于修正安全头盔检测框的位置。最后,应用非极大值抑制(Non-Maximum Suppression, NMS)输出骑乘人员是否佩戴头盔的目标检测结果。
图1 基于RetinaNet的安全头盔检测模型框架

1.2 特征提取网络

以残差神经网络(Residual Network, ResNet)作为RetinaNet的主干网络,用于提取安全头盔特征。ResNet-50结构如图2所示,可分为6个阶段。假设输入1张骑乘人员图像,其特征为(3, 224, 224),括号内数字为该层卷积和池化参数。阶段1主要对输入图像进行预处理:首先通过卷积层对图像进行特征提取,然后设置跟随批标准化层(Batch Normalization, BN)[28]归一化数据以预防深层网络梯度消失,再利用非线性激活函数RELU使函数趋于非线性,最后经过最大池化层得到特征为(64, 56, 56)的输出。后4个阶段由残差块组成。残差块在原有传统网络上加入快捷路径,使训练良好的网络输入跳过多层直达深层网络,解决了传统网络在深层出现的退化问题。根据输入与隐层输出的通道数匹配情况,残差块可分为恒等残差块与卷积残差块。在阶段2,首先对输入进行下采样操作,该操作导致主路通道数改变,故采用卷积残差块调节输入通道数,以保证与隐层输出能正常相加;然后,连续经过两个恒等残差块的学习训练来加深网络,所得输出进入下一阶段学习。阶段6通过全局平均池化和全连接操作,输出检测结果,该阶段在与后续FPN融合时会被舍去。
图2 ResNet-50结构示意图

1.3 特征融合方法

特征金字塔(Feature Pyramid Networks, FPN)主要用于解决目标检测中的多尺度问题,在RetinaNet中起到特征融合的作用。RetinaNet中的ResNet-50与FPN结合而成的主干网络结构如图3所示。
图3 RetinaNet主干网络结构
图3中,FPN结构的左侧是由主干网络形成的自底向上的下采样过程,右侧是一个自顶向下的上采样过程,中间是一个横向连接线路。Conv表示卷积操作,s表示步长。将ResNet-50构成的金字塔各阶段输出表示为{C1, C2, C3, C4, C5},再通过横向连接将下采样相同大小的特征图与上采样丰富的语义信息相加。由于底层占用过多内存,故选择从第3层开始预测。将横向连接后预测输出的特征层表示为{P3, P4, P5},利用卷积进行下采样得到P6特征层,经过RELU非线性激活后,通过卷积对特征图进行下采样操作,得到P7特征层。
对于{P3, P4, P5, P6, P7}的每个特征层,均定义不同大小的候选框。每层候选框的基础尺寸、缩放比例和候选框长宽比率设置见表1。由表1可知,特征图上每个像素都会生成9个候选框。由于头盔是小目标物体,故基础尺寸从16×16开始设置。
表1 候选框设置
对应特征层 基础尺寸 缩放比例 长宽比率
P3 16×16 { 1, 2 1 3, 2 2 3} {1∶2, 1∶1, 2∶1}
P4 32×32 { 1, 2 1 3, 2 2 3} {1∶2, 1∶1, 2∶1}
P5 64×64 { 1, 2 1 3, 2 2 3} {1∶2, 1∶1, 2∶1}
P6 128×128 { 1, 2 1 3, 2 2 3} {1∶2, 1∶1, 2∶1}
P7 256×256 { 1, 2 1 3, 2 2 3} {1∶2, 1∶1, 2∶1}

1.4 预测网络结构

当FPN每层中生成无数个候选框后,对每个候选框中的目标类别进行预测。预测网络分为分类子网络和框回归子网络。其中,分类子网络在主干网络的输出基础上执行图像分类任务,框回归子网络用于得到候选框的边框回归。RetinaNet预测网络如图4所示。
图4 RetinaNet预测网络结构

注:H为图像高度(pt);W为图像宽度(pt)。

分类子网络用于输出是否佩戴安全头盔及其置信度。为提取特征,首先对每个安全头盔特征图进行连续4个3×3卷积操作,每次卷积后均叠加1个RELU层,以增强训练后安全头盔检测模型的非线性能力;然后进行KA个卷积核大小为3×3的卷积操作,其中K表示卷积目标的类别数,A表示特征图上每个安全头盔图像上生成的候选框数;最后采用Sigmoid非线性激活得到每个候选框处的分类置信度。相关研究中,通常将c设定为256,A设定为9[25]
Sigmoid函数图像如图5所示,非线性激活函数值输出区间为[0,1]。假设输出为[0.05,0.07,0.6,0.1],设置1个类别(例如佩戴安全头盔)的概率阈值。以概率阈值0.3为例,当概率值大于0.3时,判定类别是佩戴安全头盔,由此判定假设输出中第3个为佩戴安全头盔,其他输出项判定为未佩戴安全头盔。因此,Sigmoid可用作输出层分类选择,表示类别的置信度概率。设x为输入候选框的加权值,则Sigmoid函数表达式为:
S i g ( x ) = 1 1 + e - x
图5 Sigmoid函数图像
框回归子网络与分类子网络构造基本一致,在每个特征图上叠加4个卷积核大小为3×3的卷积层训练预测框,设置卷积核深度为c,并链接RELU激活函数。框回归子网络与分类子网络的结构区别在于其最终输出4A个卷积核,该过程表示给每个候选框设定4个回归调节参数,且输出与类别无关。框回归子网络预测框的最终位置由候选框与真实框的映射关系学习后生成。通过候选框学习一种映射关系,获得预测框,再通过不断学习使得预测框尽可能接近真实框。预测框映射的表达式为:
T x = G x - A x A w T y = G y - A y A h T w = l o g ( G w / A w ) T h = l o g ( G h / A h )
式(2)中: A x, A y, A w A h分别为候选框的最小x坐标、最小y坐标、宽度、高度; G x, G y, G w G h分别为真实框的最小x坐标、最小y坐标、宽度、高度; T x, T y, T w T h分别为候选框与真实框之间在最小x坐标、最小y坐标、宽度、高度等4个方面的相对值。
预测目标是使预测框尽可能接近真实框,即最理想情况为网络预测值与4个相对值相等。RetinaNet是一种单阶段的全卷积神经网络,为加速训练安全头盔的超参数学习速度,使用NMS融合相邻近的框,只保留局部区域内交并比(IOU)得分最高的框。一般设置NMS = 0.5为阈值进行数据筛选[25]

1.5 模型评估方法

通常在模型训练预测阶段后,损失函数在模型每批数据通过前向传播的预测过程中输出预测类型置信度,或在候选框预测框回归后计算出安全头盔预测值和实际值的差值,即损失值。在损失函数输出该轮训练安全头盔检测模型的损失值后,模型通过基于梯度下降的反向传播更新安全头盔检测模型的超参数,以达到降低损失值的目的。当安全头盔检测模型的损失值逐渐减小,达到设定可接受的范围时,表明参数学习过程完成。
由于RetinaNet包含两个预测子网络,即同时存在分类损失和框回归损失,故损失函数RE_Loss为:
R E _ L o s s = 1 N P O S i L c l s i + 1 N P O S j L r e g j
式(3)中: L c l s为分类损失函数,在该模型中采用聚焦损失(Facal Loss)函数;i为样本序号; N P O S为正样本个数; 1 N P O S i L c l s i为分类损失值; L r e g为框回归损失函数,在该模型中采用平滑L1损失(Smooth L1 loss)函数;j为正样本序号; 1 N P O S j L r e g j为框回归损失值。
单阶段目标检测算法的主要缺陷是精度低,这是由于该类算法在获得特征图后,目标检测器会生成高达100kb的目标候选区域,对于本文样本的检测图像而言,佩戴安全头盔仅占图像的一部分,由此产生过多的负样本,且大多为简单易分负样本,不仅对训练无益,还会导致训练样本正负不平衡的问题。计算获得的损失值会被未佩戴头盔的负样本占据主要权重,佩戴头盔正样本提供的关键信息则会因数量过少而不能在训练损失中改变权重,从而无法获得安全头盔检测模型的准确损失值,导致检测精度偏低。RetinaNet在分类损失函数中提出了聚焦损失函数,该函数引入的新因子可解决单阶段目标检测算法精度低的缺陷。聚焦损失函数 F L ( p t )的表达式为:
F L ( p t ) = - α t ( 1 - p t ) γ l o g ( p t )
其中
p t = p e = 1 1 - p e l s e
α t = α e = 1 1 - α e l s e
式(4)中: p为模型对Sigmoid函数预测结果是否正确的概率估计, p [ 0,1 ] p t为概率估计参数; α为权重因子, α [ 0,1 ] α t为用于调节正负样本的参数; e = 1表示Sigmoid函数预测结果是正样本; γ为用于调节难易样本的参数。相关研究表明,当 γ = 2, α t = 0.25时,实验所得平均精确度(Average precision, AP)值最好[25]
RetinaNet使用平滑L1损失函数作为安全头盔候选框回归损失函数。平滑L1损失函数前期利用L1,参数学习速度快,后期使用L2,超参数逐渐收敛到最优值。该损失函数结合了L1和L2的优点,相比L1损失函数,平滑L1损失函数参数学习收敛效率高;相比L2损失函数,其对离群点、异常值不敏感,梯度变化相对更小[29]。框回归损失函数( S m o o t h L 1 ( x ))的表达式如下:
S m o o t h L 1 ( x ) = 0.5 x 2               | x | < 1 | x | - 0.5 e l s e
式(5)中: x y i y i p的差值; y i为真实值; y i p为预测值。

2 模型训练与检验

2.1 数据获取

选取江苏省南通市城区范围内的典型路段和交叉口进行案例分析,共计10条路段和12个交叉口,如图6所示。通过多路段和交叉口的数据采集,测试检测算法在更多实际交通场景中的适应性。共搜集到56段高清视频,每段视频约15~25min,每个视频的采样间隔(区间)时长为10s,整理获得6 820幅图像,每幅图像平均有3.8辆电动自行车。采用DarkLabel标注工具对视频样本进行标注,标注对象包括电动自行车和骑乘人员头部(佩戴头盔、未佩戴头盔),利用OpenCV向网络导入视频帧。标注后总样本量为12 564个,其中正样本(佩戴安全头盔的矩形框)5 408个,负样本(未佩戴安全头盔的矩形框)7 156个。
图6 实验拍摄点分布(路段与交叉口)

2.2 模型训练

电动自行车骑乘人员安全头盔佩戴行为检测是一种典型的目标检测任务,因此采用Keras框架,对RetinaNet预训练模型进行微调。采用内存16G,显卡rtx2060(6G显存),CPU i7-9750H,Windows操作系统作为基础环境,先后安装1.13.2版本的Tensorflow-GPU、2.10.0版本的h5py、2.1.5版本的Keras,配置训练所需环境,最后利用VSCODE编译器进行电动自行车骑乘人员安全头盔佩戴检测模型训练。
训练中,先利用随机函数使数据集随机产生3个不相交的子集,分别为81%的训练集、9%的验证集和10%的测试集。训练中,以ResNet-50与FPN作为基础网络预训练权重参数。主干网络的特征提取功能较强,可加速训练过程收敛。将锚框横纵比值设为[0.5,1,2],缩放值设为[0.1,0.25,21/3],采用Adam优化器[30]自动为不同参数适应不同的学习率,学习率设定为 α = 0.00001。由于计算机显存略低,设置批尺寸 b a t c h _ s i z e = 2。另外,将分类损失函数的参数设置为: γ = 2, α t = 0.25;将迭代次数epoch值设为100,即整个训练数据集被迭代100次。训练损失走向如图7所示,可见验证损失与训练损失走向趋势基本一致,未发生过拟合现象。当验证数据集训练到第85次时,验证损失值达到最低0.402,因此选用第85次的训练权重作为检测时的权值。
图7 训练损失走向
训练完成后,即可利用电动自行车骑乘人员安全头盔佩戴行为检测系统进行检测实验,将置信度阈值设置为0.5,NMS设置为0.3。检测实验流程如图8所示。
图8 检测实验流程图

2.3 模型有效性检验

(1)模型准确性检验
为评估算法的准确性,采用AP和加权平均AP值(Mean Average Precision, mAP)评估电动自行车骑乘人员安全头盔佩戴行为检测模型的检测精确度。AP对精确度和召回率指标进行了集成,其中精确度P(Positive)和召回率R(Recall)的计算公式分别见式(6)和式(7):
P = T P T P + F P
R = T P T P + F N
式(6)~式(7)中:TP(True Positive)表示预测结果是正样本且为真;FN(False Negative)表示预测结果是负样本且为假;TN(True Negative)表示预测结果是负样本且为真;FP(False Positive)表示预测结果是正样本且为假。
通常采用混淆矩阵(见表2)快速计算精确度和召回率[31]
表2 混淆矩阵
真实情况 预测结果
正样本 负样本
正样本 TP FN
负样本 FP TN
获得精确度和召回率后,可以召回率为横坐标、精确度为纵坐标,绘制P-R曲线。AP即P-R曲线的线下面积,计算公式为:
A P = 0 1 P ( R )   d ( R )
式(8)中:AP为平均精确度;P为精确度;R为召回率。
mAP的计算公式为:
m A P = 1 C i = 1 C A P i
式(9)中:C表示类别,当C=1时,mAP=AP;i表示标签的类别数量。
图9所示为置信度设置为0.5时,在Pascal VOC2007标准下评价得到的P-R曲线及其AP值。图9(a)显示检测到佩戴安全头盔的AP值达93.29%,图9(b)显示检测到未佩戴安全头盔的AP值为83.50%。经过训练的RetinaNet实现了88.40%的加权平均AP值,训练出的权重表现良好。可见,基于RetinaNet的电动自行车骑乘人员安全头盔佩戴行为检测模型在算法准确度上表现良好。
图9 P-R曲线与AP值
(2)模型稳定性和实用性检验
为验证模型的稳定性与实用性,采用训练后的模型分别检测摄像头不同角度(90°与45°)、不同光线(明亮与昏暗)下的视频。图10所示为部分视频帧抽样检测结果。图10(a)~(d)对明亮场景下90°与45°的视频进行帧采样,其中图10(a)显示90°检测到佩戴头盔的置信度达0.77,图10(b)显示90°检测到未佩戴安全头盔的置信度达0.92,图10(c)显示45°且骑行带人情况下检测到未佩戴安全头盔的置信度达0.69和0.67,图10(d)显示45°多辆电动自行车场景下检测到未佩戴安全头盔的置信度达0.77和0.51。图10(e)~(h)对昏暗场景下90°与45°的视频进行帧采样,其中图10(e)显示90°检测到未佩戴头盔的置信度达0.71,图10(f)显示90°检测到佩戴头盔的置信度达0.70,图10(g)显示45°检测到佩戴头盔的置信度达0.59,图10(h)显示45°检测到未佩戴头盔的置信度达0.71。可见,在不同角度和不同光线场景下,检测模型均可得到准确的检测结果,模型具有较好的稳定性和实用性。
图10 不同角度和光线场景下的检测效果
(3)模型对比
为进一步验证基于RetinaNet的模型在电动自行车骑乘人员安全头盔佩戴行为检测中的优势,对相同源数据分别基于单阶段目标检测算法(Single Shot MultiBox Detector, SSD)与两阶段目标检测算法Fast R-CNN进行参数权值训练。SSD目标检测算法选用SGD[32]优化器训练参数。利用SSD目标检测算法对目标进行训练,当epoch = 200时,验证损失值达到最低0.405,选用该轮的训练权重参数作为SSD检测时的权值。Fast R-CNN目标检测算法选用与RetinaNet目标检测算法相同的Adam优化器优化参数,训练时先提取候选框,再进行分类与回归,当epoch = 95时,验证损失值达到最低0.691,选用该轮的训练权重参数作为Fast R-CNN检测时的权值。
SSD, Fast R-CNN和RetinaNet目标检测模型对相同视频检测后的部分帧样本检测结果对比情况如图11所示。其中,图11(a)显示对于简单的90°负样本,3个模型检测置信度均达0.9以上,检测效果好;图11(b)显示对于困难的90°负样本,3个模型均检测出未佩戴头盔,但SSD模型的检测置信度相对较低;图11(c)显示对于45°下的困难多目标负样本,SSD模型未检测出结果,Fast R-CNN模型仅检测出一个样本未佩戴头盔且对于另一个样本未给出相应的预测框与判定,而RetinaNet模型对两个样本均做出了正确判定。由此可见,基于RetinaNet的电动自行车骑乘人员安全头盔佩戴行为检测模型,与单阶段目标检测模型SSD相比,在困难信息挖掘上具有更好的优越性;与两阶段目标检测模型Fast R-CNN相比,能对多目标样本进行同时检测。
图11 3种目标检测模型对部分样本的检测结果对比
SSD, Fast R-CNN与RetinaNet目标检测模型在同一数据集上,以Pascal VOC2007为标准的检测精确度和检测速度结果对比如表3所示。在检测精确度上,RetinaNet模型相比SSD模型提高了11.56%,相比Fast R-CNN模型略有提高。在检测速度上,虽然RetinaNet模型和Fast R-CNN模型明显低于SSD模型,但RetinaNet模型在保证精确度的情况下,其检测速度是Fast R-CNN模型的2倍以上。这表明,基于RetinaNet的电动自行车骑乘人员安全头盔佩戴行为检测模型在综合性能上表现最优。
表3 3种目标检测模型的检测精确度和速度对比
检测模型 佩戴头盔AP值
(%)
未佩戴头盔AP值
(%)
mAP值
(%)
检测速度
/(帧·s-1
SSD 82.93 75.56 79.24 25.25
Fast R-CNN 93.56 83.16 88.36 6.18
RetinaNet 93.29 83.50 88.40 13.89

3 结语

针对现阶段国内电动自行车骑乘人员安全头盔佩戴率普遍较低,以及现场执法识别头盔佩戴情况效率低、成本高,无法切实提高安全头盔佩戴水平的问题,本文构建了一种基于RetinaNet的电动自行车骑乘人员安全头盔佩戴行为检测模型。研究结果表明,该检测模型可以解决正负样本失衡问题,能对图像中远(小)、近(大)电动自行车骑乘人员进行同步检测;对应的AP值达93.29%,mAP值达88.40%,在不同角度和光线下检测效果稳定;相较于SSD与Fast R-CNN模型,所建检测模型的综合性能表现最优。实例研究结果表明,该检测模型可用于较复杂场景下电动自行车骑乘人员安全头盔佩戴行为检测。
然而,电动自行车所处的交通场景极其复杂,本文检测模型在特殊气候(如雨雪天等)及有遮挡物等复杂情况下的检测效果尚未得以检验,下一阶段将增加上述场景下的样本以进一步训练、优化检测模型。此外,安全头盔检测平台的计算资源和内存是有限的,未来将继续探索更便捷和高效的网络架构,减少检测平台的资源消耗,实现检测平台的模块化和便捷化。
[1]
公安部交通管理局. 安全头盔佩戴率、安全带使用率大幅提升,“一盔一带”安全守护行动成绩斐然[N/OL]. (2021-02-05)[2022-04-01]. https://baijiahao.baidu.com/s?id=1690837899878629840&wfr=spider&for=pc.

[2]
National Highway Traffic Safety Administration. Motorcycle Helmet Use in 2019-Overall Results[R]. Washington, D.C.: Department of Transportation, 2020.

[3]
DALAL N, TRIGGS B. Histograms of oriented gradients for human detection[C]// IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE, 2005: 886-893.

[4]
赵才荣, 齐鼎, 窦曙光, 等. 智能视频监控关键技术:行人再识别研究综述[J]. 中国科学:信息科学, 2021, 51(12):1979-2015.

[5]
杨永胜, 邓淼磊, 李磊, 等. 基于深度学习的行人重识别综述[J]. 计算机工程与应用, 2022, 58(9):51-66.

[6]
王梦缘. 基于深度学习的行人及非机动车违规检测系统[D]. 大连: 大连理工大学, 2021.

[7]
方建成. 智能交通系统中交通流量控制及小目标检测识别[D]. 成都: 电子科技大学, 2021.

[8]
胡恬, 王新刚. 基于小波变换和神经网络的安全帽识别系统分析与设计[J]. 软件导刊, 2006, 23(12):37-39.

[9]
FANG Q, LI H, LUO X C, et al. Detecting non-hardhat-use by a deep learning method from far-field surveillance videos[J]. Automation in Construction, 2018, 85: 1-9.

[10]
张明媛, 曹志颖, 赵雪峰, 等. 基于深度学习的建筑工人安全帽佩戴识别研究[J]. 安全与环境学报, 2019, 19(2):535-541.

[11]
杨莉琼, 蔡利强, 古松. 基于机器学习方法的安全帽佩戴行为检测[J]. 中国安全生产科学技术, 2019, 15(10):152-157.

[12]
吴冬梅, 王慧, 李佳. 基于改进Faster R-CNN的安全帽检测及身份识别[J]. 信息技术与信息化, 2020(1):17-20.

[13]
李华, 王岩彬, 益朋, 等. 基于深度学习的复杂作业场景下安全帽识别研究[J]. 中国安全生产科学技术, 2021, 17(1):175-181.

[14]
王兵, 李文璟, 唐欢. 改进YOLO v3算法及其在安全帽检测中的应用[J]. 计算机工程与应用, 2020, 56(9):33-40.

[15]
DAHIYA K, SINGH D, MOHAN C K. Automatic detection of bike-riders without helmet using surveillance videos in real-time[C]// 2016 International Joint Conference on Neural Networks (IJCNN). New York: IEEE, 2016: 3046-3051.

[16]
VISHNU C, SINGH D, MOHAN C K, et al. Detection of motorcyclists without helmet in videos using convolutional neural network[C]// 2017 International Joint Conference on Neural Networks (IJCNN). New York: IEEE, 2017: 3036-3041.

[17]
刘琛, 王江涛. 基于RFB-Net的摩托车驾驶人头盔检测研究[J]. 太原科技大学学报, 2021, 42(6):496-500.

[18]
KRIZHEVSKY A, SUTSKEVER I, HINTON G. Imagenet classification with deep convolutional neural networks[J]. Association for Computing Machinery, 2017, 60(6): 84-90.

[19]
GIRSHICK R, DONAHUE J, DARRELL T, et al. Region-based convolutional networks for accurate object detection and segmentation[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2015, 38(1): 142-158.

[20]
GIRSHICK R. Fast r-cnn[C]// Proceedings of The IEEE International Conference on Computer Vision. New York: IEEE, 2015: 1440-1448.

[21]
REN S Q, HE K M, GIRSHICK R, et al. Faster r-cnn: Towards real-time object detection with region proposal networks[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 39(6): 1137-1149.

[22]
CAI Z, VASCONCELOS N. Cascade r-cnn: Delving into high quality object detection[C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE, 2018: 6154-6162.

[23]
REDMON J, DIVVALA S, GIRSHICK R, et al. You only look once: Unified, real-time object detection[C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE, 2016: 779-788.

[24]
LIU W, ANGUELOV D, ERHAN D, et al. SSD: Single shot multibox detector[C]// Proceedings of the 14th European Conference on Computer Vision. Amsterdam: Springer, 2016: 21-37.

[25]
LIN T Y, GOYAL P, GIRSHICK R, et al. Focal loss for dense object detection[C]// 2017 IEEE International Conference on Computer Vision (ICCV). New York: IEEE, 2017: 2999-3007.

[26]
LAW H, DENG J. Cornernet: Detecting objects as paired keypoints[C]// Proceedings of the European Conference on Computer Vision. Berlin:Springer, 2018: 734-750.

[27]
ZHOU X, WANG D, KRÄHENBÜHL P. Centernet: Objects as points[EB/OL]. ( 2019-04-25) [2022-04-26]. https://arxiv.org/abs/1904.07850.

[28]
IOFFE S, SZEGEDY C. Batch normalization: Accelerating deep network training by reducing internal covariate shift[C]// Proceedings of the 32nd International Conference on Machine Learning (ICML). New York: IEEE, 2015: 448-456.

[29]
周倍同. 基于深度学习的锂电池剩余寿命预测研究[D]. 武汉: 华中科技大学, 2020.

[30]
KINGMA D, BA J. Adam: A method for stochastic optimization[C] // 3rd International Conference on Learning Representations(ICLR). San Diego: arXivLabs, 2015: 1-15.

[31]
张盼. 基于混淆矩阵的分类器选择集成方法研究[D]. 焦作: 河南理工大学, 2016.

[32]
THEODORIDIS S. Chapter 5-Stochastic gradient descent: The LMS algorithm and its Family[M]// Machine Learning. New York: Academic Press: 2015: 161-231.

文章导航

/