理论与方法

基于多维特征融合的服务区小客车载客系数检测方法

  • 李洪囤 , 1 ,
  • 邬岚 , 2, * ,
  • 陈超越 2 ,
  • 王彦 2 ,
  • 杨明 3
展开
  • 1 交通运输部科学研究院,北京 100029
  • 2 南京林业大学 汽车与交通工程学院,江苏 南京 210037
  • 3 南京市城市与交通规划设计研究院股份有限公司,江苏 南京 210008
*邬岚(1977—),女,湖北武汉人,博士,副教授,研究方向为交通运输规划管理、交通仿真、交通大数据。E-mail:

李洪囤(1973—),男,河北饶阳人,硕士,副研究员,研究方向为交通运输大数据、交通信息化。E-mail:

收稿日期: 2025-07-31

  网络出版日期: 2026-06-11

基金资助

综合交通运输大数据应用技术交通运输行业重点实验室开放课题(2024B1203)

江苏省大学生创新训练计划(202410298199Y)

A Method for Detecting Passenger Coefficient of Passenger Cars in Service Areas Based on Multi-Dimensional Feature Fusion

  • LI Hongtun , 1 ,
  • WU Lan , 2, * ,
  • CHEN Chaoyue 2 ,
  • WANG Yan 2 ,
  • YANG Ming 3
Expand
  • 1 China Academy of Transportation Sciences, Beijing 100029, China
  • 2 School of Automotive and Traffic Engineering, Nanjing Forestry University, Nanjing 210037, China
  • 3 Nanjing Institute of City & Transport Planning Co., Ltd., Nanjing 210008, China

Received date: 2025-07-31

  Online published: 2026-06-11

摘要

针对高速公路服务区人车交互频繁、跨类别跟踪一致性不足,导致小客车载客系数检测困难,检测精度低、鲁棒性较差等问题,提出一种基于多维特征融合的小客车载客系数检测方法,以提高服务区运行数据的准确性。首先,采用YOLOv10x和ByteTrack作为检测跟踪模块,构建融合多维特征的检测系统。其次,采用卡尔曼滤波法预测目标运动轨迹,建立目标运动先验,引入分类别特征提取方法分别提取车辆与行人的外观语义特征;设计基于检测置信度的自适应加权关联策略,进行多维特征融合,并利用匈牙利算法实现目标重识别与匹配。最后,基于服务区监控视频进行载客系数检测,通过跟踪精度、跟踪精确度、ID跳变次数以及帧率等指标对算法进行对比分析。实验结果表明:基于多维特征融合的检测方法能够对载客系数进行精确统计,与传统ByteTrack仅采用IOU匹配实现目标跟踪相比跟踪精度和跟踪精确度分别提升了0.99%和16.09%,ID跳变次数减少了151个,降幅为18.33%;该方法在保证推理速度的同时,显著提升了复杂交通场景下的精度与鲁棒性,能够弥补服务区中载客系数统计的缺失,为提高服务区的运营管理与服务效能提供了理论基础,同时为推算高速公路上的实载率提供参考。

本文引用格式

李洪囤 , 邬岚 , 陈超越 , 王彦 , 杨明 . 基于多维特征融合的服务区小客车载客系数检测方法[J]. 交通运输研究, 2026 , 12(2) : 83 -95 . DOI: 10.16503/j.cnki.2095-9931.2026.02.007

Abstract

In view of the frequent interaction between pedestrians and vehicles, and the lack of consistency in cross category tracking in expressway service areas, which leads to difficulties in passenger coefficient detection, low detection accuracy and poor robustness, a passenger coefficient of passenger cars detection method based on multi-dimensional feature fusion is proposed to improve the accuracy of service area operation data. Firstly, YOLOv10x and ByteTrack are used as detection and tracking modules to build a detection system incorporating multi-dimensional features. Secondly, the Kalman filter method is used to predict the target trajectory and establish the target motion prior, and the classification feature extraction method is introduced to extract the appearance semantic features of vehicles and pedestrians respectively; An adaptive weighted association strategy based on detection confidence is designed, and multi-dimensional feature fusion is carried out. The Hungarian Algorithm is utilized to realize target re-identification(ReID) and matching. Finally, the passenger coefficient is detected based on the monitoring video in the service area, and the algorithm is compared and analyzed by indicators such as tracking accuracy, tracking precision, ID switches, and frame rate. The experimental results show that: the detection method based on multi-dimensional feature fusion can accurately count the passenger coefficient. Compared with the traditional ByteTrack algorithm that relies solely on IOU matching for object tracking,its tracking accuracy and tracking precision are improved by 0.99% and 16.09%, respectively, and the number of ID switches is reduced by 151, representing a 18.33% reduction. This method can significantly improve accuracy and robustness in complex traffic scenes while ensuring inference speed, and can make up for the lack of passenger coefficient statistics in the service area, which can provide a theoretical basis for improving the operation management and service efficiency of the service area, and provide a reference for calculating the actual loading rate on the expressway.

0 引言

高速公路服务区车流、客流规模持续扩大,对高速公路运营能力带来新的挑战,而车辆实载率偏低易造成道路时空资源低效消耗,制约服务区资源配置与运营效率[1]。载客系数(Passenger Coefficient)是计算统计实载率以及核算路网客运效率的核心指标,也是服务区客流评估、运力优化与服务提升的重要依据。传统服务区客运数据统计以交通流量为主,缺乏对载客系数的系统化检测手段,难以将交通流量转化为有效客运量信息,无法精准刻画服务区客流时空分布与运输效率。因此,依托计算机视觉技术实现载客系数高精度检测,完善服务区客运统计体系,已成为智能交通领域的重要研究方向。
高速公路服务区具有车流密集、人车交互频繁以及环境干扰复杂等特点。可见光视频具有贴近人类视觉感知、成像直观、运维成本低等特点[2],因而被广泛应用于高速公路服务区监控体系中。基于可见光视频开展载客系数检测可充分利用现有资源,具有较好的工程应用价值。车辆与行人的检测与跟踪是载客系数检测的关键。在目标检测方面,孔烜等[3]将车辆检测方法分为运动目标、目标实例以及细粒度检测,系统阐述了对应类型下的检测方法。周飞等[4]和胡伟超等[5]分别在YOLOv8模型中融入小目标检测头与WFM-IOU模块,有效提升了目标定位与检测的准确性。周华平等[6]通过特征增强和特征融合模块构建特征金字塔网络以应对遮挡环境下的行人检测问题。在目标跟踪方面,陈凌子等[7]提出了一种基于FMCW毫米波雷达的车辆跟踪方法,通过轨迹管理机制改善原始轨迹平滑度,实现了多车辆目标的准确跟踪。蒲玲玲等[8]提出了一种基于Tracking-by-Detection的改进YOLOv5模型,添加ReID模块和IOU阈值,有效提升了算法的跟踪精度。贺愉婷等[9]提出了一种融入重识别模型的算法对行人进行跟踪,显著提升了多目标跟踪的准确率。王振学等[10]和陈禹等[11]分别根据全局上下文信息和行人姿态估计,提出针对车辆与行人的重识别方法,提升了遮挡环境下目标跟踪的准确性。
综上,现有研究多聚焦车辆或行人的单一类别研究,缺乏面向服务区场景的人车协同建模与载客系数检测方法。此外,在光照多变、遮挡频繁的服务区场景中,现有多目标识别方法在跨类跨帧一致性跟踪方面仍存在不足,缺乏对多特征融合的目标匹配机制研究,导致多目标跨类跟踪的匹配稳定性不足,难以满足载客系数的精细化统计需求。针对上述问题,本文以高速公路服务区小客车载客系数为研究对象,提出一种基于多维特征融合的小客车载客系数检测方法,采用YOLOv10x为检测基线,以ByteTrack为跟踪模块,引入FastReID获取外观语义特征,并利用卡尔曼滤波法建立目标运动先验,构建融合时空特征与外观语义的多维特征描述系统。在跨帧目标匹配阶段,设计基于检测置信度的自适应加权关联策略,根据检测置信度动态调节交并比(Intersection over Union, IOU)距离与外观语义特征距离权重,以实现多维特征的自适应融合与鲁棒关联,提升载客系数检测性能,为高速公路服务区精细化管理提供精确的客运数据,进而提高运营管理与服务效能。

1 问题描述与检测系统构建

1.1 问题描述

载客系数指车辆实际承载人数与额定载客人数的比值,是反映车辆载客情况、转换统计实载率的关键指标。本文载客系数的统计对象为《收费公路车辆通行费车型分类》(JT/T 489—2019)中的1类客车,即车长小于6 000 mm且核定载人数不大于9人的载客汽车,是服务区入区客流的主要承载车型。当前载客系数的传统观测手段主要依靠人工统计或传统传感器,存在成本高、效率低且适用范围受限等局限,难以满足服务区精细化运营的统计需求。针对这一问题,本文以高速公路服务区为研究场景、以监控视频为数据来源,依托该场景下车辆与行人多处于静止或低速状态的特征,实现目标的稳定检测与跟踪,进而实现载客系数的精准统计。该指标不仅能够弥补高速公路客运实载率统计的数据缺口,而且能够直观反映服务区运行负荷,对于评估服务区服务水平、优化资源配置及提升运营效能具有重要意义。

1.2 检测系统构建

本文针对高速公路服务区场景,提出一种基于多维特征融合的载客系数检测方法,其检测系统(见图1)主要由视觉感知与检测模块、多维特征描述模块以及目标匹配与跟踪模块构成。
图1 多维特征融合检测系统
图1所示,视觉感知与检测模块以YOLOv10x作为检测基线,对输入的监控视频进行逐帧检测,输出包含车辆与行人的类别、位置等信息的检测框(Box)以及检测置信度(Score),实现车辆与行人的一致性检测,为特征提取融合与目标匹配跟踪提供空间定位与置信度依据。
多维特征描述模块通过FastReID和卡尔曼滤波法提取外观语义与时空序列特征。FastReID以ResNet50作为特征提取模型,采用在VehicleID数据集和Market1501数据集中训练所得的FastReID分别提取车辆与行人的语义特征,并通过卡尔曼滤波法提取时空运动轨迹特征,建立目标运动先验。
目标匹配与跟踪模块以ByteTrack为核心,采用目标检测框与轨迹多次关联的模式,通过检测置信度动态调整时空特征与外观语义特征权重,并利用匈牙利算法实现目标的匹配与跟踪,从而减少目标ID跳变次数,提升载客系数检测准确性。
1)视觉感知与检测模块
在目标检测领域,凭借高效的实时检测能力,YOLO系列算法的多个迭代版本在交通领域的应用越来越广泛[12]。其中,YOLOv10通过引入一致双重分配方法和效率-准确率策略,在目标检测精度和速度方面都有不错的表现[13]。由于任务场景的特殊性,服务区监控视频中存在车辆与行人密集、目标遮挡频繁等复杂情况,且不同车辆与行人的尺度差异显著,对检测算法的精度要求更高。为更好地适应服务区场景下的载客系数检测任务,本文在公开数据集BDD100K的基础上,采用精确率、召回率[14]、平均精度均值和交并比4种检测算法性能评价指标,对YOLOv10系列的常见算法进行性能评估,旨在选取检测性能最佳的算法作为载客系数的检测模块,以保障载客系数的检测精度。各评价指标计算公式如下:
P r = N T P N T P + N F P
式(1)中: P r为精确率; N T P为模型预测正例与实际正例匹配的数量; N F P为模型预测正例与实际正例不匹配的数量。
R e = N T P N T P + N F N
式(2)中: R e为召回率; N F N为模型将实际正例预测为反例的数量。
T = 1 n i = 1 n 0 1 P r ( R e ) d R e
式(3)中: T为平均精度均值; n为类别数量。
I o =
式(4)中: I o即IOU,为交并比。
YOLOv10系列常用检测算法在BDD100K数据集上的性能比较如表1所示。由该表可知,YOLOv10x算法在召回率和交并比指标上表现最优,其余指标与最优值差距较小,且对各评价指标赋予相同权重后,YOLOv10x的综合得分最高,说明其整体检测性能最佳。因此,本文采用YOLOv10x作为视觉感知与检测模块,以提高服务区复杂场景下车辆与行人检测准确性,为后续特征提取融合以及目标匹配跟踪提供可靠的空间特征基础。
表1 YOLOv10系列常用检测算法性能比较
YOLO BDD100K数据集
P r(%) R e(%) T (%) I o(%) 加权得分
v10n 97.94 59.07 94.14 35.95 0.670 7
v10s 96.61 67.77 94.07 44.07 0.756 3
v10m 96.65 72.23 94.62 48.40 0.779 8
v10x 95.33 75.58 94.30 52.87 0.795 2
2)多维特征描述模块
在多目标跟踪过程中,单一特征往往难以满足复杂场景的匹配需求。若仅依赖时空运动轨迹特征,则存在轨迹交叉与静态目标无区分度等问题;而仅依赖外观语义特征,存在相似目标误匹配、遮挡后特征突变等问题。这些问题均会导致目标ID跳变,从而影响载客系数检测精度。因此,本文构建多维特征描述模块,通过提取车辆与行人对应的时空运动轨迹与外观语义双维度特征描述目标态势。针对跨类跟踪匹配稳定性不足的问题,引入FastReID模型,采用在VehicleID数据集和Market1501数据集中训练所得的FastReID集成的ResNet50分别提取车辆与行人外观语义特征,从而解决单一特征提取模型同时提取车辆与行人外观语义特征所导致的跨类跟踪性能较差的问题。ResNet50网络结构如图2所示。
图2 ResNet50网络结构
图2所示,FastReID以ResNet50为特征提取网络,通过多层卷积与残差结构后,通过全局平均池化与全连接层对特征进行压缩整合,生成能够有效表征目标外观语义信息的特征向量,为跨帧匹配提供可靠依据。在时空特征提取方面,采用卡尔曼滤波法提取车辆与行人的时空运动轨迹特征,通过预测目标轨迹,能够平滑和补全目标轨迹,同时在服务区低速、短距离运动状况下,其线性匀速运动假设能够更好地预测目标轨迹,减小轨迹预测误差。
3)目标匹配与跟踪模块
在多目标跟踪算法中,DeepSORT和Byte-Track是目前应用较为广泛的两种方法。DeepSORT[15]通常会过滤置信度较低的检测框,而ByteTrack[16]则是将高置信度检测框与低置信度检测框共同纳入跟踪链路,后者能够有效缓解目标遮挡或密集场景下的目标遗漏和轨迹碎片化问题,提升目标跟踪的完整性和鲁棒性。因此,本文采用ByteTrack作为目标跟踪模块,并利用匈牙利算法实现目标匹配。匈牙利算法能够有效解决多对多匹配的全局最优问题,适配多维特征融合的代价矩阵匹配逻辑。

2 特征提取与匹配

2.1 特征提取

2.1.1 时空运动轨迹特征

本文采用卡尔曼滤波法提取目标运动轨迹特征,建立目标运动先验。首先,根据时间序列,设定一定的缓冲时间,为每个目标分配独立的轨迹存储空间,以维护每个目标的历史轨迹信息。在此基础上,利用卡尔曼滤波法预测目标下一帧和未来30帧内的运动轨迹和边界框。若目标无遮挡且能够被持续检测,则将下一帧的预测框与下一帧实际观测检测框的IOU值进行跨帧匹配;若目标因短期遮挡导致无有效观测检测框,则用未来30帧内对应帧的预测框替代缺失的观测检测框用于IOU匹配,从而为目标匹配提供时空约束。
卡尔曼滤波法单帧预测过程主要分为如下两个步骤[17]
步骤1(预测阶段):基于历史状态预测目标下一个状态。
预测目标状态如式(5)所示:
x ^ k = F x ^ k - 1 + B u k - 1
式(5)中: x ^ k为第 k帧目标状态; F为状态转移矩阵; x ^ k - 1为第 k - 1帧的目标状态; B为控制输入矩阵; u k - 1为系统噪声。
预测轨迹特征的误差协方差矩阵如下:
P k = F P k - 1 F T + Q
式(6)中: P k为第 k帧预测轨迹特征的误差协方差矩阵; P k - 1为第 k - 1帧的误差协方差矩阵; F T F的转置形式; Q为过程噪声协方差矩阵。
步骤2(更新阶段):根据检测框的实际观测值和预测状态,更新目标状态。
计算卡尔曼增益,见式(7):
K k = P k H T ( H P k H T + R ) - 1
式(7)中: K k为卡尔曼滤波增益; H为观测矩阵; H T H的转置形式; R为观测噪声协方差矩阵。
更新轨迹特征的状态估计如式(8)所示:
x ¯ k = x ^ k + K k ( z k - H x ^ k )
式(8)中: x ¯ k为第 k帧更新的目标状态; z k为第 k帧实际观测值。
更新轨迹特征的误差协方差见式(9):
P ¯ k = ( I - K k H ) P k
式(9)中: P ¯ k为第 k帧更新的误差协方差矩阵; I为单位矩阵。
未来30帧内的运动轨迹和边界框预测仅采用式(5)和式(6)进行。以第 k帧更新后的状态为起点,连续迭代执行30次预测递推,生成第 k + 1 k + 30帧的预测轨迹特征并存储,为遮挡环境下缺失观测检测框提供持续的匹配条件。

2.1.2 外观语义特征

目标外观语义特征是实现跨帧匹配的核心视觉依据,能够将目标视觉信息映射到高维特征空间,形成具有区分性的特征向量。针对服务区场景下车辆与行人存在不同类别的特征差异,本文采用分类别的外观语义特征提取模块,以Fast-ReID集成的ResNet50为核心,提取车辆与行人对应的外观语义特征,步骤如图3所示。
图3 外观语义特征提取步骤
步骤1:输入目标图像。原始视频帧图像为BGR格式,尺寸为H×W×3,通过YOLOv10x检测帧内目标,输出目标框坐标和类别标签等信息,通过ROI裁剪从原始图像中截取出仅包含目标的区域。
步骤2:图像预处理。将裁剪后的目标图像转换为ResNet50模型要求的RGB格式,通过尺寸归一化将图像的空间尺寸缩放为256×128,然后进行张量归一化和批次维度扩展,输出张量维度为1×3×256×128,满足ResNet50模型的输入维度要求。
步骤3:分类特征提取。将预处理后的图像输入不同训练集训练所得的ResNet50模型中。模型的输入尺寸均为3×256×128,输出尺寸均为2048×8×4。在行人特征提取时,残差块内先通过批量归一化(BN)模块完成特征归一化,再进行残差计算;而在提取车辆特征时,残差块浅层1×1卷积后通过实例归一化(IN)和BN组合完成特征归一化再进行残差计算,顶层仍使用BN,在不增加计算量的前提下,提升模型的准确性和泛化能力。经过4阶段的卷积与残差计算后,将结果输入到全局平均池化、全连接层中,实现车辆与行人的外观语义特征向量的提取。
步骤4:特征处理与存储。将特征向量转化为Numpy数组,便于后续特征匹配时的特征距离计算,同时存储提取出的车辆与行人特征,为目标匹配提供语义约束。

2.2 特征匹配

图4所示,目标匹配与跟踪主要由Byte-Track和匈牙利算法实现。通过特征匹配,将当前帧的目标特征与历史帧的目标特征进行比较,若特征匹配度较高,则目标沿用历史ID,实现目标的重识别匹配,从而减少ID跳变情况,提升对目标的跟踪性能。
图4 基于融合特征的目标匹配与跟踪
图4中红色框所示,相较于传统的ByteTrack仅采用IOU值进行目标匹配,本文提出的基于多维特征融合的目标匹配与跟踪方法,在ByteTrack两次关联中的特征匹配阶段,融入由FastReID提取出的外观语义特征,再通过匈牙利算法进行目标匹配。

2.2.1 特征距离

特征匹配结果由特征距离决定,IOU距离与外观语义特征距离计算方法如下。
1)IOU距离。由卡尔曼滤波法提取的时空运动轨迹特征和式(4)能够计算出预测框与真实框的IOU,其取值范围为[0,1],数值越大表示空间匹配度越高。以1-IOU表示IOU距离 D I,当 D I为0时,两框完全重叠,IOU特征匹配最佳。当 D I为1时,两框完全分离,IOU特征匹配最差。
2)外观语义特征距离。首先根据当前帧目标与历史帧目标的特征计算余弦相似度,其取值范围为[-1, 1],以1-余弦相似度表示外观语义特征距离 D F,其取值范围为[0,2]。为便于与IOU距离进行加权融合匹配,将 D F取值范围归一化到[0,1]。当 D F为0时,语义特征匹配最佳;当 D F为1时,语义特征匹配最差。

2.2.2 自适应加权关联

本文提出基于检测置信度的自适应加权关联策略,即根据检测置信度动态调节IOU距离与外观语义特征距离权重。在服务区场景下,IOU匹配相较于外观语义特征更为精准,特别是在目标遮挡或运动模糊的状况下,外观语义特征可靠性较低。因此,当检测置信度≥0.5时,为IOU距离和外观语义特征分别赋予0.8, 0.2的权重,当检测置信度<0.5时,为IOU距离和外观语义特征距离分别赋予0.9, 0.1的权重,从而实现动态权重调整,提升目标匹配跟踪性能。

2.2.3 匹配代价

通过自适应加权关联策略,根据检测置信度对IOU距离和外观语义特征距离赋予不同的权重,融合两类特征可计算单个目标的匹配代价,如式(10)所示:
C = w I D I + w F D F
式(10)中: C为单个目标的匹配代价,量化单个检测与单个轨迹的匹配代价,即当前检测与历史轨迹特征和外观语义特征的融合匹配代价; w I为IOU距离的自适应权重; w F为外观语义特征距离的自适应权重。
在单个目标匹配代价的基础上,构建包含所有检测-轨迹对的匹配代价集合,形成代价矩阵,将其输入匈牙利算法中,以总代价最小为目标,实现全局最优的目标匹配和重识别。

3 实验

3.1 实验环境与数据集

本文基于深度学习框架Pytorch1.13.1搭建载客系数检测算法,实验配置为RTX3050Ti显卡,16 GB显存,英特尔i5-11400H CPU,Python3.9.19。载客系数检测所采用的视频数据来源于交通运输部科学研究院重点实验室,包括江苏、广东、四川等地的21个服务区监控视频。部分视频抽帧实例如图5所示。
图5 服务区监控视频抽帧实例
为验证本文提出的基于多维特征融合的载客系数检测方法的有效性,采用公开数据集KITTI-Tracking作为验证数据集。该数据集包含车辆与行人等8个类别,共7 987张图像,每张图像具有类别标签、边界框标注以及时间序列信息等,能够根据不同帧对应的车辆与行人检测框和轨迹信息,对比不同方法的跟踪性能。实验过程中,根据标注数据提取每帧目标的类别、边界框与ID信息,以便计算评价指标。

3.2 评价指标

为客观评估融入多维特征的载客系数检测方法的跟踪性能,采用多目标跟踪精度 M A、多目标跟踪精确度 M P和ID跳变次数 I s等3种跟踪性能评价指标评估算法性能,同时以每秒帧数(Frames Per Second, FPS)评估检测方法的处理速度。各评价指标计算公式如下:
M A = 1 - F N + F P + I s G T
式(11)中: M A即MOTA(Multiple Object Tracking Accuracy),为多目标跟踪精度; F N为漏检的数量; F P为误检的数量; I s即IDS (ID Switches),为目标ID跳变次数; G T为跟踪序列中真实存在的目标总数。
M P = t ,   i d t ,   i t c t
式(12)中: M P即MOTP (Multiple Object Tracking Precision),为多目标跟踪精确度; d t ,   i为第 t帧第 i个匹配对的距离,即预测轨迹与真实轨迹在该帧的坐标框差异; c t为第 t帧中预测轨迹与真实轨迹成功配对的数量。

3.3 载客系数计算方法

为减小单车检测误差的影响并客观反映服务区的整体运行状态,本文通过计算观测区域内累计检测到的车辆总承载人数与车辆总额定载客量的比值,获得平均载客系数,用以表征服务区内车辆的平均实载效能。由于服务区场景中车辆类型多以1类客车为主,因此在载客系数计算时,仅考虑1类客车的总承载人数与总额定载客量。针对观测区域内的部分行人可能为其他车型的乘客,本文根据服务区各车型驶入流量与各车型额定载客人数[18],将观测区域内的总行人数折算为1类客车的实际承载人数,其计算公式如式(13)所示。
P 1 = P T k 1 = P T Q 1 α 1 i = 1 n Q i α i
式(13)中: P 1为1类客车实际承载人数; P T为观测区域内的行人累计总数; k 1为1类客车承载人数的折算系数; Q i为各车型入区流量; α i为各车型额定载客人数,均采用标准定义下的区间均值进行计算。
考虑到ID分配是由跟踪算法自动匹配生成,数值随机性较大,若按照跟踪算法自动匹配生成的ID数值大小来确定类别数量,会产生较大的误差。因此在载客系数检测过程中,先通过Byte-Track初步匹配目标ID,然后根据IOU与外观语义特征进行跨帧匹配,实现目标重识别,进而恢复历史ID,以减少ID跳变所带来的ID新增。仅当实际新增一个ID时,对应类别才增加一个数量,从而得到对应类别的累计总数。平均载客系数计算公式如式(14)所示。
A f = P 1 V 1
式(14)中: A f为平均载客系数; P 1为车辆总承载人数,即1类客车实际承载人数; V 1为车辆总额定载客量,即1类客车累计总数与其额定载客量的乘积。考虑到1类客车的额定载客人数≤9人,本文以5人/车作为1类客车的额定载客量。

3.4 实验结果与分析

3.4.1 载客系数检测结果

为降低视频质量对载客系数检测的影响,克服因视频质量不足导致的不同检测方法的差异,从而客观评价不同方法的性能,采用在公开数据集CSIQ上基于XGBoost模型训练所得的图像质量评价方法对服务区监控视频进行评价,结果如表2所示。
表2 服务区监控视频质量评价结果
视频名称 质量分数 视频名称 质量分数
江苏14-1 0.420 0 湖北13-1 0.418 5
江苏14-2 0.424 0 湖北13-2 0.415 8
江苏14-3 0.410 9 浙江23-1 0.394 5
江苏14-4 0.405 5 浙江23-2 0.406 7
江苏15-1 0.434 6 甘肃2-1 0.423 3
江苏15-2 0.438 2 甘肃2-2 0.423 1
广东5-1 0.411 6 辽宁16-1 0.411 9
广东5-2 0.385 5 辽宁16-2 0.401 6
广东5-3 0.392 5 上海21 0.388 3
广东5-4 0.394 2 四川22 0.384 6
广东7 0.413 6
CSIQ数据集的主观分数类型为DMOS,分数越大,则表示图像质量越差。四川22视频的质量分数最低,为0.384 6,说明该视频质量最佳,能够减少对不同检测方法的性能影响。因此,本文选取四川22视频作为载客系数检测实验示例,该视频时长为10 min,总帧数为15 000帧。载客系数检测结果如表3所示。
表3 基于不同匹配特征检测方法的载客系数结果
检测方法 车辆总承载人数 车辆总额定载客量 平均载客系数
IOU匹配 1 767 5 695 0.32
本文方法 1 166 1 570 0.75
以YOLOv10和ByteTrack作为检测跟踪基线对四川22视频进行分析,在目标匹配时采用IOU匹配的平均载客系数为0.32,本文提出的IOU+外观语义特征融合匹配的平均载客系数为0.75。结合人工识别结果,观测区域内1类客车数为88辆,总额定载客量为440人,有效行人数为387人,根据式(13)可知,1类客车总承载人数为322人,则平均载客系数为 322 440 0.73。上述结果表明,相较于融合特征匹配,仅采用IOU匹配时的目标ID跳变更为频繁,导致载客系数精确度降低,而融合匹配方法能够有效降低行人数与车辆数的统计误差,提升载客系数检测的准确性。
图6所示为仅采用IOU匹配与采用IOU+外观语义特征融合匹配方法进行载客系数检测的跟踪效果对比图。图6(a)图6(d)分别为两种方法的开始帧,以ID为17的行人进行分析,在经历频繁的人车交互遮挡后,图6(b)所示中间帧阶段仅采用IOU匹配的行人ID跳变次数为2 352,而图6(e)所示采用IOU+外观语义特征匹配的行人ID未发生变化。此外,开始帧中ID为10和20的两辆车辆,在结束帧结果中,图6(c)所示仅采用IOU匹配的两辆车的ID均发生了变化,而图6(f)所示采用IOU+外观语义特征匹配的两辆车仍然能够保持开始帧时的ID。进一步验证了在复杂场景下进行载客系数检测时,融合多维特征实现目标匹配方法的有效性。
图6 不同特征匹配方法跟踪效果对比

3.4.2 消融实验

由载客系数检测结果可知,本文提出的基于多维特征融合的检测方法能够有效减少ID跳变次数,提高模型跟踪性能。为进一步验证特征融合的效果,本文通过KITTI-Tracking数据集对比不同检测方法的性能,实验结果如表4所示。以每一帧累计的 M A M P I s为基准,记录3个指标的数值变化,如图7图8图9所示。
表4 基于不同匹配特征的检测方法的跟踪效果对比
检测方法 KITTI-Tracking数据集
M A M P I s FPS
IOU匹配 85.88% 57.33% 824 4.18
本文方法 86.87% 73.42% 673 3.71
图7 多目标跟踪精度变化对比
图8 多目标跟踪精确度变化对比
图9 ID跳变次数变化对比
分析表4和各指标变化图可得,本文提出的基于IOU+外观语义特征融合匹配的方法,其跟踪性能相较于仅采用IOU匹配的方法具有显著优势。其中,跟踪精度提升了0.99%,表明检测算法的误检、漏检数量及目标ID跳变次数IS有所下降,跟踪准确性有所提高;跟踪精确度提升了16.09%,表明算法捕捉目标运动、预测目标位置的能力增强;目标ID跳变次数减少了151,降幅18.33%,表明目标ID跳变情况有所缓解,算法检测跟踪的鲁棒性提高。另外,由FPS结果能够看出,融入外观语义特征后模型计算速度下降幅度较小,说明在保证推理速度的情况下,有效提升了方法的跟踪精度。

3.4.3 对比实验

采用以YOLOv10n和YOLOv10s为目标检测网络,以ByteTrack为跟踪算法,融合IOU+外观语义特征匹配的检测方法以及采用以YOLOv10x为目标检测网络,以SORT和DeepSORT为跟踪算法的检测方法分别与本文方法在KITTI-Tracking数据集上进行推理精度与速度的对比,结果见表5
表5 不同方法的跟踪性能对比
检测方法 M A FPS
YOLOv10n+ByteTrack(融合特征) 86.04% 5.02
YOLOv10s+ByteTrack(融合特征) 86.38% 4.27
YOLOv10x+SORT 86.31% 4.52
YOLOv10x+DeepSORT 86.80% 4.13
本文方法 86.87% 3.71
在相同跟踪算法ByteTrack的条件下,将检测模块调整为复杂度相较于YOLOv10x更低的YOLOv10n和YOLOv10s两种模型,同时仍采用IOU+外观语义特征融合进行匹配跟踪。结果显示,虽然模型推理速度均有提高,但模型的精度却均低于本文方法,表明检测网络的精度也会影响多目标跟踪性能,在保证推理速度的情况下,检测精度越高,越有利于目标匹配与跟踪的稳定性,进一步验证了本文选取YOLOv10x作为载客系数检测模块的有效性。另外,在相同的检测网络YOLOv10x下,采用IOU匹配的SORT算法和同样引入外观特征的DeepSORT算法的跟踪性能也弱于本文方法。实验结果表明,本文所提出的基于多维特征融合的检测方法相比其他方法在检测载客系数时具有明显的优势,能够更好地完成视频识别任务,满足利用交通监控视频进行载客系数检测的工程应用需求。

4 结束语

为提升高速公路服务区载客系数检测精度,本文提出了基于多维特征融合的载客系数检测方法。该方法采用YOLOv10x检测网络和ByteTrack检测跟踪算法,构建融合多维特征的检测系统。在特征提取阶段,采用卡尔曼滤波法建立目标运动先验,针对车辆与行人分别建立不同的特征提取模型,以提升跨类跟踪的稳定性。在跨帧匹配阶段,设计基于检测置信度的自适应加权关联策略,动态调整IOU距离与外观语义特征距离权重,以实现多维特征的自适应融合,提升目标跟踪性能和载客系数检测精度。实验结果表明,与传统ByteTrack仅采用IOU匹配实现目标跟踪相比,本文提出的方法在跟踪精度和跟踪精确度上分别提升了0.99%和16.09%,目标ID跳变次数减少了18.33%。与目前部分主流的跟踪方法相比,本文方法在保证模型推理速度的前提下有效提升了跟踪精度,能够满足高速公路服务区载客系数的检测需求,为服务区客运数据的精细化管理提供技术参考。
本文仅在目标跟踪模块融入了外观语义特征,未考虑检测模型特征的融合。未来将深入研究图像特征与检测模型的内在关联,进一步提升检测方法的性能。此外,本文提出的检测方法在其他场景下的检测效果还有待检验,后续将拓展研究场景,进一步提升方法的泛化能力。
[1]
王梦菊. 基于视频分析技术的长途客运汽车实载率监测研究[D]. 成都: 西南交通大学, 2013.

[2]
龙学军, 谭志国, 高枫. 多传感器融合路侧感知技术应用现状分析[J]. 中国交通信息化, 2021(10):137-140.

[3]
孔烜, 张杰, 邓露, 等. 基于机器视觉的车辆检测与参数识别研究进展[J]. 中国公路学报, 2021, 34(4):13-30.

[4]
周飞, 郭杜杜, 王洋, 等. 基于改进YOLOv8的交通监控车辆检测算法[J]. 计算机工程与应用, 2024, 60(6):110-120.

[5]
胡伟超, 皮建勇, 胡倩, 等. 面向复杂场景密集行人检测的YOLOv8改进模型[J]. 电子测量技术, 2024, 47(14):159-169.

[6]
周华平, 吴涛, 孙克雷. 面向遮挡行人检测的自适应多尺度特征金字塔网络[J]. 系统仿真学报, 2025, 37(5):1222-1233.

[7]
陈凌子, 王华伟, 刘海青, 等. FMCW毫米波雷达检测车辆目标跟踪方法[J]. 交通运输研究, 2022, 8(4):99-109.

[8]
蒲玲玲, 杨柳. 改进YOLOv5的多车辆目标实时检测及跟踪算法[J]. 科学技术与工程, 2023, 23(28):12159-12167.

[9]
贺愉婷, 车进, 吴金蔓. 基于YOLOv5和重识别的行人多目标跟踪方法[J]. 液晶与显示, 2022, 37(7):880-890.

[10]
王振学, 许喆铭, 雪洋洋, 等. 融合全局与空间多尺度上下文信息的车辆重识别[J]. 中国图象图形学报, 2023, 28(2):471-482.

[11]
陈禹, 刘惠, 梁东升, 等. 基于姿态估计和Transformer模型的遮挡行人重识别[J]. 科学技术与工程, 2024, 24(12):5051-5058.

[12]
LIANG F, ZHOU Y, CHEN X, et al. Review of target detection technology based on deep learning[C]// Proceedings of the 5th International Conference on Control Engineering and Artificial Intelligence. New York: ACM, 2021: 132-135.

[13]
崔家礼, 张林, 郑瀚. 基于MDA-YOLOv10的融合图像车辆行人检测方法[J/OL]. 红外技术, 2025: 1-9.(2025-04-01)[2025-08-10]. https://link.cnki.net/urlid/53.1053.TN.20250331.1749.004.

[14]
范谦, 姚利德, 赵宇, 等. 基于改进YOLOv7-Tiny的交通车辆与行人轻量级目标检测算法[J]. 扬州大学学报(自然科学版), 2024, 27(6):34-42.

[15]
WOJKE N, BEWLEY A, PAULUS D. ICIP).Simple online and realtime tracking with a deep association metric[C]// Beijing: IEEE, 2017: 3645-3649.

[16]
任泽林, 庞澜, 王超, 等. 基于自编码器结构与改进ByteTrack的低光照行人检测及跟踪算法[J]. 应用光学, 2024, 45(3):616-629.

[17]
向重洋. 高速服务区多目标检测与跟踪算法研究与实现[D]. 成都: 西南交通大学, 2019.

[18]
邹欣坤, 李慧. 基于ETC数据的高速公路服务区车辆驶入识别及特征研究[J]. 中国交通信息化, 2024(12):84-89.

Options
文章导航

/