目标跟踪技术本质上讲,就是在连续帧图像或点云数据中,对障碍物(车辆、行人、非机动车等)进行检测、特征关联与状态估计,实现对目标身份、位置、速度等信息的持续追踪,为决策规划提供稳定的动态环境输入。

1 目标跟踪的实现方法

1.1 基于滤波的目标跟踪算法

基于滤波的目标跟踪算法是传统目标跟踪的主流方向,通过构建滤波模型学习目标外观特征,并利用滤波响应在后续帧中定位目标,本质是 “特征学习 - 滤波匹配” 的闭环过程。

首先进行特征提取:依赖手工设计特征,通过人工定义的规则提取目标外观信息,不具备自主学习能力。然后使用滤波模型构建:将目标跟踪转化为信号滤波问题,通过在线学习构建目标的滤波模板,使模板与目标区域的相关性最大、与背景区域相关性最小。最后进行目标定位:将滤波模板与下一帧图像进行相关性计算,响应值最大的位置即为目标预测位置。

当下主流算法包括:

  • Adaptive Correlation Filters(ACF):通过自适应滤波器动态学习目标外观,直接利用滤波器在后续帧中完成检测与跟踪,奠定了相关滤波跟踪的基础。

  • Kernelized Correlation Filters(KCF):引入核函数将线性相关滤波扩展到非线性空间,同时结合循环矩阵特性降低计算复杂度,大幅提升了跟踪速度与准确性。

  • Scale Adaptive Correlation Filters:在 KCF 基础上增加尺度估计分支,解决了传统相关滤波算法无法适应目标尺度变化的问题,鲁棒性进一步提升。

1.2 基于深度学习的目标跟踪

基于深度学习的目标跟踪是当前主流技术方向,核心是利用深度神经网络自主学习目标的高层语义特征,具备更强的环境适应能力与目标区分能力,可分为 “检测 - 跟踪分离” 与 “端到端跟踪” 两大范式。

首先进行特征提取,通过 CNN、Transformer 等深度网络,从大量标注数据中自主学习目标的深层语义特征,特征表达能力远优于手工特征。然后是跟踪范式的选择,一般分为两种核心思路,分别适配不同场景需求。

  • Tracking-by-Detection(检测 - 跟踪分离):先通过目标检测网络(如 YOLO、Faster R-CNN)获取单帧目标位置,再通过关联算法(结合外观特征与运动特征)匹配连续帧目标,最后用滤波算法平滑运动状态。

  • End-to-End Tracking(端到端跟踪):直接以连续帧图像为输入,通过网络直接输出目标轨迹,无需单独检测步骤,本质是学习目标与搜索区域的相似性度量。

2 单目标跟踪介绍

单目标跟踪(Single Object Tracking, SOT)是计算机视觉领域的核心基础任务,也是自动驾驶、智能监控等诸多实际应用的关键技术支撑。

其核心任务非常明确:在给定视频序列的第一帧中,当用户指定了某个目标的初始位置(通常以边界框或掩码形式标注)后,算法需要自动在后续的每一帧图像中,持续、精准地定位该目标的位置,最终输出目标在各帧中的边界框、大小甚至姿态信息。

从本质上讲,单目标跟踪解决的是 “在动态变化的场景中,对特定感兴趣目标进行持续身份关联与状态估计” 的问题,它与多目标跟踪(MOT)存在本质区别 —— 单目标跟踪始终聚焦于 “一个指定目标”,无需对场景中的其他目标进行区分或身份识别,核心难点集中在目标自身外观变化与复杂场景干扰下的稳定定位。

2.1 基于CNN的孪生跟踪器

这类跟踪器的特点是使用卷积神经网络提取输入图像的特征,之后使用互相关操作 计算目标与搜索区域中所有位置间的相似度。最后根据相似度分数预测目标在搜索区域 中的位置。本小节将介绍SiamFC、SiamRPN和SiamBAN三个代表性的基于CNN的孪 生跟踪器。

2.1.1 SiamFC 跟踪算法概述

SiamFC 是单目标跟踪任务中极具代表性的基于CNN的跟踪器,也是孪生系列单目 标跟踪器的开创性工作。SiamFC 采用孪生结构构建单目标跟踪器,采用由两个图像构 成的图像对作为跟踪器的输入。图像对中一个图像作为目标跟踪中的模板图像,另一个 图像作为目标跟踪中的搜索区域。

在单目标跟踪中模板图像是跟踪器需要跟踪的目标对 象,通常取跟踪视频序列中的第一帧中以目标为中心的区域。不同于传统的目标跟踪方 法,SiamFC将单目标跟踪问题转化为相似度匹配问题。SiamFC能够以实时的推理速度 运行,网路架构设计简单,同时在多个单目标测试基准上实现了同时期最先进的跟踪性 能。SiamFC的孪生结构设计也深深地影响着后续的单目标跟踪算法的设计。SiamFC的 网络结构图如图所示。

SiamFC 是单目标跟踪领域极具开创性的里程碑式算法,其以简洁架构实现了出色性能,在 GPU 上速度可达 86FPS。该算法通过孪生结构提取模板与搜索区域特征,并采用互相关操作计算两者相似度的核心设计,深刻影响了后续单目标跟踪算法的发展。

2.1.2 SiamRPN 跟踪算法概述

尽管SiamFC在实现中采用多尺度状态估计的方法,却仍然只能预测目标的位置, 而无法准确地预测目标的尺寸变化。受到目标检测算法Faster R-CNN的启发,后续的研 究者在 SiamFC 架构中引入了区域建议网络(Region Proposal Network,RPN),提出 SiamRPN。SiamRPN 可以预测目标的尺寸变化。SiamRPN的网络结构图如图所示。

SiamRPN 在SiamFC 的基础上引入了RPN子网络,使用RPN可以回归目标的位置 和尺寸信息。RPN的引入可以舍弃SiamFC中的多尺度状态估计,避免了多尺度状态估 计产生的计算复杂度,提升了跟踪器的跟踪速度。SiamRPN能够以160FPS的速度处理 视频序列。由于 SiamRPN 出色的设计和性能,在后续衍生出如 DaSiamRPN和 SiamRPN++这些优秀的工作。

2.1.3 SiamBAN 跟踪算法概述

SiamRPN 是基于锚框的跟踪器,采用的RPN子网络需要在网络中添加大量的具有 位置和尺寸先验信息的锚框。设置这些锚框需要考虑与锚框数量、尺寸等信息,难以设 置合适的超参数,网络实验周期长。同时过多的锚框需要大量的计算资源。针对SiamRPN 中存在的问题,SiamBAN采用基于锚点的方法,设计了一种无锚框的跟踪器。SiamBAN 的网络结构如图所示:

SiamBAN 使用基于锚点的设计避免了手动设计大量锚框所带来的复杂调参问题。 采用带有空洞卷积的 Resnet 增强了特征提取能力,同时多层特征互相关的操作使得对 目标的预测更加准确。

2.2 基于CNN-Transformer 的混合架构跟踪器

Transformer 最初应用于 NLP 领域的机器翻译,2020 年 ViT 将其引入计算机视觉领域的图像分类任务并获出色性能。与仅能提取局部信息的卷积不同,Transformer 可计算像素全局相似度以提取全局信息,具备建立远程依赖的特性,建模能力更优。此后,Transformer 迅速扩展至计算机视觉各领域,成为主流方案,本小节将介绍结合 Transformer 的代表性跟踪器 TransT、STARK 和 GdaTFT。

2.2.1 TransT 跟踪算法概述

以往主流的单目标跟踪器是基于卷积的孪生网络。这类网络大多采用互相关操作计 算模板图像和搜索区域间的相似性,这种相似性计算是一种简单的融合方式。互相关操 作本身是一个局部的线性匹配过程,这会导致图像语义信息的丢失。为此,TransT提出 使用Transformer 来实现模板图像特征和搜索区域特征间的结合。TransT 的网络结构如图所示。

TransT 是基于CNN-Transformer 的混合架构的跟踪器。与卷积跟踪器相同,TransT 结构包含三个部分:用于特征提取的孪生子网、由 Transformer 构成的特征融合子网、 用于结果估计的预测头。TransT 使用深层卷积神经网络ResNet 作为孪生子网用来提取 输入图像的特征信息。如图所示,两种特征信息展平为一维的特征向量后被馈送到 由 Transformer 构成的特征融合子网络中。

在特征融合子网中,两类特征信息被增强和 融合交互。特征融合子网由自我上下文增强模块(Ego-Context Augment,ECA)和交互 特征增强模块(Cross-Feature Augment,CFA)构成。

ECA 模块和CFA 模块在形式上类似于Transformer 中 Encoder 和 Decoder。特征信息在 ECA 模块中得到 进一步的增强。两种特征信息在CFA模块中完成交互。与卷积互相关相比,模版特征和 搜索区域特征的交互更加充分。最终的融合信息经过预测头中分类分支和回归分支得到 分类置信度和预测边界框。

TransT 借助自注意力机制进一步增强图像的特征信息,利用交互注意力机制替代卷积互相关操作实现模版特征和搜索区域特征间的交互,使得跟踪器可以自适应地关注和 提取丰富的语义信息,提升了跟踪器的跟踪性能。

2.2.2 STARK 跟踪算法概述

STARK 是与 TransT 同时期的单目标跟踪器。STARK 的网络结构如图  所示。 STARK 的 Spatio 版本 STARK-S 模型的构成包含特征提取的孪生子网络、Transformer  Encoder-Decoder 模块和用于结果估计的预测头。此外 STARK 的 Spatio-Temporal 版本 STARK-ST 还包含额外的分支,用于在线更新动态模版图像,如图所示,右上红色 部分。

STARK 将不同来源的特征图像拼接一同进行自注意力操作的处理方式深深影响着 后续的很多跟踪器设计。借助 Transformer 并行计算的特性,将不同特征拼接后可联合 实现特征增强和特征交互。

2.2.3 GdaTFT 跟踪算法概述

随着对Transformer 的深入研究,一些研究者发现尽管Transformer中自注意力机制 的全局建模特性为单目标跟踪任务带来优异的性能提升,但其仍存在两个挑战。首先全 局感受野对局部结构和通道间的关注较少,其次线性的特征融合方式无法避免非目标语 义对象对跟踪的干扰。为此,GdaTFT提出全局扩张注意模块(Global Dilation Attention, GDA)和目标关注子网络(Target Focusing Network,TFN)来解决上述问题。GdaTFT 的网络结构如图所示。

与以往跟踪器中交互注意力机制不同,如图所示,TFN使用模板特征信息作为查询,在模板特征和搜索区域特征之间建立点对点的关联,并将信息从模板传输到搜索 区域,以进一步增强目标的特征。

2.3 基于纯Transformer 的跟踪器

自SiamFC 之后,基于孪生结构的单目标跟踪网络持续刷新着单目标跟踪任务的性 能指标。但是,尽管如此,孪生跟踪器中使用先分别提取特征,之后再进行关系建模的 范式。这种方式缺乏对目标的感知,跟踪器区分目标与背景的能力有限。在最近的研究 中,多数跟踪器舍弃了孪生架构,搭建了一种单流单阶段的基于纯 Transformer 的跟踪 器。

2.3.1 OSTrack 跟踪算法概述

针对上述孪生架构中存在的问题,OSTrack舍弃了卷积神经网络,设计了一种基纯Transformer 的单流单阶段的跟踪框架。OSTrack的网络结构如图所示。

OSTrack 网络结构主要包含两部分:联合特征提取和关系建模的 Transformer 主干 网络和边界框预测头。如图所示,模版图像和搜索区域构成的输入图像对首先经过 paths 划分、线性映射生成 token 向量。两种类别的 token 向量被拼接后馈送入有 Transformer 层堆叠而成的主干网络中。在主干网络中,由于输入token向量包含模板图 像生成的token向量和搜索区域生成的token向量,因此输入token在计算自注意力时, 并行实现特征提取与增强和特征交互(这在OSTrack中称为关系建模)。  此外,为了加速跟踪器的推理效率,OSTrack提出早期候选消除模块。该模块的处理流程如图所示。早期候选消除模块根据TopK策略保留一定比率的搜索区域 生成的token 中注意力分数靠前的K个token,其余 token 被舍弃并且不参与后续的运 算。

2.4 基于动态锚框生成查询的跟踪算法

单目标跟踪作为计算机视觉下游任务备受关注,其成果广泛应用于自动驾驶、安防等领域,近年主流算法已完成从相关滤波、卷积神经网络到混合 Transformer 的演进。

STARK 是早期将 Transformer 引入单目标跟踪的代表性算法,性能领先且为后续研究提供重要参考,其模板与搜索区域特征拼接输入 Transformer 的设计被广泛采纳,但存在两点不足:一是特征提取仅用主干网络 layer3 的深层语义特征,未融合浅层细粒度特征,利用率低;二是 target query 延续 DETR 的随机初始化方式,质量不足。

针对这些问题,改进模型 DAB-STARK 提出多项优化:融合 layer2 浅层细粒度特征与 layer3 深层语义特征,提升细节感知与特征利用率;采用可学习 anchor box 提供位置和尺度先验,生成高质量 target query;将 target query 解耦为 content query 与 positional query,分别负责内容匹配与位置定位,减轻单一 query 负担;训练中通过 Decoder 间 MLP 拟合目标边界框。

DAB-STARK 在 OTB100 等数据集上实现 0.1%-1.4% AUC 提升,GOT10k-Test 中 AO 达 70.7%(+3.5%),且保持实时性。其核心贡献包括:提出特征融合策略提升特征利用率;用可学习 anchor box 优化 target query 质量;解耦 query 的内容与位置信息;在多个数据集上实现性能与速度的平衡。

2.5 基于自适应动态采样token的目标跟踪算法

Transformer 在视觉领域的成功应用推动了视觉目标跟踪发展,纯 Transformer 单流跟踪器已成为单目标跟踪主流方案。尽管现有跟踪器性能优异,但目标形变、遮挡等仍是需应对的挑战,而 Transformer 的远距离依赖特性可捕获全局信息、并行计算特性可联合特征增强与关系建模,显著提升了跟踪性能。

不过,Transformer 跟踪器存在计算成本高的问题,因自注意力计算成本与 token 长度呈二次方增长,限制了对高分辨率帧的处理。早期跟踪器多结合 CNN 与 Transformer,由 CNN 提取特征并降分辨率,Transformer 负责特征增强与关系建模;当前主流纯 Transformer 单流跟踪器则堆叠深层结构,参数量明显上升。

此外,跟踪中模板与搜索区域以目标为中心裁剪(模板为目标 2 倍尺寸,搜索区域为 4-5 倍尺寸),导致两者含大量背景区域,这些区域生成的冗余负面 token 贯穿跟踪器,增加了训练推理负担,同时损害跟踪性能。

此项工作提出自适应动态采样 token 策略(ADS),并构建跟踪器 ADSTrack,实现输入 token 动态化,可自适应舍弃负面 token。该策略针对不同输入图像对,在各 Transformer 层自主保留与目标相关性高的积极 token、舍弃负面 token;因积极 token 主导跟踪结果,仅保留此类 token 仍能精准跟踪目标。考虑到模板图像 token 是区分前景背景的唯一依据,且目标具有多变性,ADS 仅逐步舍弃搜索区域中的负面 token。该策略以每层注意力分数作为保留 token 的依据,不额外增加模型参数。此外,网络中添加的多个辅助 token,可消除图像低背景区域伪影,平滑模板与搜索区域特征图。

3 多目标跟踪介绍

多目标跟踪(Multiple Object Tracking, MOT)是在视频序列中,同时对多个目标进行持续定位,并为每个目标分配唯一且稳定的身份标识(ID),最终输出所有目标的轨迹信息,本质上是解决 “目标定位” 与 “身份关联” 的双重问题。

MOT的目标是对场景中的多个目标同时进行跟踪和识别,这在实际应用中具有广泛的应用价值,例如,在智能视频监控、自动驾驶、机器人导航等领域中,MOT可以帮助系统实时监测和识别场景中的多个目标,提高智能决策和控制的效率和准确性。

3.1 在线多目标跟踪算法

3.1.1 SORT 算法

SORT 算法以 Faster R-CNN 为目标检测模块,采用 VOC 数据集预训练模型,仅关注置信度>0.5 的行人目标,检测质量提升可使跟踪性能提升 18.9%;数据关联环节,先通过卡尔曼滤波器对目标状态建模,结合当前检测位置与上一帧预测位置计算最佳位置以实现 “去噪”,再以检测框与跟踪框的 IOU 作为匈牙利算法 cost 矩阵输入,完成检测结果与轨迹的匹配。该算法具有复杂度低、结构简单、运行速度快的优势,但数据关联模型较简单,易受遮挡影响,为后续优秀跟踪算法奠定了基础,其框架如图 所示。

3.1.2 DeepSORT 算法

SORT 算法借助卡尔曼滤波器对目标运动状态进行预测,通过计算 IOU 值来评 估预测与检测边界框之间的相似程度,进而利用匈牙利算法实现数据关联,从而完 成目标跟踪任务。DeepSort 算法引入深度学习特征提取,利用级联匹配技术解决 目标重叠或遮挡时的ID切换问题。算法结合马氏距离和余弦距离计算代价矩阵,用 于匹配检测结果。

DeepSort 算法流程如图所示。首先,目标检测器逐帧检测视频序列,获取 目标边界框信息。视频首帧时,卡尔曼滤波器为检测到的目标初始化轨迹,初设为 非确认态;随后,每帧中,卡尔曼滤波器更新轨迹状态并预测位置。执行级联匹 配,配对更新轨迹与当前帧检测框,综合考虑外观与运动信息,输出匹配与未匹配 结果。为提高准确性,增加二次匹配;最后,根据匹配结果更新轨迹状态,输出跟 踪轨迹与状态信息。

3.1.3 MOTDT算法

MOTDT算法整体框架和DeepSORT相似。SORT算 法及DeepSORT算法进行轨迹匹配时,从检测和跟踪的输出 中收集候选项作为集合,输入到匹配机制,导致候选集合中 存在冗余候选项。针对该问题,MOTDT算法通过融合对象 分类器和跟踪器置信度制定了统一的轨迹评分机制,将产生 的检测框和预测框的标准置信度作为非最大抑制(NMS)输 入,从而获得无冗余候选项。引入轨迹评分机制,对NMS 的每一个输入进行评分,利用卡尔曼滤波预测弥补漏检。

数据关联上,MOTDT 算法为改善拥挤场景类别遮挡问题,融合外观表示与空间信息,对现有轨道与候选项进行分层关联。

外观表示

与 DeepSORT 算法类似,通过深度学习行人重识别(Re-ID)数据集,提取目标外观特征向量,以特征距离判定相似性,解决目标重现检测问题。Re-ID 可实现目标消失后重现时的轨迹关联,其传统难点为长距离跟踪中高相似度目标易混淆。实验验证,Re-ID 特征在 IDF1、IDs 指标上优于传统手工特征,且可通过学习车辆等其他类别重识别数据集,拓展跟踪框架适用范围。

分层关联机制

优先基于空间与外观信息,将候选集、候选项与现有轨迹匹配;未匹配的候选项与轨迹,再通过 IOU 进行匹配。

实验性能

在 MOTA2016 数据集(采用公开检测器)上,该算法速度达实时要求(20.6 FPS),多数指标优于同期在线跟踪器,尤其 IDF1 指标提升显著。其优势源于采用深度学习 Re-ID 特征强化识别能力,且计算复杂度低。

3.1.4 数据集

在计算机视觉和机器学习领域,数据集是不可或缺的关键部分,这些数据集允许研究人员将他们提出的模型与使用相同数据集的先前模型的有效性进行比较!可用于多目标跟踪的公开数据集的详细信息如表所列。

3.1.5 在线多目标跟踪算法性能对比

在线多目标跟踪算法输入为视频帧,算法运行方式为逐 帧进行,仅利用上一帧与当前帧的信息进行检测、预测、关联,实现跟踪任务。本文主要介绍的在线算法有目前工业界 应用较为广泛的SORT、DeepSORT算法,基于这2种算法 框架改进MOTDT、JDE算法,以及2020年提出的Fair算法。 下表为以上在线多目标跟踪算法使用私人检测器在MOT16 数据集上的实验结果。

3.2 离线多目标跟踪算法

3.2.1 POI 算法

POI 算法是一种离线多目标跟踪算法,融合目标检测与深度学习外观特征。其核心逻辑为:通过检测算法获取行人位置,利用外观特征匹配前后帧行人框实现跟踪。

该算法采用 Faster R-CNN 作为检测算法,结合随机采样动态尺度的多尺度训练策略,及 skip pooling 与 multi-region 策略融合多尺度特征,可降低 FN+FP 值。模型训练同时使用 softmax loss 与 triplet loss,以区分目标表观特征,通过余弦距离判断相似度。其离线跟踪器基于 H2T 算法改进,在 MOT16 数据集上表现良好,MOTA 值达 66.1。

3.2.2 IOU 算法

IOU 算法是一种离线多目标跟踪算法,核心思路为:在高检测精度与高视频帧率(25 FPS)场景下,结合简单检测算法与 IOU,通过阈值判断前景背景完成跟踪。

该算法优缺点显著。优点是框架简单、速度快,在简单环境下效果明显,在 MOT16 数据集上速度约 3000 FPS,对检测与分割结合有启发意义。缺点是未引入帧间信息、运动及外观模型,漏检错检难解决,易因遮挡、目标形变导致 ID 频繁切换,且高度依赖检测算法性能。

3.2.3 LMP 算法

LMP 算法虽提出时间较久,但在 MOT16 数据集上表现出色,主要针对遮挡问题与行人重识别设计。

其核心创新在于:结合深度网络整体表示特征与姿态估计模型的身体姿态特征提升准确率;数据关联层面基于最小代价多分割问题(MP)改进,将匹配转化为图分解聚类问题,通过目标函数最大化目标概率,降低 IDs。该算法在 MOT16 数据集私人检测器上性能领先,MOTA 达 71.0。

3.2.4 离线多目标跟踪算法性能对比

不同于在线多目标跟踪算法的逐帧关联策略,离线多目 标跟踪算法输入通常为整段视频,在全局搜索最佳匹配,所 以相较于在线方式,离线多目标跟踪在跟踪准确度方面具有 优势。通常,在MOT数据集的性能排名中,名列前茅的多 为离线方法。下表为本文所阐述离线算法在MOT16数据集 上的实验结果,检测器均为私人检测器。

4 总结

单目标跟踪(SOT)聚焦单个目标,在初始帧标注后持续输出其后续帧位置;

多目标跟踪(MOT)需同时跟踪多个目标并分配唯一 ID,输出轨迹信息。

SOT 技术从传统方法演进至深度学习(如 SiamFC)、Transformer(如 STARK),解决外观变化、遮挡等挑战;MOT 从分离式(如 SORT)发展到端到端(如 MOTDT),核心是检测 - 关联 - 轨迹管理,应对 ID 切换、密集遮挡等问题。SOT 适用于自动驾驶单目标监测、医疗影像跟踪;

MOT 服务于智能监控、交通管理等多目标场景。

二者均为计算机视觉基础任务,技术迭代持续提升复杂场景下的跟踪性能与实用性。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐