VisDrone精度狂飙6%!CollabOD协同多骨干架构,让无人机“看清”每一个微小目标
本文核心贡献如下:
-
提出协作框架CollabOD:首个面向无人机小目标检测的轻量级多骨干协同与跨尺度视觉网络,兼顾精度与效率。
-
创新结构细节保留模块:设计DPF-Stem与DABlock,在输入与骨干阶段显式增强边界轮廓等结构信息,缓解深层网络细节衰减。
-
设计双边重加权模块:在融合前对异构特征流进行空间自适应校准,提升跨路径特征一致性与定位稳定性。
-
提出统一细节感知检测头:通过共享细节增强与解耦预测,在不增加推理开销下强化边界回归。
-
性能全面领先:在VisDrone上AP75达30.8,超基线5.5%;在AI-TOD上AP50达45.4,超YOLOv12-M-P2,计算成本最低。

博主简介
AI小怪兽 | 计算机视觉布道者 | 视觉检测领域创新者
深耕计算机视觉与深度学习领域,专注于视觉检测前沿技术的探索与突破。长期致力于YOLO系列算法的结构性创新、性能极限优化与工业级落地实践,旨在打通从学术研究到产业应用的最后一公里。
🚀 核心专长与技术创新
-
YOLO算法结构性创新:于CSDN平台原创发布《YOLOv13魔术师》、《YOLOv12魔术师》等全系列深度专栏。系统性提出并开源了多项原创自研模块,在模型轻量化设计、多维度注意力机制融合、特征金字塔重构等关键方向完成了一系列突破性实践,为行业提供了具备高参考价值的技术路径与完整解决方案。
-
技术生态建设与知识传播:独立运营 “计算机视觉大作战” 公众号(粉丝1.6万),成功构建高质量的技术交流社群。致力于将复杂算法转化为通俗易懂的解读与可复现的工程代码,显著降低了计算机视觉的技术入门门槛。
🏆 行业影响力与商业实践
-
荣获腾讯云年度影响力作者与创作之星奖项,内容质量与专业性获行业权威平台认证。
-
全网累计拥有 7万+ 垂直领域技术受众,专栏文章总阅读量突破百万,在目标检测领域形成了广泛的学术与工业影响力。
-
具备丰富的企业级项目交付经验,曾为工业视觉检测、智慧城市安防等多个关键领域提供定制化的算法模型与解决方案,驱动业务智能化升级。
💡 未来方向与使命
秉持 “让每一行代码都有温度” 的技术理念,未来将持续聚焦于实时检测、语义分割及工业缺陷检测的商业化闭环等核心方向。愿与业界同仁协同创新,共同推动技术边界,以坚实的技术能力赋能实体经济与行业变革。
原创自研系列, 26年计算机视觉顶会创新点
原创自研系列, 25年计算机视觉顶会创新点
应用系列篇:
23、24年最火系列,加入24年改进点内涵100+优化改进篇,涨点小能手,助力科研,好评率极高
0.原理介绍

论文:CollabOD: Collaborative Multi-Backbone with Cross-scale Vision for UAV Small Object Detection
摘要—无人机图像中的小目标检测极具挑战性,主要归因于尺度变化、结构细节退化以及有限的计算资源。在高空场景中,细粒度特征在层级下采样和跨尺度融合过程中进一步被削弱,导致定位不稳定和鲁棒性降低。为解决此问题,我们提出了CollabOD,一个轻量级协同检测框架,该框架在多尺度融合之前显式地保留结构细节并对齐异构特征流。该框架整合了结构细节保留、跨路径特征对齐和定位感知轻量化设计策略。从图像处理、通道结构和轻量化设计的角度,它优化了传统无人机感知模型的架构。所提出的设计在保持高效推理的同时,增强了表示稳定性。一个统一的细节感知检测头在不引入额外部署开销的情况下,进一步提升了回归鲁棒性。
I. 引言
无人机已成为城市交通监控、交通流分析和停车管理等应用中自主感知的关键平台。在这些场景中,目标检测通过准确识别和定位航空图像中的目标,在可靠的交通状态评估中发挥着关键作用。然而,高空运行带来了显著的尺度变化、大量远距离小目标以及有限的机载计算资源,使得轻量级且准确的检测模型备受青睐。
从特征表示的角度来看,通常小于32×32像素的航空小目标包含极其有限的判别信息。它们的特征通过重复下采样迅速退化,导致表示能力弱和信噪比低,尤其是在低对比度、运动模糊和大气扰动等具有挑战性的航空条件下。在这种情况下,细粒度的结构线索,如物体边界和边缘纹理,对于区分前景和背景变得至关重要,从而需要精确定位。尽管特征金字塔网络保留了多尺度表示,但其跨尺度融合通常通过简单的加法或拼接实现,缺乏对结构细节衰减和跨层错位的显式建模。
现有方法通过引入辅助分支、注意力机制或精细化融合策略来增强表示能力。虽然有效,但这些设计通常会产生具有不同感受野分布和语义偏差的异构特征流。传统的融合隐式地假设路径间的空间和语义兼容性,使得难以显式抑制跨路径差异。对于本身结构和语义表示有限的小目标,即使是微小的空间错位也可能在边界框回归过程中被放大,导致定位不稳定和鲁棒性降低。因此,无人机小目标检测受到结构细节衰减和隐式跨路径融合不一致的共同制约。
为解决这些问题,我们在融合之前显式增强结构细节保留并校准异构特征流。我们认为,首先,与定位相关的结构线索应在轻量化约束下显式增强。其次,异构特征流应在融合前进行校准,以提高空间和语义兼容性。
在本文中,我们提出了CollabOD,一个基于YOLO11-M-P2构建的协同小目标检测框架。CollabOD系统性地改进了输入编码、骨干表示、多尺度融合和检测头设计,以实现结构细节增强、跨路径对齐和计算效率。在VisDrone、UAVDT和AI-TOD上的实验表明,CollabOD提高了在具有挑战性的航空场景中的检测鲁棒性。它在VisDrone上取得了最先进的AP75,同时使用最低的GFLOPs,并在UAVDT上获得了最佳的AP50和AP50:95,展示了强大的精度-效率权衡。在AI-TOD上,我们的模型进一步在AP50、AP50:95、GFLOPs和FPS方面建立了最先进的性能,同时实现了最高的检测精度和最有利的计算效率。

本工作的主要贡献总结如下:
-
我们开发了一个轻量级检测框架CollabOD,该框架联合增强了结构细节并对齐了异构特征流,确保在有限的计算预算下实现小目标的稳定定位和高检测精度。
-
我们设计了一个双路径融合主干和一个密集聚合模块,以减轻深度网络中与定位相关的结构信息的逐渐退化,在输入阶段保留边界和轮廓线索,同时补偿层级特征衰减。
-
我们引入了一个双边重加权模块,通过通道级自适应权重生成和可学习缩放来改进跨尺度特征一致性。
-
我们提出了一个统一的细节感知检测头,通过细节感知卷积增强边界回归,并采用重参数化来消除额外的推理开销。
II. 相关工作
本节回顾了无人机小目标检测的最新进展,从部署约束下的定位稳定性角度,重点关注结构表示、跨尺度特征学习和效率感知定位设计。
A. 小目标的结构表示
对于无人机航空图像中的小目标检测,结构表示能力可以从两个维度来表征:小目标结构信息的供给强度,以及结构信息在层级传播过程中的稳定性。相关研究主要沿着两条相应的路径发展:细节供给和结构补偿。
在信息供给层面,早期方法通常通过更高的输入分辨率、基于切片/图块的推理或超分辨率辅助来增加有效像素,但对深度下采样引起的结构信息退化提供的缓解有限。最近的检测框架通过显式引入更高分辨率的特征层或调整金字塔分配策略来保留细粒度结构,从而增强了结构信息的初始表示能力。
在传播稳定性层面,先进技术侧重于边缘敏感增强、局部上下文建模和多路径表示设计,以加强结构线索的跨层传递,将小目标表示从单路径增强转向多源协同表达。当前趋势表明,在统一框架内联合改善结构信息供给和传播稳定性,可以更鲁棒地支持航空图像中小目标的细粒度定位。
然而,在无人机系统的轻量化部署约束下,如何显式增强与定位相关的结构信息仍然是一个关键问题。
B. 跨尺度和多分支特征学习
跨尺度和多分支设计的核心目标在于增强特征交互,以提高复杂场景中小目标的表示稳定性。以FPN为代表的早期方法通过分层金字塔结构实现多尺度特征的渐进融合;PANet或PAFPN进一步加强了双向信息流,而NAS-FPN和ASF则通过自适应重分配和结构优化提高了跨尺度集成的灵活性。
随着网络架构的发展,多分支检测框架和多骨干设计通过差异化结构和显式交互机制引入了并行表示路径,增强了特征多样性和互补表达;MoE、跨分支门控和协同蒸馏模型进一步建模了路径间的信息选择和协同作用,使特征融合从隐式聚合转向显式交互和动态协作。
尽管跨尺度特征交互机制不断演进,现有方法在融合前对异构特征流之间一致性的建模仍然有限,这在无人机场景中可能放大空间和语义错位,从而损害细粒度定位的稳定性。
C. 定位与高效检测设计
特征表示和交互机制最终必须转化为稳定的定位和高效的推理。为了提高回归质量,现代检测器采用解耦的分类和回归分支,并集成基于IoU的损失来增强边界框稳定性。鉴于小目标对细粒度结构线索的敏感性,一些方法进一步细化回归设计或加强边界感知表示。此外,还采用结构重参数化和轻量级骨干网络来平衡效率和表示能力,使其能够在计算受限的环境中部署。
综上所述,贯穿表示、交互和预测的协同机制对于鲁棒部署变得越来越重要。
III. 方法论
本节介绍 CollabOD,一个面向无人机图像的轻量级小目标检测框架,如图 2 所示。考虑到在轻量化部署约束下由结构退化和跨路径不一致性引入的不稳定性,我们重点关注两个方面:增强与定位相关的结构信息,以及在融合前提高异构特征流的一致性。相应地,所提出的框架包含三个协同组件:结构细节保留、跨路径特征对齐和定位感知轻量化设计。这三部分机制将分别在 III-A、III-B 和 III-C 节中详细讨论。

A. 结构细节保留
在无人机图像中,对精确定位至关重要的小目标线索主要存在于边界轮廓和纹理梯度中。然而,深度骨干网络中的重复下采样会逐渐衰减此类高频响应。为了在输入阶段和骨干网络阶段减轻结构衰减,我们设计了用于早期保留的双路径融合主干和用于层级补偿的密集聚合模块。
a) 双路径融合主干:给定输入特征 X ∈ R^{C×H×W},DPF-Stem 的核心原理是将特征划分为两个互补的流:结构流和细节流。首先,对输入特征进行嵌入和分割:

其中 ϕ(·) 表示轻量级特征嵌入,Split(·) 表示通道级分割算子。这两个流分别负责保留低频几何轮廓和高频纹理梯度:

其中 Ψ_pool 采用最大投影或池化来聚合稳定的结构响应,Ψ_conv 是一个可学习的轻量级卷积,旨在保留纹理梯度和局部差异响应。随后,两个流在同一尺度下融合以获得主干输出,然后进行下采样:

其中 ⊕ 表示拼接,ϕ_fuse 是用于通道混合和尺度对齐的轻量级投影。这种双流建模确保了 DPF-Stem 在下采样前后保留高频结构响应,从而减轻早期结构信息的损失。
b) 密集聚合模块:即使结构细节在输入阶段得以保留,它们在深度网络内的重复下采样和跨层传播过程中仍会逐渐衰减。DABlock 的目标是通过密集聚合,持续将浅层的细粒度结构响应注入更深层的特征,从而补偿骨干网络内部的这种层级结构衰减。设 {X_i}_{i=1}^{n} 表示来自先前阶段并对齐到当前尺度的特征图。DABlock 聚合这些特征并通过堆叠卷积进行细化:

这里,⊕ 表示特征聚合,X 是当前阶段的输入。当启用时,残差开关 δ 保留了恒等映射。这种设计有效地在更深层表示中增强了浅层结构线索,从而缓解了上述细节衰减。
从有效感受野的角度来看,密集聚合促进了跨层的渐进空间交互。通过集成对齐的多级特征,DABlock 在保留结构细节的同时增强了长程依赖建模。如图 3 所示,ERF 随深度稳步扩展,表现出越来越广泛的高贡献区域。

B. 跨路径特征对齐
为了减轻融合前异构特征流之间的不一致性,我们构建了双边重加权模块,用于在融合来自多个骨干路径的特征之前校准双流特征。具体来说,给定同一尺度上的双流特征 X^{(1)}, X^{(2)} ∈ R^{C×H×W},我们首先使用轻量级投影将特征映射到一个统一的嵌入空间以获得 ˆX^{(1)} 和 ˆX^{(2)}。随后,我们跨路径联合嵌入它们以捕获联合上下文:

其中 [·, ·] 表示沿通道维度的拼接,ψ 是一个轻量级的空间交互算子,用于建模跨路径依赖性。然后,通过激活和分割生成双边门控掩码:

其中 σ 表示 Sigmoid 激活函数,Split(·) 均匀划分通道以获得双流掩码 G^{(k)} ∈ (0, 1)^{C×H×W}。与仅限通道的门控不同,这些掩码是空间相关的,能够在复杂背景下更精细地抑制跨路径冗余和有偏响应。
获得双边掩码后,BRM 重新加权两个流,并通过可学习的通道幅度调制在融合前实现统计尺度校准:

其中 ⊙ 表示哈达玛积;λ^{(k)} ∈ R^{C×1×1} 是一个可学习的通道缩放因子,旨在平衡两个流的响应幅度并稳定梯度流;ϕ_out 是一个用于通道混合和输出集成的 1×1 投影。通过双边空间重加权和通道校准,BRM 在融合前减轻了跨路径差异,从而提高了特征兼容性并稳定了后续的定位回归。
C. 定位感知轻量化设计
在结构增强和跨路径校准之后,剩下的关键挑战是使回归头能够稳定地利用这些结构线索,同时在推理阶段不引入额外的计算开销。为此,所提出的统一的细节感知检测头通过共享细节增强和解耦预测,在定位稳定性和效率之间取得了稳健的平衡。
a) 前向过程:具体的前向过程总结在算法 1 中,其中多尺度特征表示为 F_i。
b) 复杂度分析:主要的计算开销来自共享细节增强块 S 和预测头。设 N = ∑_i H_i W_i 表示所有尺度的总空间位置数。时间复杂度可以表示为:

通常,由于 C_h ≫ R,主导项是 O( N C_h^2 )。空间复杂度主要由中间特征和预测对数组成:

由于 S 和投影在所有尺度上共享,UDA Head 增强了用于回归的细节感知,同时保持了较低的额外参数量和推理开销,使其非常适合计算资源受限的无人机部署场景。
IV. 实验与结果
A. 实验设置
-
实现细节:CollabOD 基于 YOLO11-M-P2 架构构建。所有实验均在 NVIDIA RTX 5090D GPU 上进行。我们使用 SGD 优化器,初始学习率为 0.01,动量为 0.937。输入图像尺寸为 640×640,批量大小为 8,训练 500 个轮次。
-
数据集:我们在三个广泛使用的无人机目标检测基准上进行了大量实验,即 VisDrone-2019-DET [11]、UAVDT [12] 和 AI-TOD [13]。VisDrone-2019-DET [11] 是一个广泛采用的无人机检测基准,包含在不同城市、时间和飞行高度下拍摄的 10,209 张图像,涵盖 10 个类别,具有显著的尺度变化和复杂背景。UAVDT [12] 是一个大规模面向交通的无人机基准,包含从 100 个视频序列中提取的 77,819 个标注帧,涵盖城市道路、交叉口和高速公路上的四个车辆类别,并提供了丰富的属性标注。AI-TOD [13] 是一个专门为微小目标检测定制的遥感基准,包含 28,036 张图像和 700,621 个标注实例,涵盖八个目标类别。
-
评估指标:我们采用标准的 COCO 评估协议 [42],报告 APₛ、APₘ、AP₅₀、AP₇₅ 和 AP₅₀:₉₅,以评估在不同定位严格程度下的检测一致性。
B. VisDrone 数据集上的结果
-
对比结果:我们在 VisDrone-2019-DET 基准上将 CollabOD 与广泛的最先进检测器进行了比较。定量结果总结在表 I 中。

CollabOD 以 2090 万参数和 65.5 GFLOPs 的计算量,实现了 52.4 AP₅₀、30.8 AP₇₅ 和 29.9 AP₅₀:₉₅。在所有比较方法中,CollabOD 取得了最高的 AP₇₅,表明在更严格的 IoU 阈值下具有改进的定位稳定性。这一增益与我们在多尺度融合前显式增强定位相关结构线索和提高特征一致性是一致的,同时保持了较低的计算成本。
与广泛采用的 YOLO11-M-P2 相比,CollabOD 将 AP₅₀ 从 46.4 提高到 52.4,AP₇₅ 从 25.3 提高到 30.8,分别提升了 6.0 和 5.5 个百分点。同时,计算成本从 91.3 GFLOPs 降低到 65.5 GFLOPs。这一结果表明,增强与定位相关的结构信息并在融合前校准异构特征流可以在不增加推理复杂度的情况下提高高质量定位。
与基于 Transformer 的方法相比,CollabOD 以显著更低的计算开销实现了有竞争力或更优的检测性能。这些结果验证了所提出的框架在保持实用效率的同时提供了强大的定位能力,这对于基于无人机的部署场景尤为重要。
这些结果使 CollabOD 成为基于无人机的轻量级小目标检测中一个高效而准确的解决方案。为了进一步验证其有效性,我们在图 4 中展示了定性比较。即使在具有密集分布小目标的杂乱场景中,CollabOD 也能保持集中的激活响应和稳定的定位,产生更少的漏检和更精确的边界框。

-
消融研究:我们在 VisDrone-2019-DET 数据集上进行了逐步消融研究,以评估每个提出组件的独立贡献。在相同的训练设置下,将 DPF-Stem、DABlock、BRM 和 UDA Head 逐步集成到基线检测器中。定量结果总结在表 II 中。

从基线开始,引入 DPF-Stem 将 AP₅₀ 从 26.2 提高到 29.1,表明增强的浅层特征建模有利于小目标表示。尽管此阶段 AP₇₅ 有所下降,但整体检测性能保持稳定,同时计算成本降至 51.2 GFLOPs,证明了效率的提升。
加入 DABlock 后,AP₇₅ 提高到 44.6,显示出在更严格的 IoU 阈值下定位精度的提升。此外,APₛ 和 APₘ 也表现出一致的改进,验证了自适应特征增强对不同尺度目标的有效性。
引入 BRM 后,检测器实现了 49.1 AP₅₀ 和 27.0 AP₅₀:₉₅,反映了融合前异构特征流一致性的改善。该模块在跨 IoU 阈值的平均检测指标上带来了明显的改进,表明整体检测鲁棒性得到增强。
最后,集成 UDA Head 进一步将性能提升至 50.7 AP₅₀、52.4 AP₇₅ 和 30.8 AP₅₀:₉₅,在所有配置中取得了最佳结果。与之前的变体相比,AP₇₅ 提高了 2.3 个百分点,证实了统一的细节感知头在细化定位质量和稳定严格 IoU 阈值下回归的有效性。重要的是,这一精度增益是在 65.5 GFLOPs 的计算量下实现的,与基线复杂度相当,并在精度和计算成本之间保持了有利的权衡。
总体而言,跨多个评估指标的一致改进表明,每个组件都提供了互补的增强,从而形成了一个专为基于无人机的小目标场景设计的鲁棒且高效的检测框架。
C. UAVDT 数据集上的结果
在 UAVDT 基准上,对比结果报告在表 III 中。CollabOD 实现了 31.2 AP₅₀、17.9 AP₇₅ 和 17.4 AP₅₀:₉₅,在比较方法中取得了最佳的 AP₅₀ 和 AP₅₀:₉₅。此外,它在 AP₇₅ 上排名第二,表明在更严格的 IoU 阈值下具有稳定的定位性能。

这些结果表明,所提出的框架有效地泛化到了主要基准之外的面向交通的无人机场景。
为了进一步检验模型在 UAVDT 上的行为,我们提供了热图可视化进行定性分析。使用与 VisDrone 实验相同的可视化协议,我们比较了 ClusDet 和 CollabOD 的激活响应。可视化结果显示,CollabOD 在目标区域周围产生更集中的响应,并与周围背景区域保持更清晰的分离,这与图 5 中报告的改进的量化性能一致。

D. AI-TOD 数据集上的结果
-
对比结果:在 AI-TOD 基准上,对比结果总结在表 IV 中。CollabOD 实现了 45.4 AP₅₀ 和 20.0 AP₅₀:₉₅,在两个指标上均取得了所有 YOLO 系列模型中的最佳性能。与最强的基线相比,它在 AP₅₀ 上比 YOLOv12-M-P2 高出 0.7 个百分点,并超过了由 YOLO11-M-P2 取得的 19.5 的次优 AP₅₀:₉₅ 值 0.5 个百分点。

在效率方面,尽管 CollabOD 引入了稍多的参数(2990 万),但它实现了最低的计算成本 65.5 GFLOPs 和最高的推理速度 137 FPS,展示了优越的精度-效率权衡。
这些结果表明,所提出的协同检测框架有效地增强了 AI-TOD 上的小目标检测性能,同时保持了有竞争力的实时能力。
-
消融研究:在 AI-TOD 数据集上,我们进行了消融研究以评估所提出框架中每个组件的贡献,如表 V 所示。从基线模型开始,我们逐步加入 DPF-Stem、DABlock、BRM 和 UDA Head。

引入 DPF-Stem 将推理速度提高到 110 FPS,同时将计算成本降低到 51.2 GFLOPs,检测精度略有波动。添加 DABlock 进一步将 AP₅₀ 提升至 43.7,AP₅₀:₉₅ 提升至 18.8,证明了其在增强特征表示方面的有效性。加入 BRM 后,检测性能提高到 44.2 AP₅₀ 和 19.3 AP₅₀:₉₅,同时保持了 74.8 GFLOPs 的高效计算。
最后,集成 UDA Head 构成了完整的 CollabOD 模型,实现了最佳的整体性能,AP₅₀ 为 45.4,AP₅₀:₉₅ 为 20.0,同时将计算成本降低到 65.5 GFLOPs,并将推理速度提高到 137 FPS。这些结果验证了每个组件都对检测精度和效率有积极贡献,它们的组合带来了持续且互补的性能增益。
V. 结论
我们提出了 CollabOD,一个用于无人机小目标检测的轻量级框架,它通过在融合前增强结构线索和校准特征流来改善定位稳定性。在 VisDrone、UAVDT 和 AI-TOD 上的实验表明,在更严格的 IoU 阈值下性能得到提升,并具有有竞争力的效率。未来的工作将探索实时机载部署以及与下游航空任务(如多目标跟踪和协同无人机感知)的集成。
更多推荐
所有评论(0)