注意力机制

【三分钟动画讲解算法——注意力机制 | 讲透算法原理 + 优势】 https://www.bilibili.com/video/BV1Cm4DzqEfw/?share_source=copy_web&vd_source=0caeacd6c3217ba41c56ea47a129e168

YOLO

【YOLOv4原理讲解精华版(上)】 https://www.bilibili.com/video/BV1V9N4zfEw4/?share_source=copy_web&vd_source=0caeacd6c3217ba41c56ea47a129e168

目标检测

YOLO(You Only Look Once)是一种基于深度神经网络的对象识别和定位算法,其最大的特点是运行速度很快,可以用于实时系统。

YOLOv4 清晰分为三部分:Backbone → Neck → Head

1. Backbone(主干:CSPDarknet53)
  • 作用提取图像特征(线条→纹理→形状→物体)
  • 改进:把 YOLOv3 的 Darknet53 升级为 CSPDarknet53
    • CSP(跨阶段局部连接):把特征分成两路,一路直接走,一路走残差,减少计算、增强特征、防梯度消失
    • 激活函数:用 Mish 替代 LeakyReLU,更平滑、收敛更好Ultralytics YOLO
    • SAM 注意力:加入空间注意力,让模型 “看重点”

2. Neck(颈部:SPP + PAN)
  • 作用多尺度特征融合—— 把 “大目标语义” 和 “小目标细节” 揉在一起
  • 两大黑科技
    • SPP(空间金字塔池化):对高层特征做 4 种尺度池化,扩大感受野、分离上下文特征,大幅提精度
    • PAN(路径聚合网络)自顶向下 + 自底向上双向融合,让浅层细节(小目标)和深层语义(大目标)充分交流
3. Head(检测头)
  • 作用:最终预测 ——框坐标 + 类别 + 置信度
  • 延续 YOLOv3 多尺度
    • 3 个分支,分别测 大 / 中 / 小 目标
    • CIoU Loss 替代 IoU Loss:考虑框重叠、中心距、宽高比,回归更准
    • DIoU-NMS:去重框时更准,减少遮挡漏检 / 误删

YOLOv4 = 单阶段实时检测天花板(2020 年)= CSPDarknet53(主干) + SPP+PAN(融合) + 多尺度 Head(预测)

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐