论文题目:A Distractor-Aware Memory for Visual Object Tracking with SAM2(基于SAM2的视觉目标跟踪干扰感知记忆)

会议:CVPR2025

摘要:基于内存的跟踪器是一种视频对象分割方法,它通过将最近跟踪的帧连接到内存缓冲区中形成目标模型,并通过将当前图像与缓冲帧相关联来定位目标。虽然已经在许多基准测试中取得了最佳性能,但最近发布的SAM2才使基于内存的跟踪器成为视觉对象跟踪社区的焦点。尽管如此,现代的追踪器在干扰物的存在下仍然举步维艰。我们认为需要一个更复杂的记忆模型,并提出了一个新的干扰感知记忆模型和一个基于自省的更新策略,共同解决分割精度和跟踪鲁棒性问题。生成的跟踪器表示为DAM4SAM。为了更好地研究分心物问题,我们还提出了一种新的分心物提取的DiDi数据集。DAM4SAM在7个基准测试中优于SAM2.1和相关的SAM内存扩展,并在其中6个基准测试中设置了坚实的新技术。

代码和新数据集可在https:// github.com/jovanavidenovic/DAM4SAM上获得。


深入解析DAM4SAM——让SAM2在复杂场景下更稳定的视觉跟踪新方法

引言

在计算机视觉领域,视觉目标跟踪一直是一个经典而富有挑战性的问题。想象一下:你需要在视频中持续定位一个特定的物体,但视频中可能存在许多与目标物体外观相似的"干扰物"。这些干扰物可能是附近相似的物体,也可能是目标物体自身的相似部分。当目标离开视野后重新出现时,这个问题变得更加棘手。

来自斯洛文尼亚卢布尔雅那大学的研究团队最近在CVPR 2025上发表的论文《A Distractor-Aware Memory for Visual Object Tracking with SAM2》为这个问题提供了一个优雅的解决方案。他们提出的DAM4SAM方法在多个权威基准测试上刷新了最佳成绩,并且无需任何额外训练!

问题的核心:干扰物如何"迷惑"跟踪器?

什么是干扰物?

在目标跟踪任务中,干扰物(distractors)是指那些在视觉上难以与被跟踪目标区分开的图像区域。它们主要分为两类:

  1. 外部干扰物:与目标相似的附近物体(例如,跟踪一只羊时,羊群中的其他羊)
  2. 内部干扰物:当只跟踪物体的一部分时,物体上的相似区域(例如,跟踪一个人的头部时,身体的其他部位)

为什么现有方法难以应对?

近年来,基于内存(memory-based)的跟踪方法成为主流,特别是SAM2(Segment Anything Model 2)的出现更是将这类方法推向了新高度。这些方法通过将最近跟踪到的帧存储在"内存"中,然后让当前帧与内存中的帧进行像素级关联来定位目标。

但问题在于:现有的内存管理机制将所有内存槽位平等对待。SAM2采用一个简单的FIFO(先进先出)缓冲区,保留最近6帧和初始帧。这种设计虽然简单有效,但无法针对性地解决干扰物问题:

  • 最近的帧有助于准确分割
  • 但区分目标和干扰物需要不同的"记忆"

就像人类的记忆系统——我们既需要短期记忆来处理当前信息,也需要长期记忆中的关键线索来做出正确判断。

DAM4SAM的创新:功能分化的内存架构

核心思想:内存功能分化

论文的核心创新在于提出了Distractor-Aware Memory (DAM),将内存根据其在跟踪中的功能分为两个部分:

1. RAM (Recent Appearance Memory) - 最近外观内存
  • 功能:确保当前帧的分割准确性
  • 结构:3个槽位的FIFO缓冲区
  • 特点:
    • 包含最近的目标外观
    • 应用时间编码,让模型知道哪些帧更"新鲜"
    • 每5帧更新一次(避免存储高度相关的连续帧)
    • 当目标不可见时不更新(这是一个关键改进!)
2. DRM (Distractor Resolving Memory) - 干扰物解决内存
  • 功能:确保跟踪鲁棒性和目标重新检测
  • 结构:初始帧槽位 + 3个锚帧的FIFO缓冲区
  • 特点:
    • 存储包含关键干扰物的帧
    • 不应用时间编码(因为这些帧的价值不依赖于时间远近)
    • 智能更新:只在检测到干扰物且跟踪稳定时更新

创新的更新策略:利用SAM2的"内省"能力

DAM4SAM最巧妙的地方在于其DRM更新机制。研究者发现了一个有趣的现象:

SAM2实际上预测3个输出掩码,并选择IoU预测最高的那个作为最终输出。这意味着SAM2本身就是一个"多假设"模型。研究者的初步研究表明,在跟踪失败前的几帧中,SAM2实际上在另外两个替代掩码中检测到了干扰物!

基于这个洞察,DAM4SAM设计了一个简单而有效的干扰物检测机制:

1. 对输出掩码和"输出掩码+最大替代区域"分别拟合边界框
2. 计算两个边界框的面积比
3. 如果面积比 < 0.7,说明可能存在干扰物
4. 同时满足以下条件才更新DRM:
   - 预测IoU > 0.8 (跟踪足够稳定)
   - 掩码面积在最近10帧中位数的±20%内(避免异常帧)

这种设计就像给跟踪器装上了"内省"能力——它能意识到自己可能被迷惑了,并在这些关键时刻保存"记忆"。

另一个贡献:DiDi数据集

除了方法上的创新,论文还贡献了一个新的数据集——DiDi (Distractor-Distilled Dataset)

为什么需要新数据集?

研究者注意到一个问题:现有基准测试中包含很多对于现代跟踪器来说已经不具挑战性的"简单"序列。这些简单序列的高分数会"淹没"总分,导致基准测试饱和,无法准确反映跟踪器在困难场景下的真实能力。

DiDi如何构建?

DiDi通过半自动方式从多个权威基准测试(GoT-10k, LaSOT, UTB180, VOT2020, VOT2022等)中精选序列:

  1. 干扰物检测:使用DINO2编码器提取特征,计算每个像素与目标区域的视觉相似度
  2. 序列筛选:如果至少1/3的帧包含显著干扰物,则纳入DiDi
  3. 最终数据集:180个序列,平均长度1.5k帧,共274,882帧

这个数据集专注于干扰物场景,能更准确地评估跟踪器处理复杂情况的能力。

实验结果:全面领先

消融实验:验证设计的有效性

研究者在DiDi数据集上进行了详细的消融实验:

方法QualityAccuracyRobustness
SAM2.1 (基线)0.6490.7200.887
+ 仅在目标存在时更新0.6650.7230.903
+ 降低更新频率(Δ=5)0.6670.7180.914
DAM4SAM (完整)0.6940.7270.944

关键发现:

  • 不在目标缺失时更新内存 → 鲁棒性提升 (+1.6%)
  • 降低更新频率 → 鲁棒性继续提升 (+1.1%)
  • 完整DAM机制 → 鲁棒性大幅提升 (+5.7%),准确性也有提升 (+0.7%)

与SOTA方法比较

DiDi数据集上:

  • 超越并发工作SAMURAI 2% (更高鲁棒性)
  • 超越SAM2.1Long 7%
  • 超越具有显式干扰物处理的ODTrack 14%
  • 超越Cutie 21%

VOT2022 (最具挑战性的分割跟踪基准):

  • EAO: 0.753 (SAM2.1: 0.692, 挑战赛冠军MS_AOT: 0.673)
  • 相比SAM2.1提升 9%
  • 相比冠军方法提升 12%

VOT2020:

  • EAO: 0.729 (SAM2.1: 0.681, 挑战赛冠军RPT: 0.530)
  • 相比SAM2.1提升 7%
  • 相比冠军方法提升 37.5%

VOTS2024 (最新的多目标分割跟踪基准):

  • Quality: 0.711 (第二名,仅次于复杂的集成方法S3-Track)
  • 相比SAM2.1提升 8%

边界框跟踪基准:

  • LaSoT AUC: 75.1% (与LORAT并列第一)
  • LaSoText AUC: 60.9% (第一,超越第二名7.6%)
  • GoT10k AO: 81.1% (第一,超过99%的帧成功跟踪)

性能vs效率

值得一提的是,DAM4SAM的速度为11 fps,相比SAM2.1的13.3 fps只有约20%的速度下降,但性能提升显著。这是一个非常合理的trade-off。

技术细节与实现要点

关键参数设置

DAM4SAM使用固定参数,无需针对不同数据集调优:

  • 内存大小:NDAM = 6 (RAM 3槽 + DRM 3槽 + 初始帧)
  • 更新间隔:Δ = 5帧
  • 锚帧检测阈值:θanc = 0.7
  • IoU稳定性阈值:θIoU = 0.8
  • 面积变化阈值:θarea = 0.2
  • 面积历史窗口:NM = 10帧

为什么DRM不使用时间编码?

这是一个重要的设计决策。实验表明,如果给DRM添加时间编码(除初始帧外),跟踪质量会下降3.6%!

原因在于:DRM中的帧对当前帧解决干扰物的价值不应受时间远近影响。一个含有关键干扰物的"古老"帧可能比一个最近但无关的帧更有价值。时间编码会给模型带来不必要的偏见。

为什么总是包含最近一帧?

实验显示,如果RAM的所有槽位都按5帧间隔更新(不包含最新帧),跟踪质量会下降1.3%。最近的帧对准确分割至关重要,这验证了设计的合理性。

方法的优势与局限

优势

  1. 无需训练:DAM4SAM是对预训练SAM2.1的零样本增强,无需任何额外训练
  2. 简单优雅:核心思想清晰,实现相对简单
  3. 普适性强:固定参数在多个数据集上都表现出色
  4. 显著提升:在处理干扰物时鲁棒性大幅提升

可能的局限

  1. 速度略有下降:虽然只有20%,但对实时应用仍有影响
  2. 依赖SAM2架构:目前方法基于SAM2的多假设输出特性
  3. 参数敏感性:虽然论文称对参数不敏感,但未来可能需要自适应策略

未来方向

论文在结论中提出了几个有前景的研究方向:

  1. 可学习的内存管理策略:当前的更新规则是基于启发式的,未来可以通过学习获得更优策略
  2. 更高效的架构:基于内存的框架相比当前SOTA方法架构更简单,有进一步优化空间
  3. 自适应内存大小:根据场景复杂度动态调整内存容量

实践建议

如果你想在自己的项目中使用DAM4SAM:

  1. 代码已开源:访问 https://github.com/jovanavidenovic/DAM4SAM
  2. 适用场景:特别适合存在大量视觉相似物体的场景(人群、动物群、相似商品等)
  3. 起步门槛低:无需训练,直接加载SAM2.1权重即可使用
  4. 参数调优:论文提供的默认参数是很好的起点,通常无需调整

结论

DAM4SAM这篇论文通过一个简单而深刻的洞察——内存应该根据功能进行分化——解决了视觉跟踪中的一个基本挑战。更令人印象深刻的是,这个方法无需任何训练就能在多个权威基准上取得显著的性能提升,充分证明了好的设计思想的价值。

这项工作不仅在技术上有所创新,还为社区贡献了DiDi数据集,帮助研究者更好地评估跟踪器在困难场景下的表现。随着论文代码的开源,相信会有更多研究在此基础上继续推进视觉跟踪技术的发展。

对于从事计算机视觉、特别是视觉跟踪研究的同学,这篇论文绝对值得深入阅读。它展示了如何通过深入理解问题本质,用相对简单的方法取得显著效果,这正是优秀研究的典范。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐