(论文速读)基于SAM2的视觉目标跟踪干扰感知记忆
论文题目:A Distractor-Aware Memory for Visual Object Tracking with SAM2(基于SAM2的视觉目标跟踪干扰感知记忆)
会议:CVPR2025
摘要:基于内存的跟踪器是一种视频对象分割方法,它通过将最近跟踪的帧连接到内存缓冲区中形成目标模型,并通过将当前图像与缓冲帧相关联来定位目标。虽然已经在许多基准测试中取得了最佳性能,但最近发布的SAM2才使基于内存的跟踪器成为视觉对象跟踪社区的焦点。尽管如此,现代的追踪器在干扰物的存在下仍然举步维艰。我们认为需要一个更复杂的记忆模型,并提出了一个新的干扰感知记忆模型和一个基于自省的更新策略,共同解决分割精度和跟踪鲁棒性问题。生成的跟踪器表示为DAM4SAM。为了更好地研究分心物问题,我们还提出了一种新的分心物提取的DiDi数据集。DAM4SAM在7个基准测试中优于SAM2.1和相关的SAM内存扩展,并在其中6个基准测试中设置了坚实的新技术。
代码和新数据集可在https:// github.com/jovanavidenovic/DAM4SAM上获得。

深入解析DAM4SAM——让SAM2在复杂场景下更稳定的视觉跟踪新方法
引言
在计算机视觉领域,视觉目标跟踪一直是一个经典而富有挑战性的问题。想象一下:你需要在视频中持续定位一个特定的物体,但视频中可能存在许多与目标物体外观相似的"干扰物"。这些干扰物可能是附近相似的物体,也可能是目标物体自身的相似部分。当目标离开视野后重新出现时,这个问题变得更加棘手。
来自斯洛文尼亚卢布尔雅那大学的研究团队最近在CVPR 2025上发表的论文《A Distractor-Aware Memory for Visual Object Tracking with SAM2》为这个问题提供了一个优雅的解决方案。他们提出的DAM4SAM方法在多个权威基准测试上刷新了最佳成绩,并且无需任何额外训练!
问题的核心:干扰物如何"迷惑"跟踪器?
什么是干扰物?
在目标跟踪任务中,干扰物(distractors)是指那些在视觉上难以与被跟踪目标区分开的图像区域。它们主要分为两类:
- 外部干扰物:与目标相似的附近物体(例如,跟踪一只羊时,羊群中的其他羊)
- 内部干扰物:当只跟踪物体的一部分时,物体上的相似区域(例如,跟踪一个人的头部时,身体的其他部位)
为什么现有方法难以应对?
近年来,基于内存(memory-based)的跟踪方法成为主流,特别是SAM2(Segment Anything Model 2)的出现更是将这类方法推向了新高度。这些方法通过将最近跟踪到的帧存储在"内存"中,然后让当前帧与内存中的帧进行像素级关联来定位目标。
但问题在于:现有的内存管理机制将所有内存槽位平等对待。SAM2采用一个简单的FIFO(先进先出)缓冲区,保留最近6帧和初始帧。这种设计虽然简单有效,但无法针对性地解决干扰物问题:
- 最近的帧有助于准确分割
- 但区分目标和干扰物需要不同的"记忆"
就像人类的记忆系统——我们既需要短期记忆来处理当前信息,也需要长期记忆中的关键线索来做出正确判断。
DAM4SAM的创新:功能分化的内存架构

核心思想:内存功能分化
论文的核心创新在于提出了Distractor-Aware Memory (DAM),将内存根据其在跟踪中的功能分为两个部分:
1. RAM (Recent Appearance Memory) - 最近外观内存
- 功能:确保当前帧的分割准确性
- 结构:3个槽位的FIFO缓冲区
- 特点:
- 包含最近的目标外观
- 应用时间编码,让模型知道哪些帧更"新鲜"
- 每5帧更新一次(避免存储高度相关的连续帧)
- 当目标不可见时不更新(这是一个关键改进!)
2. DRM (Distractor Resolving Memory) - 干扰物解决内存
- 功能:确保跟踪鲁棒性和目标重新检测
- 结构:初始帧槽位 + 3个锚帧的FIFO缓冲区
- 特点:
- 存储包含关键干扰物的帧
- 不应用时间编码(因为这些帧的价值不依赖于时间远近)
- 智能更新:只在检测到干扰物且跟踪稳定时更新
创新的更新策略:利用SAM2的"内省"能力
DAM4SAM最巧妙的地方在于其DRM更新机制。研究者发现了一个有趣的现象:
SAM2实际上预测3个输出掩码,并选择IoU预测最高的那个作为最终输出。这意味着SAM2本身就是一个"多假设"模型。研究者的初步研究表明,在跟踪失败前的几帧中,SAM2实际上在另外两个替代掩码中检测到了干扰物!
基于这个洞察,DAM4SAM设计了一个简单而有效的干扰物检测机制:
1. 对输出掩码和"输出掩码+最大替代区域"分别拟合边界框
2. 计算两个边界框的面积比
3. 如果面积比 < 0.7,说明可能存在干扰物
4. 同时满足以下条件才更新DRM:
- 预测IoU > 0.8 (跟踪足够稳定)
- 掩码面积在最近10帧中位数的±20%内(避免异常帧)
这种设计就像给跟踪器装上了"内省"能力——它能意识到自己可能被迷惑了,并在这些关键时刻保存"记忆"。
另一个贡献:DiDi数据集

除了方法上的创新,论文还贡献了一个新的数据集——DiDi (Distractor-Distilled Dataset)。
为什么需要新数据集?
研究者注意到一个问题:现有基准测试中包含很多对于现代跟踪器来说已经不具挑战性的"简单"序列。这些简单序列的高分数会"淹没"总分,导致基准测试饱和,无法准确反映跟踪器在困难场景下的真实能力。
DiDi如何构建?
DiDi通过半自动方式从多个权威基准测试(GoT-10k, LaSOT, UTB180, VOT2020, VOT2022等)中精选序列:
- 干扰物检测:使用DINO2编码器提取特征,计算每个像素与目标区域的视觉相似度
- 序列筛选:如果至少1/3的帧包含显著干扰物,则纳入DiDi
- 最终数据集:180个序列,平均长度1.5k帧,共274,882帧
这个数据集专注于干扰物场景,能更准确地评估跟踪器处理复杂情况的能力。
实验结果:全面领先
消融实验:验证设计的有效性
研究者在DiDi数据集上进行了详细的消融实验:

| 方法 | Quality | Accuracy | Robustness |
|---|---|---|---|
| SAM2.1 (基线) | 0.649 | 0.720 | 0.887 |
| + 仅在目标存在时更新 | 0.665 | 0.723 | 0.903 |
| + 降低更新频率(Δ=5) | 0.667 | 0.718 | 0.914 |
| DAM4SAM (完整) | 0.694 | 0.727 | 0.944 |
关键发现:
- 不在目标缺失时更新内存 → 鲁棒性提升 (+1.6%)
- 降低更新频率 → 鲁棒性继续提升 (+1.1%)
- 完整DAM机制 → 鲁棒性大幅提升 (+5.7%),准确性也有提升 (+0.7%)
与SOTA方法比较


DiDi数据集上:
- 超越并发工作SAMURAI 2% (更高鲁棒性)
- 超越SAM2.1Long 7%
- 超越具有显式干扰物处理的ODTrack 14%
- 超越Cutie 21%
VOT2022 (最具挑战性的分割跟踪基准):

- EAO: 0.753 (SAM2.1: 0.692, 挑战赛冠军MS_AOT: 0.673)
- 相比SAM2.1提升 9%
- 相比冠军方法提升 12%
VOT2020:

- EAO: 0.729 (SAM2.1: 0.681, 挑战赛冠军RPT: 0.530)
- 相比SAM2.1提升 7%
- 相比冠军方法提升 37.5%
VOTS2024 (最新的多目标分割跟踪基准):

- Quality: 0.711 (第二名,仅次于复杂的集成方法S3-Track)
- 相比SAM2.1提升 8%
边界框跟踪基准:

- LaSoT AUC: 75.1% (与LORAT并列第一)
- LaSoText AUC: 60.9% (第一,超越第二名7.6%)
- GoT10k AO: 81.1% (第一,超过99%的帧成功跟踪)
性能vs效率
值得一提的是,DAM4SAM的速度为11 fps,相比SAM2.1的13.3 fps只有约20%的速度下降,但性能提升显著。这是一个非常合理的trade-off。
技术细节与实现要点
关键参数设置
DAM4SAM使用固定参数,无需针对不同数据集调优:
- 内存大小:NDAM = 6 (RAM 3槽 + DRM 3槽 + 初始帧)
- 更新间隔:Δ = 5帧
- 锚帧检测阈值:θanc = 0.7
- IoU稳定性阈值:θIoU = 0.8
- 面积变化阈值:θarea = 0.2
- 面积历史窗口:NM = 10帧
为什么DRM不使用时间编码?
这是一个重要的设计决策。实验表明,如果给DRM添加时间编码(除初始帧外),跟踪质量会下降3.6%!
原因在于:DRM中的帧对当前帧解决干扰物的价值不应受时间远近影响。一个含有关键干扰物的"古老"帧可能比一个最近但无关的帧更有价值。时间编码会给模型带来不必要的偏见。
为什么总是包含最近一帧?
实验显示,如果RAM的所有槽位都按5帧间隔更新(不包含最新帧),跟踪质量会下降1.3%。最近的帧对准确分割至关重要,这验证了设计的合理性。
方法的优势与局限
优势
- 无需训练:DAM4SAM是对预训练SAM2.1的零样本增强,无需任何额外训练
- 简单优雅:核心思想清晰,实现相对简单
- 普适性强:固定参数在多个数据集上都表现出色
- 显著提升:在处理干扰物时鲁棒性大幅提升
可能的局限
- 速度略有下降:虽然只有20%,但对实时应用仍有影响
- 依赖SAM2架构:目前方法基于SAM2的多假设输出特性
- 参数敏感性:虽然论文称对参数不敏感,但未来可能需要自适应策略
未来方向
论文在结论中提出了几个有前景的研究方向:
- 可学习的内存管理策略:当前的更新规则是基于启发式的,未来可以通过学习获得更优策略
- 更高效的架构:基于内存的框架相比当前SOTA方法架构更简单,有进一步优化空间
- 自适应内存大小:根据场景复杂度动态调整内存容量
实践建议
如果你想在自己的项目中使用DAM4SAM:
- 代码已开源:访问 https://github.com/jovanavidenovic/DAM4SAM
- 适用场景:特别适合存在大量视觉相似物体的场景(人群、动物群、相似商品等)
- 起步门槛低:无需训练,直接加载SAM2.1权重即可使用
- 参数调优:论文提供的默认参数是很好的起点,通常无需调整
结论
DAM4SAM这篇论文通过一个简单而深刻的洞察——内存应该根据功能进行分化——解决了视觉跟踪中的一个基本挑战。更令人印象深刻的是,这个方法无需任何训练就能在多个权威基准上取得显著的性能提升,充分证明了好的设计思想的价值。
这项工作不仅在技术上有所创新,还为社区贡献了DiDi数据集,帮助研究者更好地评估跟踪器在困难场景下的表现。随着论文代码的开源,相信会有更多研究在此基础上继续推进视觉跟踪技术的发展。
对于从事计算机视觉、特别是视觉跟踪研究的同学,这篇论文绝对值得深入阅读。它展示了如何通过深入理解问题本质,用相对简单的方法取得显著效果,这正是优秀研究的典范。
更多推荐
所有评论(0)