C-RADIOv4 (Tech Report)

  • 通过利用多教师蒸馏,凝聚视觉主干提供了一个统一的学生模型,保留并提高了多位教师的独特能力。在本技术报告中,我们描述了 C-RADIO 系列模型的最新版本 C-RADIOv4,它在设计上基于 AM-RADIO/RADIOv2.5,在相同的计算复杂性下对关键下游任务提供了强大的改进。

  • 我们发布了 -SO400M(412M 参数)和 -H (631M) 模型变体,两者均由更新的教师集进行训练:SigLIP2、DINOv3 和 SAM3。除了核心指标的改进和模仿 SAM3 的新功能之外,C-RADIOv4 型号系列还进一步改进了任何分辨率支持,带回了 ViTDet 选项以大幅提高高分辨率下的效率,并附带许可。

  • 代码地址:GitHub - NVlabs/RADIO: Official repository for “AM-RADIO: Reduce All Domains Into One”

  • 模型地址:RADIO - a nvidia Collection

  • C-RADIOv4是基于 AM-RADIO/RADIOv2.5 设计的聚合视觉基础模型,依托多教师蒸馏核心技术,将教师集升级为SigLIP2、DINOv3、SAM3并舍弃 DFN CLIP,推出SO400M(412M 参数)和H(631M 参数)两个变体;该模型在保持与前代相同计算复杂度的前提下,通过随机分辨率训练、平移等变损失 / 平移等变 MESA、平衡摘要损失、DAMP 权重噪声等多项方法更新,解决了模式切换、固定模式噪声、教师损失占比失衡等问题,强化了任意分辨率支持并恢复ViTDet 模式大幅提升高分辨率推理效率,还可直接替换 SAM3 的视觉编码器且能解决 SAM3 在 “person” 查询中的失效问题;在核心指标上,C-RADIOv4 参数远少于 DINOv3-7B(6716M),但在语义分割、kNN 分类等密集任务上表现极具竞争力,同时采用宽松许可证,在视觉语言、自动驾驶、机器人等领域具备广泛应用潜力。


Description

  • AM-RADIO 引入了凝聚基础模型的概念,这是一种通过从其他异构模型中提取特征表示来创建新基础模型的方法。在最初的公式中,我们使用 DFN CLIP 、DINOv2 和 SAM 作为核心教师集。我们还引入了多分辨率训练,即 DFN CLIP 和 DINOv2 以一种分辨率进行蒸馏,而 SAM 以更高分辨率进行蒸馏。我们发现存在一种称为“模式切换”的现象,其中学生模型学会根据分辨率改变其表示,以最大限度地减少训练损失,并且根据所使用的分辨率,它会在推理过程中导致非常不一致的行为。

  • 在 PHI-S 中,我们将教师分布平衡确定为训练强凝聚模型的重要组成部分,在 RADIOv2.5 中,我们发现在两种分辨率下对所有教师进行训练足以克服模式切换问题,在 FeatSharp 中,我们提出了一种上采样方法,该方法适用于某些固定分辨率模型,例如 DFN CLIP 和 SigLIP,与双线性相比更可取重新采样。最初的 AM-RADIO 提出的关键点之一是,改进的教师往往会产生改进的学生,并且这种趋势继续存在。自之前的工作以来,SigLIP2 已成为前沿的文本图像基础编码器,DINOv3 突破了自监督学习 (SSL) 和密集表示的界限,产生了令人难以置信的强大密集感知模型,而 SAM 已升级到 SAM3 ,在解决计算机视觉方面取得了巨大进展。

  • 为了与我们最初的前提保持一致,我们将核心教师集升级为[SigLIP2,DINOv3,SAM3],以升级我们的凝聚模型。我们继承了 DINOv3 改进的语义分割能力,以及 SigLIP2 增强的文本对齐能力。 SAM3 作为教师并没有在我们选择的基准上显示出改进的指标,但将其作为教师可以替换 SAM3 的视觉编码器骨干,以及利用凝聚模型的创造性用例,例如 RADSeg 中的用例。除了简单地更新我们的教师集之外,我们还通过提高模型在任何分辨率下运行的能力来进一步致力于多功能性,并恢复“ViTDet 模式”,允许大多数 Transformer 块在窗口模式下运行,这对高分辨率图像的推理速度产生巨大影响(见图 9)。

    • 在这里插入图片描述

    • 图1| PCA 特征可视化,比较 C-RADIOv3-H 与 C-RADIOv4-H。对象边界现在明显更清晰。

    • 在这里插入图片描述

    • 表 1 |不同视觉编码器之间的比较。在密集任务上,C-RADIOv4 与 DINOv3 相比,参数只占一小部分。

Method Updates

  • 凝聚模型依赖于多个视觉基础模型的蒸馏。对于 RADIO 系列模型,蒸馏在密集特征空间和摘要标记上进行。在本节中,我们描述了用于开发改进的 C-RADIOv4 模型的新技术,其形式是自我们在 RADIOv2.5 中全面描述该方法以来发生的变化。

Updated Teachers

  • 对于 C-RADIOv4,我们将教师集更新为:

    • SigLIP2-g-384 【Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features】
    • DINOv3-7B
    • SAM3
  • 为了减少计算需求,我们在此版本中放弃了对 DFN CLIP 的支持,转而支持更普遍的 SigLIP2 ,因为后者部署在更多地方(例如 Qwen3 VL ),并且两个模型具有相似的表示和应用领域。

Stochastic Resolutions

  • 我们不像 RADIOv2.5 那样以 2 个不同的分辨率进行训练,而是从低分辨率分区中的 {128, 192, 224, 256, 384, 432} 和高分辨率分区中的 {512, 768, 1024, 1152} 进行采样,从而实现更平滑的分辨率缩放曲线,并且在低分辨率下也获得了实质性的质量。对于 SigLIP2 ,我们使用 FeatSharp 在我们的高分辨率训练分区中进行 3 倍上采样,从 384px 到 1152px。低分辨率分区使用原始输出。最后,对于 SAM3,我们使用 RADIOv2.5 中提出的马赛克增强,因为它仅支持大小为 1152 × 1152 的输入。

    • 在这里插入图片描述

    • 表 2 | DINOv3-7B 和 C-RADIOv4-H 之间 ADE20k 线性探头的分辨率缩放比较。两种模型都表现出强大的分辨率缩放特性。 †DINOv3-7B 的指标来自 中的图 11,其中小数点后的值为近似值。

  • 图 3 和图 4 显示了多分辨率支持如何随着时间的推移而演变,图 4 显示了 RADIO 模型与 DINOv2/3 的比较,因为它们也支持多分辨率。在表 2 中,我们表明 C-RADIOv4 对于提高语义分割的分辨率具有很强的鲁棒性,包括高于训练的分辨率。考虑到 C-RADIOv4-H 的参数比 DINOv3-7B 少一个数量级,因此它的性能非常有竞争力。

    • 在这里插入图片描述

    • 图3| ImageNet-1K 零样本精度作为输入分辨率的函数。

    • 在这里插入图片描述

    • 图4| ImageNet-1K kNN 精度作为输入分辨率的函数。

Shift Equivariance

  • 自 PHI-S 以来,特征损失的公式为 1 Z ∑ i ( x − y ^ ) 2 \frac1Z\sum_i(x-\hat y)^2 Z1i(xy^)2,其中 y ^ \hat y y^ 是 PHI-S 标准化的教师特征,𝑥 是学生预测,𝑍 标准化常数。这种方法的缺点是学生不仅学习老师的有用特征,而且还学习固定模式噪声。在 DVT 中,作者发现所有这些视觉基础模型都存在这种噪声,并且他们学习将模型输出分解为 V i T ( x ) ≈ f ( x ) + g ( E p o s ) + h ( x , E p o s ) ViT(x)≈f(x)+g(E_{pos})+h(x,E_{pos}) ViT(x)f(x)+g(Epos)+h(x,Epos)​,其中 𝑓 是依赖于输入的语义,𝑔 是数据不变偏差,ℎ 是纠缠残差。
  • 我们还在 FeatSharp 工作中识别出这些相同的噪声模式,尤其是 SigLIP2 模型,因为它们沿着输出特征图的边界有这些“孔”。 SAM 在 ViTDet 窗口的边界处有很强的伪影。 DINOv3-H+ 碰巧有一些频繁的大幅度噪声斑块。在所有这些情况下,如果不加以缓解,模型将学习模仿 MLP 适配器中的这种噪声,甚至会泄漏到主干特征中。我们通过损失公式中两种不同形式的移位等方差来解决这个问题,这两种形式都使学生无法知道学生和教师之间匹配的补丁的确切位置。我们在图 2 中可视化这些伪像,其中出现高能量表示,通常出现在其他大部分均匀的图像区域中。
    • 在这里插入图片描述

    • 图2| DINOv3 和 C-RADIOv4(适配器)预测的可视化。请注意 DINOv3 产生的不适当的斑点。

    • 第 1 列:输入图像

    • 第 2 列:DINOv3 PCA 可视化。

    • 第 3 列:C-RADIOv4 适配器 PCA 可视化。

    • 第 4 列:学生适配器预测和 DINOv3 教师之间的误差热图。

Shift Equivariant Loss
  • 为了防止学生匹配不明确依赖于输入的语义的密集教师特征,对于特定图像,我们随机移动学生以及每个教师看到的裁剪。教师之间以及学生之间都有独立的轮班。我们跟踪映射 F 𝑆 → 𝑇 ℱ_{𝑆→𝑇} FST,它将学生产生的特征转换为与教师在空间上对齐。采样的偏移以补丁大小的增量进行,这尽可能消除了插值效应。因此,我们采用如下新的损失公式:

    • L s p a t i a l ( x , y ^ ) = 1 ∣ Ω ∣ ∑ ︁ 𝑢 ∈ Ω ( F 𝑆 → 𝑇 [ x ] 𝑢 − y ^ 𝑢 ) 2 . ( 1 ) L_{spatial}(x, \hat y) =\frac 1{|Ω|} ∑︁_{𝑢∈Ω} (ℱ_{𝑆→𝑇} [x]_𝑢 −\hat y_𝑢)^2 . (1) Lspatial(x,y^)=∣Ω∣1uΩ(FST[x]uy^u)2.(1)

    • Ω 是学生和教师之间常见的空间位置集合,x 是学生输出, y ^ \hat y y^ 是 PHI-S 标准化教师输出。

Shift Equivariant MESA
  • MESA 是训练分类模型不可或缺的工具,它试图将权重收敛到平坦区域,在该区域中,输入的扰动不会导致输出的混乱变化,并提高泛化能力。为了进一步对抗学生模型中出现的固定模式噪声,我们应用了匹配学生模型的指数移动平均值 (EMA) 的 MESA 公式,但还添加了为学生及其 EMA 引入不同作物的变化,并通过 F 𝑆 → 𝑆 ˉ ℱ_{𝑆→\bar 𝑆} FSSˉ 变换将它们关联起来,然后使用以下公式:

    • L 𝑚 𝑒 𝑠 𝑎 ( x , x ˉ ) = 1 ∣ Ω ∣ ∑ ︁ 𝑢 ∈ Ω ( F 𝑆 → 𝑆 ˉ [ 𝐿 𝑁 ( x ) ] 𝑢 − 𝐿 𝑁 ( x ˉ ) 𝑢 ) 2 , ( 2 ) L_{𝑚𝑒𝑠𝑎}(x,\bar x)=\frac1{|Ω|}∑︁_{𝑢∈Ω}(ℱ_{𝑆→\bar𝑆}[𝐿𝑁(x)]_𝑢−𝐿𝑁(\bar x)_𝑢)^2,(2) Lmesa(x,xˉ)=∣Ω∣1uΩ(FSSˉ[LN(x)]uLN(xˉ)u)2,(2)

    • 𝐿𝑁 是层范数,没有可学习的仿射投影, S ˉ , x ˉ \bar S,\bar x Sˉ,xˉ 分别是 EMA 学生模型的裁剪和输出。

DAMP

  • 为了进一步增强模型的鲁棒性,我们采用了 DAMP ,它在训练期间将乘性噪声应用于模型的权重。

Balanced Summary Loss

  • 在 PHI-S 中,整个研究围绕着标准化每个教师的空间特征分布展开,这样大的激活就不会主导损失。然而,没有注意到摘要特征。其原因是因为摘要特征是使用余弦相似度进行匹配的,余弦相似度本质上是标准化的。然而,我们后来注意到,虽然汇总特征的大小被归一化到单位超球面上,但它们的方向方差却没有。如果教师生成的特征在单位超球面上均匀分布,这并不重要,但我们发现特征往往会落入圆锥体中,并且每个教师的圆锥体半径都不同。

  • 这样做的结果是,半径较大的锥体会比半径较小的锥体产生更大的损耗。此外,重要的不是学生和老师之间的角度,而是相对于所有其他嵌入的角度。为了减轻这种情况,我们不再使用余弦距离作为我们的总结损失,而是采用以下内容:

    • c o s ( x , y ) = x ⊺ y ‖ x ‖‖ y ‖ , ( 3 ) Θ ( x , y ) = a r c c o s ( c o s ( x , y ) ) , ( 4 ) 𝜇 y = E [ y ] ‖ E [ y ] ‖ , ( 5 ) D i s p ( Θ y ) = E [ ︁ Θ ( y , 𝜇 y ) 2 ] ︁ , ( 6 ) L 𝑎 𝑛 𝑔 𝑙 𝑒 ( x , y ) = Θ ( x , y ) 2 D i s p ( Θ y ) , ( 7 ) cos(x, y) =\frac{x^⊺y}{‖x‖‖y‖}, (3)\\ Θ(x, y) = arccos(cos(x, y)) ,(4)\\ 𝜇_y = \frac{E[y]}{‖E[y]‖} ,(5)\\ Disp(Θ_y) = E [︁ Θ (y, 𝜇_y) ^2 ]︁, (6)\\ L_{𝑎𝑛𝑔𝑙𝑒}(x, y) =\frac{Θ(x, y)^2}{Disp(Θ_y)}, (7) cos(x,y)=x‖‖yxy,(3)Θ(x,y)=arccos(cos(x,y)),(4)𝜇y=E[y]E[y],(5)Disp(Θy)=E[︁Θ(y,𝜇y)2],(6)Langle(x,y)=Disp(Θy)Θ(x,y)2,(7)

    • 其中 x 为学生预测,y 为教师预测,𝜇y 为 y 的预期方向,Disp(θy) 为 y 的角色散,我们用它来标准化教师之间的圆锥半径,使学生能够专注于相对角度,并防止一位教师支配另一位教师。我们报告了表 3 中发现的角色散,表明 SigLIP2 和 DINOv3 之间存在显着差异。如果不加以缓解,DINOv3 将主导损失项,使学生偏向于匹配它,但代价是匹配 SigLIP2。

    • 在这里插入图片描述

    • 表 3 |重点教师摘要令牌的角分散。

Results

Metrics

  • 在图3中,我们展示了RADIOv2.5和各种版本的C-RADIO的零样本精度。我们注意到 RADIOv2.5 和 C-RADIOv2 没有 SigLIP2 对齐的头,因此我们使用其 DFN CLIP 头来报告准确性。一般来说,DFN CLIP 对于学生模型来说更容易匹配,因此,直到 C-RADIOv4,我们都无法匹配之前的 RADIOv2.5 模型的零样本精度。显示的所有模型都表现出强大的分辨率缩放能力,但是,相对于前几代模型,C-RADIOv4 极大地改进了低分辨率下的分类。我们使用保留宽高比的调整大小,在 1024 像素分辨率下实现了最大零镜头分数。

  • 我们能够使用 k-NN(k 最近邻)分类直接与 DINOv2/3 模型进行比较,如 DINOv2 和之前的 RADIO 作品所使用的那样。我们在图 4 中显示了这些结果,我们可以看到 DINOv3 与 DINOv2 相比在 k-NN 上取得了很大的改进,但是,随分辨率缩放的能力集中在 192-256px 左右,并且更高的分辨率会降低。对于 RADIO,CRADIO 模型在 RADIOv2.5 的基础上大幅改进,其中 C-RADIOv4 通常比 C-RADIOv3 稍好一些。这表明 C-RADIOv3 的零样本问题更有可能源于与 SigLIP2 特定匹配的问题,而不是缺乏良好的整体表示。尽管如此,C-RADIOv4 仍然对这两项任务有所改进。奇怪的是,DINOv3 的 H+ 模型在 kNN 分类方面比 7B 模型更好。从 256px 开始,C-RADIOv4-H 能够匹配或超过 DINOv3

    • 在这里插入图片描述

    • 表 4 |对各种 RADIO 模型进行完整的 Probe3d 评估。所有指标越高越好。

SAM3

  • 旧版本的 RADIO 支持 SAM 适配器,这使得 RADIO 可以取代 SAM 的视觉编码器,同时使用其解码和内存堆栈来执行分段。这种能力在 RADSeg 等作品中得到了巧妙的运用,它使用 SAM 头来细化分割掩码,并为开放词汇语义分割设定了新的技术水平。 CRADIOv4 将我们的 SAM 支持升级到 SAM3 ,再次允许替换核心视觉模型。

  • 我们在 https://github.com/mranzinger/sam3-radio 上有一个 SAM3 代码库的分支,演示了如何进行此替换。在图 6 和图 7 中,我们展示了 RADIO 替换视觉编码器的能力,首先使用 SAM3 提供的图像演示,然后使用不同的查询使用我们自己的图像。定性地讲,RADIO 完全可以代替 SAM3 的感知编码器 主干网。在表 5 中,我们显示了 SA-Co/Gold 实例分割的基准测试结果。 C-RADIOv4 成为第二好的模型,尽管它继承了取代 SAM3 视觉编码器的能力参差不齐。在以自然图像为主的“metaclip_nps”和“sa1b_nps”上,RADIO 表现得很好,与 SAM3 差距较小,但在“fg_sports_equipment”和“wiki_common”上差距变得更大。提高我们更好地匹配 SAM3 的能力是一个开放的研究方向。

    • 在这里插入图片描述

    • 图6|掩码结果来自 SAM3 图像演示,无论是使用常规 SAM3,还是使用 RADIO 替换视觉编码器。 RADIO 能够复制 SAM3 结果。

    • 在这里插入图片描述

    • 图 7 |用RADIO替换SAM3视觉编码器的文本查询结果,同时保持解码器不变。

    • 在这里插入图片描述

    • 表 5 | SA-Co/Gold 实例分割的结果。 “VDT”指的是ViTDet窗口大小𝑊,而“G”指的是全局注意力。

  • C-RADIOv4 支持“ViTDet 模式”,它允许模型在完全全局注意力(例如禁用 ViTDet 模式)下运行,或者在大部分窗口注意力和一些全局注意力层下运行。这可以在构建模型时使用“vitdet_window_size”标志进行控制。SAM3 使用 ViT-L+ 架构,具有 4 个全局层,其余具有 24 × 24 令牌的窗口。为了提高效率,C-RADIOv4 支持 6 × 6 到 32 × 32 令牌之间的任何窗口,唯一的限制是窗口大小乘以补丁大小需要均匀划分输入图像分辨率

  • 较小的窗口有可能更快,因为它减少了自注意力的二次惩罚,但是,硬件可能会减少/消除相似窗口大小之间的差距,并且较小的窗口可能会导致质量略有下降。我们在图 9 中显示了 A100 GPU 上单图像推理的推理时间。对于 SO400M 模型,窗口大小 ≤ 12 比 SAM3 的编码器更快。 ViT-H RADIO 的窗口大小为 8 几乎同样快。我们还在图 5 中显示了分辨率在 256px 到 4096px 之间的两种 C-RADIOv4 模型的延迟,无论是否有 ViTDet。虽然 ViTDet 不会将模型的复杂性从 O ( T 2 ) O(T^2 ) O(T2) 改变为令牌数量,但由于 4 层仍然采用全局注意力这一事实,它确实大大降低了增长因子。

    • 在这里插入图片描述

    • 图5|对 A100 的 C-RADIOv4 两个版本(有或没有指定窗口大小的 ViTDet)进行延迟分析。窗口大小为 8 和 16 的 ViTDet 模式之间的延迟差异可以忽略不计。

  • “person”的奇怪情况在 SAM3 github 上(截至 2026 年 1 月 14 日),github 问题 253 指出 SAM3 的 github 示例无法正常处理“person”查询。我们能够复制这种行为。然而,通过 C-RADIOv4 作为视觉主干,查询可以按预期工作。我们在图 8 中展示了这种行为。RADIO 变体在全局注意力模式下工作,以及窗口大小为 8 的 ViTDet(其他可能也可以工作,这是我们测试的唯一两个)。这似乎表明两个视觉编码器之间表示的细微差别对这个特定的查询具有阈值效应。

    • 在这里插入图片描述

    • 图8| SAM3 演示(github 问题)无法使用“person”查询进行屏蔽,而 C-RADIOv4[SO400M,H] 效果很好。

    • 在这里插入图片描述

    • 图9| SAM3 视觉编码器与 RADIO 视觉编码器的 A100 单图像基准测试结果(SO400M 和 Huge 尺寸)。 SAM3 使用 ViT-L+ 架构,窗口大小为 24。窗口大小为 72 相当于完全全局注意力。

Conclusion

  • 由于基础模型的改进,特别是 DINOv3 ,以及我们的蒸馏算法的改进,C-RADIOv4 比其前身有了很大的改进。与之前的版本不同,我们提供了 SO400M 版本,该版本通常能够与 ViT-H 竞争,同时价格更便宜。

  • 我们演示了如何使用 C-RADIOv4 来替换 SAM3 中的视觉编码器,并且使用 ViTDet 窗口大小 ≤ 12 的 SO400M 变体,它甚至比 SAM3 使用的 ViT-L+ 感知编码器 更快。过去的 RADIO 模型已得到广泛应用,包括 Nemotron Nano V2 VL 视觉语言模型、自动驾驶车辆、机器人、OCR 文档解析 、开放词汇语义分割 等等。鉴于商业许可,我们希望学术界和工业界都能够利用这一基础模型来构建伟大的事物。

模型核心背景与设计初衷

  • 聚合视觉基础模型的核心是通过蒸馏异构模型的特征表示构建统一学生模型,初代 AM-RADIO 因分分辨率蒸馏出现模式切换问题,即模型随分辨率改变特征表示,导致推理行为不一致;RADIOv2.5 通过全分辨率匹配教师集解决该问题,FeatSharp 提出了更优的上采样方法。
  • C-RADIOv4 延续该理念,因SigLIP2、DINOv3、SAM3成为新一代视觉基础模型前沿,将教师集升级为该三者并舍弃 DFN CLIP(SigLIP2 更通用且与 DFN CLIP 表征相似),同时推出 SO400M(412M 参数)H(631M 参数) 两个变体,兼顾性能与轻量化。
  • 核心设计目标:保留多教师的独特能力、强化任意分辨率支持、恢复 ViTDet 模式提升高分辨率推理效率、实现更优的密集任务表现。

本次模型的性能提升源于 5 项核心方法创新,解决了前代训练中的噪声、损失失衡、分辨率适配等问题:

  1. 更新教师集:确定核心教师为 SigLIP2-g-384、DINOv3-7B、SAM3,舍弃 DFN CLIP,降低计算需求的同时提升表征的前沿性;SAM3 仅支持 1152×1152 输入,训练时采用马赛克增强。
  2. 随机分辨率训练:替代原 2 种分辨率,低分辨率分区采样 {128,192,224,256,384,432},高分辨率分区采样 {512,768,1024,1152};对 SigLIP2 采用 FeatSharp 实现 3× 上采样(384px→1152px),实现更平滑的分辨率缩放曲线,提升低分辨率任务质量。
  3. 平移等变优化
    • 提出Shift Equivariant Loss:对学生和各教师的图像块进行独立随机偏移,通过特征映射对齐空间位置,避免学生学习教师的固定模式噪声;
    • 提出Shift Equivariant MESA:在 MESA 的 EMA 匹配基础上,为学生和 EMA 模型设置不同图像块,通过特征映射关联,进一步抑制固定模式噪声。
  4. DAMP 权重噪声:训练中对模型权重施加乘法噪声,有效提升模型的整体鲁棒性。
  5. 平衡摘要损失:解决前代余弦相似度仅归一化特征幅值、未归一化方向方差的问题,通过计算教师特征的角分散归一化不同教师的锥半径,避免单一教师主导损失(如 DINOv3 角分散远大于 SigLIP2),让学生聚焦相对角度匹配。

为解决固定模式噪声问题,C-RADIOv4 提出了两项核心平移等变技术,同时结合现有方法优化:

  1. 提出Shift Equivariant Loss,对学生和各教师的图像块进行独立于彼此的随机偏移,通过特征映射对齐空间位置,让学生仅学习输入相关的语义特征,而非教师的固定噪声;
  2. 提出Shift Equivariant MESA,在 MESA 的 EMA 模型匹配基础上,为学生模型和其 EMA 版本设置不同的图像块,通过特征映射关联二者,进一步抑制固定模式噪声的生成;
  3. 结合 FeatSharp 上采样方法,减少因分辨率转换带来的插值噪声,从源头降低噪声引入。

C-RADIOv4 相比 DINOv3-7B,在模型参数量和核心任务表现上核心优势与差距

  1. 参数量优势:C-RADIOv4 的 H 变体仅 631M 参数,SO400M 为 412M 参数,而 DINOv3-7B 达 6716M 参数,C-RADIOv4 参数量仅为其 1/10 左右,计算复杂度更低;
  2. 核心优势:在 VOC 语义分割上,C-RADIOv4-H 达 87.24,高于 DINOv3-7B 的 86.6,且在 kNN 分类(86.59)上优于 DINOv3-7B 的 85.42,同时高分辨率下的推理效率远高于 DINOv3-7B;
  3. 小幅差距:在 ADE20k 语义分割上,DINOv3-7B 达 55.9,略高于 C-RADIOv4-H 的 55.20,且在 3D 探测的部分指标上,DINOv3-7B 的 NAVI(64.4)略高于 C-RADIOv4-H 的 63.44。

C-RADIOv4 在替换 SAM3 视觉编码器方面的表现如何,且该能力带来了实际应用价值

  1. 替换表现:C-RADIOv4 可无缝替换 SAM3 的视觉编码器,在 SA-Co/Gold 实例分割基准测试中位列第二,H-G 变体平均 cgF1 达 44.7;在自然图像场景(metaclip_nps/sa1b_nps)中与 SAM3 差距较小,且能解决 SAM3 官方 demo 中 “person” 查询失效的问题,全局注意力和 ViTDet 模式均能正常工作;
  2. 应用价值:
    1. 一是大幅提升 SAM3 的推理效率,C-RADIOv4-SO400M 在 ViTDet 窗口≤12 时,推理速度快于 SAM3 原 ViT-L + 编码器,降低了 SAM3 的部署成本;
    2. 二是拓展了 SAM3 的应用场景,结合 RADSeg 等工作,可利用 C-RADIOv4 的聚合特征提升开放词汇语义分割的性能;
    3. 三是实现了轻量化部署,SO400M 变体以更低参数量替换 SAM3 编码器,适合自动驾驶、机器人等对算力有约束的端侧场景。

C-RADIO 系列模型构建的范式演变

  • C-RADIO 系列的核心构建范式是 “聚合视觉基础模型”(Agglomerative Foundation Models),即通过多教师蒸馏融合异构视觉模型的核心能力,形成统一、高效的学生模型。其构建方案的演变始终围绕 “解决前序缺陷、强化核心能力、平衡性能与效率” 展开,最终在 C-RADIOv4 中形成精细化设计:
系列核心构建范式的演变脉络
版本核心构建目标关键构建决策解决的核心问题
AM-RADIO验证聚合模型可行性教师集:DFN CLIP(文本对齐)+ DINOv2(密集感知)+ SAM(分割);分分辨率蒸馏首次实现多教师能力聚合,但存在 “模式切换”
RADIOv2.5解决模式切换 + 强化稳定性全分辨率训练(所有教师均参与高低分辨率蒸馏);保留双空间蒸馏(密集 + 摘要)模式切换(推理分辨率依赖);蒸馏稳定性不足
PHI-S(中间优化)教师分布平衡空间特征分布归一化;优化蒸馏损失权重分配单一教师主导损失;特征分布不一致
C-RADIOv3教师集迭代 + 性能提升尝试引入 SigLIP2 替代 DFN CLIP;优化特征对齐策略文本 - 图像对齐能力不足;低分辨率性能薄弱
C-RADIOv4全维度优化 + 效率与泛化平衡教师集精简升级(SigLIP2+DINOv3+SAM3);随机分辨率训练;ViTDet 模式回归;噪声抑制教师特征噪声;摘要 token 损失失衡;高分辨率效率低
C-RADIOv4 的精细化构建设计
  • 基础架构:双空间蒸馏 + Transformer 骨干

    • 核心框架:延续 RADIO 系列 “密集特征空间 + 摘要 token 空间” 双蒸馏架构 —— 密集特征负责像素级任务(分割、检测),摘要 token 负责全局任务(分类、检索),确保多任务适配性。

    • 骨干设计:采用 ViT 变体,支持两种运行模式:

      • 全局注意力模式:适合需要长距离依赖的任务(如 3D 探测、开放词汇分割);
      • ViTDet 模式:大部分 Transformer 块采用窗口注意力(窗口尺寸 6×6~32×32),仅 4 层保留全局注意力,大幅降低高分辨率图像的自注意力计算复杂度(O (T²)→近似 O (T))。
  • 模型变体:兼顾轻量化与高性能

    • SO400M(412M 参数):轻量化版本,计算成本低,ViTDet 窗口≤12 时推理速度超 SAM3 原生编码器,适合端侧部署(自动驾驶、机器人);

    • H(631M 参数):高性能版本,在语义分割、kNN 分类等密集任务上比肩 DINOv3-7B(6716M 参数),参数仅为其 1/10。

  • 教师集选型:“能力互补 + 生态兼容”

    • 舍弃 DFN CLIP,选择 SigLIP2-g-384:因 SigLIP2 是新一代文本 - 图像对齐前沿模型,生态适配性更强(已部署于 Qwen3 VL),且与 DFN CLIP 表征域重叠度低、能力更优;

    • 引入 DINOv3-7B:当前最强自监督密集感知模型,强化语义分割、3D 探测等像素级任务能力;

    • 保留 SAM3:虽未直接提升基准指标,但支持替换其视觉编码器,解锁 RADSeg 等衍生应用,且解决了 SAM3 的 “person 查询失效” 缺陷。

“适配蒸馏” 是 C-RADIO 系列的核心技术,其本质是 “让学生模型精准学习多教师的核心能力,同时规避特征噪声、分布失衡、分辨率依赖等适配问题”。其技术演进可分为 “基础构建→缺陷修复→精细化优化” 三个阶段,C-RADIOv4 实现了端到端的适配蒸馏流程:(系列适配蒸馏的核心技术演进)

技术维度AM-RADIORADIOv2.5/PHI-SC-RADIOv4
分辨率适配分分辨率蒸馏(低:DFN CLIP/DINOv2;高:SAM)全分辨率蒸馏(所有教师参与双分辨率)随机分辨率蒸馏(低:6 种采样;高:4 种采样)+ FeatSharp 上采样
特征对齐简单空间匹配像素级特征分布归一化(PHI-S)平移等变映射(F_S→T/F_S→Ṡ)+ 无插值偏移
损失设计单一 MSE 损失(空间 + 摘要)空间特征分布平衡损失空间损失(平移等变 MSE)+ 摘要损失(平衡角损失)+ MESA 损失 + DAMP
噪声抑制部分过滤(FeatSharp)双阶段噪声抑制(平移等变 + 权重乘法噪声)
C-RADIOv4 适配蒸馏的全流程实现
  • (1)第一步:教师特征预处理与适配

针对不同教师的特征特性,进行针对性预处理,确保蒸馏兼容性:

  • SigLIP2(固定 384px 输入):高分辨率训练时用 FeatSharp 做 3× 上采样(384px→1152px),避免双线性插值导致的特征模糊;低分辨率训练直接使用原生输出;

  • DINOv3(密集特征 + 噪声补丁):通过 PHI-S 归一化特征分布,减少大激活值对损失的主导;

  • SAM3(固定 1152×1152 输入):采用马赛克增强(Mosaic Augmentation)拼接多图,适配其输入尺寸限制,同时扩充训练数据多样性。

  • (2)第二步:多分辨率采样与特征对齐
    • 随机分辨率采样:低分辨率分区 {128,192,224,256,384,432}、高分辨率分区 {512,768,1024,1152},生成平滑的分辨率缩放曲线,提升模型对任意分辨率的适配性;

    • 平移等变对齐:对学生和每个教师的图像块进行独立随机偏移(偏移量为 patch 尺寸的整数倍),通过映射函数F_S→T(学生→教师)和F_S→Ṡ(学生→EMA 学生)实现空间对齐,让学生仅学习输入依赖的语义特征,而非教师的固定位置噪声(如 SigLIP2 的边界 “孔洞”、DINOv3 的噪声补丁)。

  • (3)第三步:多损失融合与平衡蒸馏

C-RADIOv4 设计了四组损失函数,分别解决不同适配问题,最终加权融合:

  1. 平移等变空间损失(L_spatial):抑制固定模式噪声 L s p a t i a l ( x , y ^ ) = 1 ∣ Ω ∣ ∑ ︁ 𝑢 ∈ Ω ( F 𝑆 → 𝑇 [ x ] 𝑢 − y ^ 𝑢 ) 2 L_{spatial}(x, \hat y) =\frac 1{|Ω|} ∑︁_{𝑢∈Ω} (ℱ_{𝑆→𝑇} [x]_𝑢 −\hat y_𝑢)^2 Lspatial(x,y^)=∣Ω∣1uΩ(FST[x]uy^u)2 。其中 Ω 为师生共现空间位置,x 为学生密集特征,ŷ为 PHI-S 归一化后的教师特征。

  2. 平衡摘要损失(L_angle):解决教师摘要 token 损失失衡。因不同教师的摘要特征分布呈 “锥形”(DINOv3 的锥半径远大于 SigLIP2,表 3),直接用余弦距离会导致 DINOv3 主导损失。通过角分散归一化: L a n g l e ( x , y ) = Θ ( x , y ) 2 D i s p ( Θ y ) L_{angle}(x,y)=\frac{Θ(x,y)^2}{Disp(Θy)} Langle(x,y)=Disp(Θy)Θ(x,y)2。其中 Θ(x,y) 为师生特征夹角,Disp (Θ_y) 为教师特征的角分散(SigLIP2:0.694;DINOv3-7B:2.186),确保各教师的摘要能力均衡传递。

  3. 平移等变 MESA 损失(L_mesa):提升泛化性,在 MESA(指数移动平均模型匹配)基础上加入偏移适配,让学生模型的权重收敛到 “抗扰动平坦区域”: L m e s a ( x , x ˉ ) = 1 ∣ Ω ∣ ∑ u ∈ Ω ( F S → S ˉ [ L N ( x ) ] u − L N ( x ˉ ) u ) 2 L_{mesa}(x,\bar x)=\frac1{∣Ω∣}∑_{u∈Ω}(F_{S→\bar S}[LN(x)]_u−LN(\bar x)_u)^2 Lmesa(x,xˉ)=Ω1uΩ(FSSˉ[LN(x)]uLN(xˉ)u)2

  4. DAMP 权重噪声:强化鲁棒性。训练时对模型权重施加乘法噪声,减少学生对教师特征噪声的过拟合,提升对输入扰动的适应能力。

  • (4)第四步:训练增强与收敛优化
    • 数据增强:针对 SAM3 的固定分辨率限制,采用马赛克增强;针对低分辨率性能,增加低分辨率样本的训练权重;
    • 优化器:适配 Transformer 架构的 AdamW 优化器,学习率随分辨率动态调整(高分辨率样本学习率降低,避免梯度震荡)。

C-RADIOv4 的教师集(SigLIP2、DINOv3、SAM3)并非简单的特征叠加,而是通过 “能力分层、缺陷互补、蒸馏适配” 实现协同赋能 —— 每个教师贡献核心独特能力,同时通过蒸馏技术规避其固有缺陷,最终形成 “1+1+1>3” 的统一表征:

教师集赋能的核心逻辑:能力互补 + 缺陷抵消

教师模型核心能力定位对 C-RADIOv4 的赋能维度蒸馏中的适配处理措施
SigLIP2-g-384文本 - 图像对齐 + 全局分类1. 零样本分类能力(ImageNet-1K Zero-Shot 83.88);2. 文本查询与视觉特征的匹配能力1. FeatSharp 3× 上采样适配高分辨率蒸馏;2. 平衡摘要损失中的角分散归一化(避免被 DINOv3 压制)
DINOv3-7B自监督密集感知 + 语义分割1. 像素级特征提取(kNN 分类 85.42);2. 语义分割(ADE20k 55.9);3. 3D 探测能力1. 平移等变损失抑制噪声补丁;2. PHI-S 归一化空间特征分布;3. 随机分辨率训练强化分辨率鲁棒性
SAM3实例分割 + 视觉编码器替换1. 支持替换 SAM3 的视觉编码器(解锁 RADSeg 等应用);2. 解决 “person” 查询失效缺陷1. 马赛克增强适配固定分辨率输入;2. 复用 SAM3 的解码器与内存栈,仅蒸馏视觉编码器特征

单教师的具体赋能路径与实验验证

(1)SigLIP2:文本 - 图像对齐的 “全局导航”
  • 核心赋能:提供强文本 - 视觉对齐能力,让 C-RADIOv4 具备零样本分类、开放词汇检索能力。实验显示,C-RADIOv4-H 的 Zero-Shot 准确率达 83.09,虽略低于 SigLIP2-g(84.75),但结合了 DINOv3 的密集能力,实现 “全局分类 + 局部分割” 双优;
  • 适配关键:FeatSharp 上采样技术是关键 —— 若直接用双线性插值,SigLIP2 的高分辨率特征会模糊,导致 VOC 分割准确率下降 3~5 个百分点;而 FeatSharp 保留了文本对齐的精细特征,使 C-RADIOv4 的 VOC 分割达 87.24(超 RADIOv2.5 的 85.97)。
(2)DINOv3:密集感知的 “像素级支柱”
  • 核心赋能:自监督预训练带来的强密集特征提取能力,让 C-RADIOv4 在语义分割、kNN 分类、3D 探测等任务中表现突出。例如,C-RADIOv4-H 的 ADE20k 分割达 55.20,接近 DINOv3-7B 的 55.9,且参数仅为其 1/10;
  • 适配关键:平移等变损失有效抑制了 DINOv3 的固定模式噪声 ——PCA 可视化显示(图 2),C-RADIOv4 的特征边界更清晰,DINOv3 的 “异位斑点噪声” 被完全过滤,使 SPair(图像配准)指标从 DINOv3 的 58.7 提升至 60.57。
(3)SAM3:实例分割的 “功能扩展器”
  • 核心赋能:不直接提升基准指标,但解锁了 “替换 SAM3 视觉编码器” 的关键功能 ——C-RADIOv4 可无缝接入 SAM3 的解码器,在 SA-Co/Gold 实例分割中位列第二(平均 cgF1 44.7),且解决了 SAM3 的 github issue 253(“person” 查询失效);
  • 适配关键:马赛克增强让 SAM3 能参与多分辨率蒸馏,避免了其固定分辨率导致的泛化不足;同时,C-RADIOv4 的表征更适合 “person” 类别的特征阈值,使该查询的掩码生成准确率从 SAM3 的 0% 提升至 100%(图 8)。

多教师的协同赋能效果

  • 任务覆盖:C-RADIOv4 同时支持零样本分类、语义分割、实例分割、3D 探测、文本查询匹配等多任务,且核心指标均超前代及单一教师的轻量化版本(表 1、表 4、表 5);
  • 效率 - 性能平衡:SO400M 变体在 ViTDet 窗口≤12 时,推理速度超 SAM3 的 ViT-L + 编码器(A100 latency 92.9ms vs 127.4ms),同时保持竞争力(SA-Co/Gold 平均 cgF1 41.4)。

C-RADIOv4 的成功源于其 “持续迭代、精准适配” 的设计理念,系列演变的核心价值可概括为三个维度:

  1. 蒸馏范式升级:从 “简单特征模仿” 到 “能力精准迁移”—— 通过平移等变、平衡损失、噪声抑制,让学生仅学习教师的核心能力,而非缺陷;
  2. 教师集优化:从 “追求数量” 到 “质量互补”—— 舍弃冗余教师(DFN CLIP),选择前沿且能力互补的模型,同时通过蒸馏技术抵消单教师缺陷;
  3. 效率 - 性能平衡:从 “重性能轻效率” 到 “双优平衡”——ViTDet 模式回归、轻量化变体设计,让模型在端侧与云端均具备部署价值。

整体架构由**骨干网络模块 **、多教师蒸馏适配模块分辨率自适应模块噪声抑制与鲁棒性增强模块损失函数优化模块SAM3 兼容适配模块六大核心模块构成。

  • 骨干网络模块:作为整个模型的特征提取基础,承担全局 / 局部特征的统一提取任务,是所有下游任务和蒸馏流程的 “特征底座”;同时通过双运行模式设计,实现长距离依赖建模高分辨率推理效率的平衡,是 C-RADIOv4 适配端侧 / 云端多部署场景的核心模块。

    • 基于 Vision Transformer(ViT)构建,延续 RADIO 系列 “密集特征 + 摘要 token” 双特征输出设计 —— 密集特征为像素级特征图,支撑分割、检测、3D 探测等密集任务;摘要 token 为全局特征向量,支撑零样本分类、图像检索等全局任务,实现单模型对多任务的原生适配。

    • 通过vitdet_window_size参数灵活切换,核心是注意力机制的差异化设计,仅保留 4 层全局注意力层(保障长距离特征关联),其余层可切换为窗口注意力:

      • 全局注意力模式:所有 Transformer 块采用全局自注意力,适合需要长距离依赖的任务(如 3D 探测、开放词汇语义分割、SAM3 编码器替换);
      • ViTDet 模式:大部分 Transformer 块采用窗口自注意力(窗口尺寸支持 6×6~32×32 可调),仅 4 层保留全局注意力,将自注意力的计算复杂度从O(T²)(T 为 token 数)降至近似O(T),大幅降低高分辨率图像的推理耗时。
    • 双模型变体:基于骨干网络的参数量与深度做差异化设计,兼顾轻量化高性能

      • SO400M(412M 参数):轻量化版本,骨干网络做了层宽与深度的精简,核心优化推理效率,适合端侧 / 边缘部署(如自动驾驶、机器人);
      • H(631M 参数):高性能版本,骨干网络保留完整的特征提取能力,在密集特征任务(语义分割、kNN 分类)上比肩千亿参数量的 DINOv3-7B,适合云端大算力部署。
    • 恢复 RADIO 系列早期的 ViTDet 模式并做优化:前代 RADIOv2.5/C-RADIOv3 为了简化设计暂时舍弃该模式,C-RADIOv4 重新引入并支持动态窗口尺寸,适配不同分辨率与任务的效率需求;双特征输出的精细化对齐:针对密集特征与摘要 token 的提取做了跨层特征融合,解决前代二者特征表征 “脱节” 的问题,提升多任务的一致性。

  • 多教师蒸馏适配模块:承担异构教师模型的特征预处理、特征空间对齐、蒸馏流程管控三大任务,是将 SigLIP2、DINOv3、SAM3 三者的核心能力融合为统一学生特征的 “桥梁”,解决了异构模型特征不兼容、蒸馏过程能力迁移不精准的核心问题。

    • 该模块为多子模块协同的端到端架构,分为教师集预处理子模块特征空间对齐子模块蒸馏流程管控子模块,核心是 “针对不同教师的特性做个性化适配,再通过统一的空间映射实现特征对齐”。

    • 教师集预处理子模块:对 SigLIP2、DINOv3、SAM3 的原生特征做针对性预处理,消除异构模型的特征表征差异,确保蒸馏兼容性:

      • SigLIP2-g-384:仅支持 384px 固定输入,低分辨率蒸馏直接用原生输出,高分辨率蒸馏通过 FeatSharp 做 3× 上采样(384px→1152px),避免双线性插值导致的特征模糊,保留其文本 - 图像对齐的精细特征;
      • DINOv3-7B:存在固定模式噪声与特征激活值分布不均问题,通过PHI-S 归一化对其密集特征做分布平衡,减少大激活值对蒸馏损失的主导,同时过滤部分低频噪声;
      • SAM3:仅支持 1152×1152 固定输入,通过 马赛克增强(Mosaic Augmentation) 将多张小图拼接为 1152×1152 的大图,既适配其输入尺寸限制,又扩充了训练数据的多样性,让 SAM3 能参与多分辨率蒸馏。
    • 特征空间对齐子模块:核心是平移等变映射函数的设计,解决 “学生与教师特征空间位置不匹配、学生学习教师固定位置噪声” 的问题:

      • 定义映射函数FS→T:实现学生特征→教师特征的空间对齐,对学生和每个教师的图像块做独立于彼此的随机偏移(偏移量为 patch 尺寸的整数倍,消除插值效应),仅在师生共现的空间位置Ω上做特征匹配;
      • 定义映射函数FS→S~:实现学生特征→EMA 学生特征的空间对齐,为后续的平移等变 MESA 损失提供基础。
    • 蒸馏流程管控子模块:实现多教师、多分辨率、多特征空间的蒸馏流程统一管控,包括:多教师特征的并行输入、多分辨率样本的随机采样、密集特征 / 摘要 token 的双空间蒸馏同步进行、损失权重的动态分配。

    • “通用预处理”“个性化预处理”:前代对所有教师采用相同的特征处理方式,C-RADIOv4 针对每个教师的输入限制、特征缺陷做针对性设计,提升蒸馏兼容性;引入平移等变映射:替代前代简单的像素级特征匹配,从根本上解决学生学习教师固定模式噪声的问题;实现多分辨率蒸馏的端到端管控:将随机分辨率采样、特征上采样、马赛克增强整合到蒸馏流程中,无需额外的预处理步骤。

  • 分辨率自适应模块:承担多分辨率样本生成、特征分辨率适配、分辨率缩放曲线优化任务,从训练源头解决了 RADIO 系列初代的 “模式切换”问题(模型随分辨率改变特征表示,导致推理行为不一致),实现任意分辨率输入的鲁棒性支持,同时提升低分辨率任务的性能。

    • 随机分辨率采样策略:替代前代 RADIOv2.5 的双分辨率固定训练(仅 2 种分辨率),将分辨率分为低分辨率分区高分辨率分区,训练时随机采样,生成平滑的分辨率缩放曲线

      • 低分辨率分区:采样集合为 {128, 192, 224, 256, 384, 432},覆盖端侧常见的低分辨率输入场景;
      • 高分辨率分区:采样集合为 {512, 768, 1024, 1152},覆盖云端 / 工业级的高分辨率输入场景。
    • 特征分辨率适配:结合 FeatSharp 上采样与原生特征输出,实现不同教师的分辨率适配:

      • 低分辨率蒸馏:所有教师均使用原生特征输出,无需分辨率转换;

      • 高分辨率蒸馏:SigLIP2 通过 FeatSharp 做 3× 上采样,DINOv3 直接输出高分辨率特征,SAM3 通过马赛克增强适配 1152×1152。

    • 超分辨率鲁棒性设计:训练时引入超训练分辨率的样本增强,让模型在高于训练分辨率的输入下仍能保持性能稳定,解决前代 “超分辨率输入性能骤降” 的问题。

    • 双分辨率固定训练随机多分辨率采样:大幅增加了训练的分辨率多样性,让模型学习到连续的分辨率缩放规律,而非针对特定分辨率的特征表示,从根本上解决模式切换问题;聚焦低分辨率性能提升:前代模型对低分辨率输入的适配性差,C-RADIOv4 通过增加低分辨率分区的采样样本量,显著提升了低分辨率下的零样本分类、kNN 分类性能;实现超训练分辨率的鲁棒支持:前代模型在超训练分辨率下性能下降明显,C-RADIOv4 通过超分辨率样本增强,让模型在 1536px(超训练最高分辨率 1152px)下仍能保持性能稳定。

  • 噪声抑制与鲁棒性增强模块:针对视觉基础模型普遍存在的固定模式噪声问题做针对性抑制,同时提升模型对输入扰动、权重扰动的鲁棒性,解决了前代模型 “学习教师特征噪声、泛化性差、鲁棒性弱” 的痛点,是 C-RADIOv4 特征质量提升的关键。

    • 双阶段固定模式噪声抑制子模块DAMP 权重鲁棒性子模块构成,分别针对特征层面的固定模式噪声模型层面的整体鲁棒性做优化,二者协同实现 “特征去噪 + 模型鲁棒” 的双重目标。
    • 双阶段固定模式噪声抑制子模块:针对 SigLIP2 的边界 “孔洞”、DINOv3 的噪声补丁、SAM3 的 ViTDet 窗口边界伪影等固定模式噪声,通过平移等变损失平移等变 MESA实现双阶段抑制:
      • 第一阶段(蒸馏损失层):通过平移等变空间损失,让学生仅在师生共现的空间位置做特征匹配,且对学生和教师做独立随机偏移,使学生无法学习教师的固定位置噪声,仅能学习输入相关的语义特征;
      • 第二阶段(模型收敛层):通过平移等变 MESA,在 MESA(指数移动平均模型匹配)的基础上,为学生模型和其 EMA 版本设置不同的图像块,通过FS→S~映射关联,让模型权重收敛到抗扰动的平坦区域,进一步抑制固定模式噪声的生成,同时提升模型泛化性。
    • DAMP 权重鲁棒性子模块:针对模型对权重扰动的鲁棒性弱问题,在训练过程中对模型权重施加乘法噪声,迫使模型学习权重无关的稳定特征表示,提升模型对权重扰动、输入扰动的整体鲁棒性,同时减少过拟合。
    • “无噪声抑制”“双阶段精准抑制”:前代模型未针对教师的固定模式噪声做处理,导致学生模型继承了教师的噪声缺陷,C-RADIOv4 从蒸馏损失和模型收敛两个阶段做针对性抑制,从根本上解决噪声学习问题;从 “特征层面鲁棒性”“模型层面鲁棒性”:前代仅关注特征层面的抗扰动,C-RADIOv4 通过 DAMP 权重乘法噪声,实现了模型权重层面的鲁棒性优化,提升了整体抗扰动能力;噪声抑制的针对性设计:针对不同教师的噪声类型做统一的抑制方案,无需个性化设计,兼顾效率与效果。
  • 损失函数优化模块:作为多教师蒸馏的核心 “指挥棒”,承担蒸馏损失的设计、多教师损失的平衡、密集 / 摘要特征的蒸馏引导任务,解决了前代模型 “单一损失适配性差、多教师损失失衡、摘要 token 蒸馏不精准” 的痛点,是实现多教师能力均衡迁移的关键。

    • C-RADIOv4 摒弃了前代 “单一 MSE 损失 + 余弦距离损失”的简单设计,构建了“双空间损失 + 正则化损失”的多损失融合体系,分为密集特征空间损失 摘要 token 空间损失正则化损失三大类,且针对多教师损失失衡问题做了角分散归一化,实现各教师能力的均衡迁移。

    • 密集特征空间损失:平移等变 MSE 损失核心公式: L s p a t i a l ( x , y ^ ) = 1 ∣ Ω ∣ ∑ u ∈ Ω ( F S → T [ x ] u − y ^ u ) 2 L_{spatial}(x,\hat y)=\frac1{∣Ω∣}∑_{u∈Ω}(F_{S→T}[x]_u−\hat y_u)^2 Lspatial(x,y^)=Ω1uΩ(FST[x]uy^u)2 其中,x为学生密集特征,y^为 PHI-S 归一化后的教师密集特征,Ω为师生共现的空间位置,FS→T为平移等变映射函数。作用:仅在师生共现位置做密集特征匹配,抑制固定模式噪声,引导学生学习教师的密集语义特征。

    • 摘要 token 空间损失:平衡角损失。替代前代的余弦距离损失,解决 “教师摘要特征分布呈锥形、损失失衡” 的问题,核心是角分散归一化,步骤与公式如下:

      • ① 计算师生特征夹角: Θ ( x , y ) = a r c c o s ( x ⊤ y ∥ x ∥∥ y ∥ ) Θ(x,y)=arccos(\frac{x^⊤y}{∥x∥∥y∥}) Θ(x,y)=arccos(x∥∥yxy)
      • ② 计算教师特征的期望方向: μ y = E [ y ] ∥ E [ y ] ∥ μ_y=\frac{E[y]}{∥E[y]∥} μy=E[y]E[y]
      • ③ 计算教师特征的角分散: D i s p ( Θ y ) = E [ Θ ( y , μ y ) 2 ] Disp(Θ_y)=E[Θ(y,μ_y)^2] Disp(Θy)=E[Θ(y,μy)2]
      • ④ 平衡角损失: L a n g l e ( x , y ) = D i s p ( Θ y ) Θ ( x , y ) 2 L_{angle}(x,y)=Disp(Θ_y)Θ(x,y)^2 Langle(x,y)=Disp(Θy)Θ(x,y)2
      • 作用:通过角分散归一化不同教师的 “锥形分布半径”,避免角分散大的教师(如 DINOv3,Disp=2.186)主导损失,实现多教师摘要 token 能力的均衡迁移。
    • 正则化损失:平移等变 MESA 损失。核心公式: L m e s a ( x , x ^ ) = 1 ∣ Ω ∣ ∑ u ∈ Ω ( F S → S ˉ [ L N ( x ) ] u − L N ( x ˉ ) u ) 2 L_{mesa}(x,\hat x)=\frac1{∣Ω∣}∑_{u∈Ω}(F_{S→\bar S}[LN(x)]_u−LN(\bar x)_u)^2 Lmesa(x,x^)=Ω1uΩ(FSSˉ[LN(x)]uLN(xˉ)u)2。其中,x~为 EMA 学生模型的特征,LN为无仿射投影的层归一化,FS→S~为学生到 EMA 学生的平移等变映射。作用:引导模型权重收敛到平坦区域,提升泛化性,进一步抑制固定模式噪声。

    • 损失融合:将Lspatial、Langle、Lmesa按动态权重融合(密集任务提升Lspatial权重,全局任务提升Langle权重),作为最终的蒸馏损失函数。

    • 单一损失双空间精细化损失:针对密集特征和摘要 token 的不同特性设计专属损失,提升蒸馏的精准性;提出平衡角损失:替代前代的余弦距离损失,从根本上解决多教师摘要 token 的损失失衡问题,实现能力均衡迁移;引入平移等变的损失设计:将平移等变映射融入损失函数,让噪声抑制成为蒸馏的固有环节,而非额外步骤;动态损失权重:根据任务类型动态调整各损失的权重,提升模型对不同任务的适配性。

  • SAM3 兼容适配模块:承担SAM3 视觉编码器的无缝替换、SAM3 输入限制的适配、SAM3 缺陷的修复三大任务,是 C-RADIOv4 从 “基础模型” 到 “工业级应用模型” 的关键,解锁了 RADSeg 等开放词汇语义分割的衍生应用,大幅拓展了模型的应用场景。

    • 视觉编码器替换接口:设计与 SAM3 视觉编码器完全兼容的特征输出接口,C-RADIOv4 可直接替换 SAM3 的原生 Perception Encoder,复用 SAM3 的解码器、内存栈和交互逻辑,无需对 SAM3 做任何修改,实现 “即插即用”;
    • SAM3 输入限制适配:通过马赛克增强将多张小图拼接为 SAM3 要求的 1152×1152 固定尺寸,让 C-RADIOv4 在替换编码器后,仍能适配 SAM3 的输入限制;
    • SAM3 缺陷修复:针对 SAM3 官方 demo 中 **“person 查询失效”的问题(github issue 253),通过 C-RADIOv4 的特征表征优化 **,让模型对 “person” 类别的特征阈值更合理,实现该查询的正常掩码生成;
    • ViTDet 模式的兼容:将 C-RADIOv4 的 ViTDet 模式融入 SAM3 的编码器替换,在保持分割性能的同时,大幅提升 SAM3 的推理效率。
    • SAM 适配SAM3 深度兼容:前代仅支持 SAM 的编码器替换,C-RADIOv4 完成了对 SAM3 的深度兼容,适配 SAM3 的全新架构与功能;无缝替换接口:设计了与 SAM3 完全兼容的特征接口,无需修改 SAM3 代码,实现工业级的 “即插即用”;修复 SAM3 的原生缺陷:通过特征表征优化,解决了 SAM3 的 “person 查询失效” 问题,提升了其实用性;效率与性能的平衡:在替换 SAM3 编码器的同时,引入 ViTDet 模式,大幅提升 SAM3 的推理效率,且性能损失可控。

C-RADIOv4 的六大核心模块并非孤立设计,而是形成 “基础支撑→核心蒸馏→性能优化→功能拓展” 的层级协同关系:

  1. 骨干网络模块是所有模块的基础,为蒸馏、分辨率适配、噪声抑制提供特征载体;
  2. 多教师蒸馏适配模块是核心,依托分辨率自适应模块的多分辨率样本,实现异构教师能力的精准迁移;
  3. 噪声抑制与鲁棒性增强模块损失函数优化模块是性能优化的双核心,为蒸馏适配模块提供损失引导和噪声过滤,提升特征质量;
  4. SAM3 兼容适配模块是功能拓展,依托骨干网络的 ViTDet 模式和蒸馏适配模块的特征能力,实现工业级的应用兼容。
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐