一、模型概述

MedSigLIP 是 Google 于 2025 年 7 月 9 日发布的医学视觉-语言预训练模型,其本质为 SigLIP-400M 在医疗场景下的定制版本。模型采用双塔结构:

  • 视觉编码器:4 亿参数的 Vision Transformer,输入分辨率 448×448;

  • 文本编码器:4 亿参数的 Text Transformer,最大文本长度 64 token。
    通过联合对比学习,将医学图像与对应文本映射到同一语义空间,从而为下游任务提供高质量的图像-文本联合嵌入。

二、训练数据

模型训练数据分为两大来源:

  1. 公开数据集:MIMIC-CXR、Slake-VQA、PAD-UFES-20、SCIN、TCGA、CAMELYON、PMC-OA、Mendeley Digital Knee X-Ray 等;

  2. 内部及合作机构提供的去标识化私有数据:涵盖放射科 CT/MRI、眼科 EyePACS 眼底照、皮肤科临床与皮肤镜图像、病理 H&E/IHC 全片扫描等。
    全部数据均经严格去标识化处理,以保护患者隐私。

三、能力定位与使用建议

MedSigLIP 的定位是“医学图像理解而非生成”。推荐场景包括:

  • 数据高效的图像分类(线性探针、微调);

  • 零样本分类;

  • 语义图像检索。
    若应用需要文本生成能力,Google 建议转向 MedGemma。

四、快速上手示例

开发者可通过 Hugging Face Transformers 一行命令加载模型:

from transformers import AutoModel, AutoProcessor
model = AutoModel.from_pretrained("google/medsiglip-448")
processor = AutoProcessor.from_pretrained("google/medsiglip-448")

示例代码同时给出了如何对图像进行 448×448 bilinear 缩放,并计算图文相似度概率。

五、技术规格与性能

  • 输入:448×448 归一化图像(-1~1),最多 64 token 文本;

  • 输出:图像嵌入、文本嵌入、图文余弦相似度;

  • 训练框架:JAX on TPU;

  • 零样本评估:在胸部 X 光、皮肤病、眼科、病理学 4 大模态 23 项任务上超越或逼近 ELIXR、Derm Foundation、Path Foundation 等基线模型;

    • 例如,Chest X-Ray 零样本平均 AUC 0.844(ELIXR 0.824);

    • Dermatology 零样本 AUC 0.851;Pathology 零样本平均 AUC 0.870。

六、使用限制与合规要求

  • 模型本身仅为开发工具,不直接提供任何医疗功能;

  • 任何面向临床的产品必须经过独立验证并满足当地监管要求;

  • 开发者需关注验证数据的代表性偏差及潜在的数据泄露风险;

  • 使用条款受 Health AI Developer Foundations 协议约束。

七、核心技术汇总表

在这里插入图片描述

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐