医疗场景下医学视觉-语言预训练模型速览:medsiglip-448
一、模型概述
MedSigLIP 是 Google 于 2025 年 7 月 9 日发布的医学视觉-语言预训练模型,其本质为 SigLIP-400M 在医疗场景下的定制版本。模型采用双塔结构:
-
视觉编码器:4 亿参数的 Vision Transformer,输入分辨率 448×448;
-
文本编码器:4 亿参数的 Text Transformer,最大文本长度 64 token。
通过联合对比学习,将医学图像与对应文本映射到同一语义空间,从而为下游任务提供高质量的图像-文本联合嵌入。
二、训练数据
模型训练数据分为两大来源:
-
公开数据集:MIMIC-CXR、Slake-VQA、PAD-UFES-20、SCIN、TCGA、CAMELYON、PMC-OA、Mendeley Digital Knee X-Ray 等;
-
内部及合作机构提供的去标识化私有数据:涵盖放射科 CT/MRI、眼科 EyePACS 眼底照、皮肤科临床与皮肤镜图像、病理 H&E/IHC 全片扫描等。
全部数据均经严格去标识化处理,以保护患者隐私。
三、能力定位与使用建议
MedSigLIP 的定位是“医学图像理解而非生成”。推荐场景包括:
-
数据高效的图像分类(线性探针、微调);
-
零样本分类;
-
语义图像检索。
若应用需要文本生成能力,Google 建议转向 MedGemma。
四、快速上手示例
开发者可通过 Hugging Face Transformers 一行命令加载模型:
from transformers import AutoModel, AutoProcessor
model = AutoModel.from_pretrained("google/medsiglip-448")
processor = AutoProcessor.from_pretrained("google/medsiglip-448")
示例代码同时给出了如何对图像进行 448×448 bilinear 缩放,并计算图文相似度概率。
五、技术规格与性能
-
输入:448×448 归一化图像(-1~1),最多 64 token 文本;
-
输出:图像嵌入、文本嵌入、图文余弦相似度;
-
训练框架:JAX on TPU;
-
零样本评估:在胸部 X 光、皮肤病、眼科、病理学 4 大模态 23 项任务上超越或逼近 ELIXR、Derm Foundation、Path Foundation 等基线模型;
-
例如,Chest X-Ray 零样本平均 AUC 0.844(ELIXR 0.824);
-
Dermatology 零样本 AUC 0.851;Pathology 零样本平均 AUC 0.870。
-
六、使用限制与合规要求
-
模型本身仅为开发工具,不直接提供任何医疗功能;
-
任何面向临床的产品必须经过独立验证并满足当地监管要求;
-
开发者需关注验证数据的代表性偏差及潜在的数据泄露风险;
-
使用条款受 Health AI Developer Foundations 协议约束。
七、核心技术汇总表

更多推荐

所有评论(0)