文章:MambaSeg: Harnessing Mamba for Accurate and Efficient Image-Event Semantic Segmentation

代码:https://github.com/CQU-UISC/MambaSeg

单位:重庆大学


一、问题背景:单模态视觉的“致命短板”

语义分割的核心是让机器给图像中每个像素“贴标签”(比如区分行人、车辆、道路),但现有方案始终逃不开两个困境:

  • RGB图像方案:依赖普通相机,颜色和纹理信息丰富,但遇到高速运动(比如超车时)会产生运动模糊,低光或强光对比场景(比如隧道出入口)下识别准确率暴跌, latency(延迟)还高;

  • 事件相机方案:不拍完整图像,只记录像素亮度变化,反应快(微秒级)、抗强光低光,但没有颜色和细节,单独用根本无法完成精细分割;

  • 现有融合方案:要么用Transformer架构导致计算量暴增(车上算力扛不住),要么只关注“空间对齐”(比如把图像和事件的位置对应),忽略了事件数据的“时间动态”(比如物体移动轨迹),融合效果差强人意。

简单说,单一模态“撑不起”复杂场景,而现有融合方案又“既慢又不准”。

二、方法创新:Mamba+双维度融合,兼顾精准与高效

MambaSeg的核心思路的是“扬长避短”——用高效架构解决算力问题,用双维度融合解决精准问题,具体有两大创新:

1. 双分支Mamba编码器:算力效率翻倍

放弃了传统Transformer的平方级计算复杂度,采用最新的Mamba架构(线性复杂度),设计了两条并行的编码分支:一条专门处理RGB图像,捕捉纹理细节;另一条处理事件数据,捕捉时间动态。既能高效处理长距离依赖(比如远处车辆和近处行人的关联),又能大幅降低计算成本,车上的嵌入式设备也能轻松运行。

2. 双维度交互模块(DDIM):融合精度拉满

专门解决“图像+事件”融合的模糊问题,相当于给两个模态加了“双向翻译器”,分为两个核心组件:

  • 空间融合(CSIM):把图像的纹理细节(比如道路标线)和事件数据的边缘结构(比如车辆轮廓)精准对齐,减少空间上的识别模糊;

  • 时间融合(CTIM):利用事件数据的时间序列特性(比如行人移动轨迹),对齐图像的静态信息,避免因运动导致的“认错目标”(比如把快速移动的自行车当成摩托车)。

简单说,MambaSeg既懂“空间上哪里有什么”,又懂“时间上这些东西在怎么动”,融合效果自然更优。

三、实验结果:刷新SOTA,精度效率双第一

研究者在两个权威驾驶数据集(DDD17和DSEC)上做了严格测试,结果相当亮眼:

  • 精度领先:DDD17数据集上mIoU(分割准确率核心指标)达到77.56%,比之前最好的EISNet高2.53%;DSEC数据集上mIoU75.10%,领先2.03%,小物体(比如交通标志、行人)分割更精准;

  • 效率碾压:仅2544万参数(比EISNet少近1000万),计算量15.59G(低于多数Transformer方案),在保证精度的同时,算力需求大幅降低;

  • 场景适配强:在低光、高速运动场景下,比传统方案减少30%以上的识别错误,尤其适合自动驾驶的复杂路况。

四、优势与局限:实际应用需关注这些点

核心优势

  1. 兼顾精准与高效:既突破了现有方案的精度天花板,又解决了车载场景的算力限制,是“能落地的SOTA”;

  2. 鲁棒性拉满:双维度融合让其在恶劣环境(低光、高速、强对比)下表现稳定,弥补了传统方案的场景短板;

  3. 通用性强:除了自动驾驶,还能迁移到机器人导航、无人机巡检等需要实时语义分割的场景。

现存局限

  1. 事件数据需要先转化为“体素网格”格式,预处理环节比纯图像方案稍复杂;

  2. 目前仅在驾驶场景验证,其他场景(比如室内机器人)的适配还需进一步测试;

  3. 对硬件的兼容性仍需优化,部分老旧车载设备可能需要适配调整。

五、一句话总结

MambaSeg用“Mamba架构+空间-时间双维度融合”,解决了复杂场景下语义分割“又慢又不准”的痛点,为自动驾驶、机器人等领域提供了更高效、更鲁棒的多模态感知方案,让机器在恶劣环境下也能“看得清、反应快”!

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐