文章:Bilevel Layer-Positioning LoRA for Real Image Dehazing

代码:https://github.com/YanZhang-zy/BiLaLoRA

单位:中山大学、大连理工大学、西安电子科技大学


一、问题背景

当下基于深度学习的图像去雾模型,大多是用人造合成雾图训练的,虽然在合成数据集上表现亮眼,但面对复杂的真实雾景时,效果会大幅下降,存在明显的“合成-真实”域间隙问题。

而想要让模型适配真实雾景,还面临两个核心痛点:

  1. 无有效无监督训练机制:真实场景中很难获取“同一张图的雾图+清晰原图”配对数据,传统依赖参考图的训练方式难以落地,模型缺精准的训练指导;

  2. 全模型微调成本过高:即便有训练思路,想要让模型适配真实场景,往往需要更新所有网络参数,带来极高的计算和内存消耗,无法实现快速部署和场景切换。

这些问题让AI去雾模型在真实世界的应用大打折扣,成为行业落地的关键阻碍。

二、方法创新

为解决上述痛点,研究团队提出了“H2C无监督损失函数+BiLaLoRA双层定位LoRA”的组合方案,从训练指导和模型调优两个维度实现突破,两大核心创新点相辅相成:

这篇文章没有网络流程图。

1. Haze-to-Clear文本引导损失(H2C):无参考图也能训模型

借助CLIP模型的跨模态理解能力,将去雾任务重构为潜空间的语义对齐问题,彻底摆脱对清晰参考图的依赖:

  • 用CLIP提取“有雾的照片”(负向)和“清晰的照片”(正向)的文本特征,定义从雾到清的理想语义变换方向;

  • 让去雾模型处理雾图后,输出图像的特征变换方向与文本定义的方向对齐,用语义层面的去雾代替传统的像素层面比对;

  • 仅需修改文本提示(如“夜晚有雾的照片”),就能适配白天、夜晚等不同雾景,泛化性拉满。

简单来说,就是让模型理解“去雾的本质是把图像的语义从雾蒙蒙变成清清爽爽”,而非单纯修改像素。

2. 双层定位LoRA(BiLaLoRA):低成本精准调优模型

针对全模型微调成本高的问题,对经典轻量调优技术LoRA进行创新,实现自动找瓶颈层+轻量微调,无需人工干预:

  • 突破传统LoRA人工选择调优层的局限,将层选择与权重优化整合为双层优化问题,让模型自动打分并定位对去雾最关键的网络瓶颈层;

  • 分两阶段训练:先通过双层优化对所有候选层排序,筛选出效果最优的Top-k层;再仅对这些层进行LoRA轻量微调,冻结原模型核心参数;

  • 保留LoRA“即插即用”的特性,可针对不同场景(如白天、夜晚)训练专属轻量适配器,实现快速场景切换。

三、实验结果

研究团队在RTTS、URHI、Fattal三大真实雾图数据集开展实验,还在无人机视角雾图(HazyDet)、浓雾场景(Dense-Haze/O-Haze)中验证泛化性,对比了主流的合成去雾、通用图像复原、真实去雾三类模型,结果表现亮眼:

1. 定量指标领先

在FADE(雾密度)、BIQME(盲图像质量)、Entropy(熵)、MUSIQ(多尺度图像质量)四大无参考评价指标上,BiLaLoRA均取得最优或次优成绩,平均MUSIQ达到64.40,显著超越现有SOTA方法。

2. 训练效率大幅提升

与全模型微调相比,BiLaLoRA的训练时间直接减少77.70%,参数量、计算量和推理耗时几乎无增加,实现“效果相当,成本大降”。

3. 泛化能力超强

  • 模型无关:适配MSBDN、DEA等多种不同结构的去雾模型,均能有效提升性能;

  • 跨域稳定:对不同合成数据集预训练的模型,均能实现稳定的性能提升;

  • 极端场景适配:在浓雾、无人机视角、夜晚雾景等挑战性场景中,仍能保持清晰的去雾效果,无偏色、过去雾、细节丢失等问题。

4. 超参数最优解明确

实验验证,选择3个核心层进行LoRA微调时效果最佳,再多增加层会出现边际效益递减,还会造成参数冗余。

四、优势与局限

核心优势

  1. 无监督训练,落地性强:H2C损失函数摆脱对配对真实数据的依赖,仅通过文本提示就能实现不同雾景的训练指导;

  2. 轻量高效,部署友好:BiLaLoRA自动定位瓶颈层,仅微调少量参数,大幅降低训练和推理成本,支持即插即用的场景适配器;

  3. 通用性广,适配性高:模型无关,可无缝对接现有各类去雾模型,跨场景、跨数据集的泛化能力优异;

  4. 效果优质,细节保真:在清雾的同时,能更好地保留图像细节和自然色彩,解决了传统方法偏色、过去雾、产生伪影等问题。

现存局限

  1. 虽能适配不同雾景,但针对极端恶劣的雾天(如强浓雾、雾霾混合),部分细节的恢复效果仍有提升空间;

  2. 目前仅针对图像去雾任务优化,尚未拓展到视频去雾场景,面对视频的时序一致性问题还需进一步研究;

  3. 双层优化的初始阶段,仍存在少量的计算开销,虽远低于全模型微调,但针对边缘端超轻量部署,还可进一步精简。

五、一句话总结

该研究提出的H2C文本引导损失与BiLaLoRA双层定位LoRA组合方案,彻底解决了真实图像去雾的无监督训练和高成本微调问题,以极低的计算开销实现了超越SOTA的去雾效果,且兼具通用性和部署友好性,为真实场景的图像去雾落地提供了全新的高效解决方案,也为低层次计算机视觉任务的域自适应研究提供了新思路。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐