
基本信息论文MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing作者Yimin Wei1,2; Aoran Xiao2; Hongruixuan Chen1,2; Junshi Xia2; Naoto Yokoya1,2单位1 The University of Tokyo东京大学2 RIKEN AIP理化学研究所 先进智能研究中心下载https://arxiv.org/abs/2603.17528代码https://github.com/Jimmyxichen/MM-OVSeg数据https://huggingface.co/YiminJimmy/MM-OVSeg/tree/mainMM-OVSeg 开放词汇分割这篇论文的核心出发点是针对现实遥感场景中云雾干扰导致光学信息丢失的痛点通过融合具有全天候穿透力的 SAR 图像与光学图像利用视觉语言大模型的强大泛化性解决在恶劣天气下对未知类别地物Open-Vocabulary进行精准识别与分割的难题。Q什么是SAR图像它有什么特点。ASAR合成孔径雷达是一种通过主动发射微波并接收回波成像的雷达系统。它具有全天候成像能力能穿透云雾、黑夜和霾捕捉地物的结构特征和物理属性。02 -OVSeg 技术与方法跨模态统一过程CMU该过程旨在打破模态壁垒通过 25,087 对无标签的 RGB-SAR 图像对利用 InfoNCE 对比损失函数进行无监督预训练。在该阶段RGB DINO 编码器保持冻结而 SAR DINO 编码器通过学习将雷达特征对齐到已有的视觉基础模型空间中使模型能够像理解光学图像一样提取 SAR 的密集局部特征。多模态密集特征聚合在全模型训练阶段DEF 模块首先从冻结的 RGB DINO 和预训练好的 SAR DINO 编码器中提取多尺度特征。这些特征经过特定层的卷积投影统一维度后通过元素级加法进行融合从而将光学图像的光谱语义与 SAR 图像的结构化回波信息有机整合为后续的像素级分割提供丰富的空间线索。全局与局部特征的文本对齐为了实现开放词汇识别模型利用 CLIP 视觉编码器提取全局语义并与 CLIP 文本编码器生成的类别嵌入进行相似度计算。DEF 模块通过残差增强机制将全局视觉-文本相似度与密集的局部相似度进行拼接融合这不仅保留了 CLIP 强大的语义泛化能力还利用多模态特征提升了在复杂环境下如云雾遮挡的定位精度。03 -OVSeg 实验与结果为了全方位验证 MM-OVSeg 的性能论文通过下 Table 1 构建了涵盖清空、薄云、厚云及跨地域泛化等 6 种严苛的实验基准。Table 2 的定量结果显示MM-OVSeg 在所有设定下均取得 SOTA 性能其平均 mIoU 达到 51.7%大幅领先于第二名 GSNet 的 45.6%。上图的定性可视化结果直观证明在光学图像受云雾严重遮挡时现有方法大多失效而 MM-OVSeg 凭借对 SAR 结构信息的成功提取依然能实现与GT高度一致的精准分割。通过热力图直观展示了 DEF 模块在不同融合阶段的演进过程。可视化结果表明CLIP 视觉编码器提取的全局特征 z_rgb 虽能捕捉语义但定位较为粗糙且易受云雾干扰 而经过双编码器融合后的最终表示 h_fuse不仅在空间定位上更加精细还能使“已见过”和“从未见过”的类别如水体、道路与文本提示实现更精准的对齐。表 3 和表 4 通过消融实验验证了模型各组件及损失函数的有效性。表 3 结果显示引入 DEF 模块使 mIoU 提升了 9.1%而结合 CMU 模块后性能进一步达到 73.1%证明了多模态融合与跨模态对齐的互补性。表 4 则对比了不同的对齐损失函数实验证明 InfoNCE 损失在促进 SAR 与 RGB 特征空间一致性方面表现最强显著优于 MSE 和 L1 损失。04 MM-OVSeg 创新与总结首创全天候遥感开放词汇框架针对遥感图像易受云雾干扰的痛点首次提出融合光学与 SAR 数据的开放词汇分割OVS框架 MM-OVSeg 。利用 SAR 的穿透力弥补光学信息的缺失解决了恶劣天气下对未知类别地物的识别难题 。跨模态特征空间的精准对齐 (CMU)通过跨模态统一过程CMU在 2.5 万对无标签 RGB-SAR 图像上进行对比学习预训练 。该模块成功将 SAR 的特征空间对齐到预训练视觉基础模型如 DINO中打破了模态壁垒 。全局语义与局部细节的高效融合 (DEF)设计了双编码器融合模块DEF同时集成 CLIP 的全局语义泛化性与 DINO 的像素级局部细节 。通过多尺度特征融合与残差增强显著提升了模型对“未见过”地物类别的分割精度。本文提出了遥感领域首个融合光学与SAR数据的开放词汇分割框架MM-OVSeg旨在解决云雾遮挡导致的光学信息缺失难题。通过跨模态统一CMU和双编码器融合DEF模块该方法成功实现了雷达与光学特征的精准对齐及全局语义与局部细节的有机整合。多场景实验证明MM-OVSeg在鲁棒性、泛化能力及分割精度上均显著优于现有的最先进模型。