|
TGRS 2026 | RSIDEA团队提出DG-CroSeg:以零样本相对深度为域不变几何先验的高分辨率卫星遥感影像跨域语义分割 | |||||||||||||||||||||||||||||||||||||||
|
|
||||||||||||||||||||||||||||||||||||||||
RSIDEA团队提出 DG-CroSeg,一种以零样本相对深度(rDepth)为域不变几何先验的高分辨率卫星遥感影像跨域语义分割框架。区别于既有方法主要在像方寻求跨域不变性,本研究在物方寻求地物的跨域线索,即地物的相对高低关系与空间连续性不随传感器、季节与地域变化而改变。该方法针对跨域语义分割中“目标域数据难以获取”与“大规模基础模型计算开销高”两个关键问题,构建了多尺度特征对比学习与深度引导语义优化相结合的统一框架,在训练全程不接触目标域数据的零样本域泛化设定下,取得了与需要目标域图像的SOTA无监督域适应方法相当甚至更优的分割精度。 相关研究成果 “Relative Depth-Guided Cross-Domain Semantic Segmentation for High-Resolution Satellite Remote Sensing Images” 已发表于遥感领域国际权威期刊 IEEE Transactions on Geoscience and Remote Sensing (TGRS)。该研究在 LoveDA、SUSAN(自建环北极跨季节数据集)与 Urban2WHU Building 三个典型跨域语义分割数据集上均取得了优于主流无监督域适应与域泛化方法的分割性能。 代码已开源(https://github.com/ArthasMil/DGCD) 论文 DOI:10.1109/TGRS.2026.3701909 研究背景 卫星遥感影像语义分割是高分辨率遥感智能解译中的重要任务。然而,受传感器类型、成像条件与地域特征差异的影响,遥感影像存在显著的跨域分布偏移,导致在源域上训练的分割模型在未见目标域上性能大幅下降。无监督域适应(UDA)方法虽能缓解该问题,但训练时依赖目标域图像;而借助大规模基础模型实现域泛化(DG)又会带来高昂的计算开销,限制了实际部署。 在星载对地观测中,深度、高程等物方几何信息是语义理解的重要参考:建筑边缘既是语义边界,也是深度突变边界,语义过渡处对应深度跳变,语义连续区域则呈现平滑的深度分布。这种“语义—几何”耦合关系为跨域语义分割提供了稳定的空间先验。
Depth Anything Model(DAM)可对任意输入图像零样本生成相对深度(rDepth)图,且在卫星下视成像条件下,地物间的相对高低关系与空间连续性对传感器变化保持不变,使 rDepth 成为天然的域不变特征。然而,rDepth在卫星遥感影像跨域语义分割中的应用尚未被充分探索。 因此,如何将零样本相对深度这一物方域不变几何先验有效引入分割网络,使其在增强光学特征表达与边界定位的同时不遮蔽光谱与纹理线索,是提升高分辨率卫星遥感影像跨域语义分割性能的关键问题。 研究方法 针对上述问题,本研究提出相对深度引导的跨域语义分割框架 DG-CroSeg,将零样本相对深度作为域不变几何先验引入跨域语义分割。该框架以光学影像及其经 DAM 零样本生成的 rDepth 图为输入,核心由三部分构成:双编码器特征提取、多尺度特征对比模块(MFCM)与深度引导的语义优化模块(DGSR),可兼容绝大多数编码器—解码器架构。 DG-CroSeg 的核心思想是:光学影像经主编码器提取四尺度特征,rDepth 图经轻量编码器提取同分辨率的深度特征;MFCM 在四尺度光学—深度特征对上计算对比损失以增强模态一致性;DGSR 则利用 rDepth 浅层特征对初始语义概率图进行残差式优化,精化边界定位。
1. 多尺度特征对比模块 MFCM rDepth 完全由光学影像派生,并非独立模态。传统多模态对比学习对称地对待两种信息源,若任由这一“衍生半模态”主导学习过程,光学特征将退化为深度表征,丢失语义判别所需的光谱与纹理线索。为此,MFCM 引入可学习的非对称融合权重,使深度先验仅用于“增强”而非“遮蔽”光学表达。 具体地,光学与 rDepth 特征分别经独立投影头映射至统一嵌入空间后,以可学习标量权重 α=σ(α_"logit" )进行加权融合:F_"enh" ^k=(1-α)⋅F_(I,"proj" )^k+α⋅F_(D,"proj" )^k。对比计算在增强特征与投影光学特征之间进行:同一样本同一空间位置构成正样本对,样本内其他空间位置采样构成负样本对,总对比损失为四个尺度的加权和。MFCM 仅在训练阶段生效,推理时零开销。
2. 深度引导的语义优化模块 DGSR 深层语义特征已在初始 logits 中编码了类别级信息,此处再叠加深层深度特征会重新引入语义歧义;而 rDepth 浅层特征编码边缘、角点、表面不连续等局部几何基元,具有跨场景的域不变性。DGSR 借鉴多视立体重建的几何一致性思想,仅以浅层深度特征作为语义概率图的残差校正,精化边界而不推翻光学分支的语义决策。 具体地,初始 logits 与对齐后的浅层 rDepth 特征分别经 3×3 卷积分支统一维度,拼接后经两级卷积生成深度引导校正项 ΔY,再以 sigmoid 约束的可训练标量加权,残差叠加至初始 logits:Y_"refined" =Y_"mask" +ω_r⋅ΔY该模块为非侵入式设计,可无缝接入绝大多数多尺度特征解码器。
3. 联合训练目标与零开销推理 训练阶段,初始与优化后的 logits 接受联合监督,并与多尺度对比损失组合为总损失: L_"total" =L_"sem" +γL_"cont" =L_"CE" (Y_"mask" ,G)+L_"CE" (Y_"refined" ,G)+γ∑_(k=1)^4▒w_k L^k。推理阶段仅保留光学编码器、解码器与 DGSR 优化分支,对比分支完全移除,在几乎不增加计算量的前提下获得跨域性能增益——以 ConvNeXt 为骨干网络时 FLOPs 仅增加约 16%,推理速度达 45.67 张/秒,在精度、效率与推理速度间取得良好平衡。 实验数据 本研究在三个具有代表性的跨域语义分割数据集上开展实验验证,覆盖城市—乡村跨域、环北极跨季节与跨传感器跨地域等多类复杂场景。 LoveDA:面向跨域语义分割的公开基准,覆盖南京、常州、武汉的城市与乡村场景(0.3 m 分辨率),共 7 类地物,提供城市→乡村(U2R)与乡村→城市(R2U)两个跨域子集。 SUSAN(自建):环北极星载亚米级土地覆盖制图数据集,覆盖芬兰、瑞典、俄罗斯 7 座城市,源自吉林一号影像(0.5/0.75 m),包含积雪覆盖等复杂跨季节场景,标注 9 类土地覆盖。 WHU Building:用于跨数据集泛化验证——模型在 LoveDA Urban 上训练,直接泛化至新西兰基督城航拍影像,构建跨传感器、跨地域、建筑风格迥异的建筑/背景二分类泛化场景。 实验结果 实验结果表明,DG-CroSeg 在 LoveDA 城市→乡村与乡村→城市任务、SUSAN环北极跨季节场景、LoveDA Urban→WHU Building 跨传感器泛化场景下均达到与需要目标域图像的SOTA无监督域适应方法相当甚至更优的分割精度。其中道路、建筑物等结构化地物提升尤为显著,印证了 rDepth 结构先验的跨域稳定性。
鲁棒性方面,强噪声与模糊扰动下本方法仍保持 67.54% 的建筑 IoU,显著优于 DINOv2、SAM2.1 等基础模型基线;消融实验证实 MFCM 与 DGSR 单独使用均有稳定增益、联合使用最优,二者在解码器前后形成互补。
研究结论 DG-CroSeg 在城市—乡村跨域、环北极跨季节与跨传感器泛化三类场景中均超越或持平需要目标域数据的 SOTA 无监督域适应方法,且推理几乎零额外开销。实验证实,零样本相对深度作为物方域不变几何先验,能够在不遮蔽光谱与纹理线索的前提下,稳定增强跨域语义分割的边界定位与结构表达,为无目标域数据条件下的遥感智能解译提供了新的技术路径。 版权与联系方式 相对深度引导的跨域语义分割框架(DG-CroSeg)方法版权归智能化遥感数据提取分析与应用研究组(RSIDEA)所有,研究成员隶属于武汉大学测绘遥感信息工程全国重点实验室(LIESMARS)和信息工程大学,仅限于学术目的使用,任何商业用途均被禁止。 如果您有任何问题或反馈,请联系: 孙咏琪 博士生: sunyq2002@163.com 宿钰 讲师: suyu417@whu.edu.cn 供稿:孙咏琪 排版:柯天 审核:吴娇、刘寅贺 |
||||||||||||||||||||||||||||||||||||||||