大模型微调玩转变化检测?3个模型实测,结果惊呆!
前面几篇文章介绍了基于SAM3以及Qwen3VL这类大模型的应用到实例分割和目标检测的本地化微调。然后也有一些同行联系我咨询能不能做「变化检测」一开始没有当一回事后面发现有好几个同行都在咨询「变化检测」相关的问题所以就决定花点时间看一下这方面的内容其实这个任务在我们行业听的比较多比如建筑变化或者是耕地变化这些场景但是相对于「实例分割」和「目标检测」这两类任务相对小众一些不过主要是在自然资源行业需求多一些。我次我验证的「变化检测」模型包含如下几个一、基于SAM3的OmniOVCD这个方法其实比较符合我一开始的思路就是尽量依赖现有视觉大模型的预训练成果然后来进行变化的提取而OmniOVCD的则是利用了SAM3的零样本分割能力先进行目标地物类型的分割然后再将两个时相经过SAM3的影像输出的三个InstanceLogits、Semantic Logits和Presence Score进行了融合从而得到一个最终的变化结果由于没有开源代码所以我只是基于论文做了一些简单的复现的尝试主要存在两个方面的问题1、实例分割存在一定的误差如果使用原始的SAM3对应的实例分割的效果不是很好以建筑为例的分割显示如果使用原始的SAM3模型对影像进行分割依然会出现很多建筑被漏掉的问题然后我使用了一些数据集对SAM进行了微调整体的分割效果好了很多但是这样的微调还是挺大的由于分割的数据集都特别大所以在当前的条件下根本没有办法进行全量的SAM3微调只能够使用SAM3LoRA微调的模式来进行微调。2、生成的细小的变化太多虽然微调提高了分割的效果但是在分割要素的边界处依然存在很多细碎的点而且经过简单融合之后其实这个问题并没有得到改善还是会存在很多细碎的差异对象但是这些差异对象很多是由于影像本身的颜色、视角、外部条件导致的一些问题。所以我当时觉得最好还是要对变化检测做一个可以「端到端」训练的模型同时这个模型又有已经预训练好的主干模型这样可以利用这些预训练的成果所以当时就考虑使用SAM3的ViT编码器或者DINOv3来作为主干因为DINOv3有一个使用遥感数据预训练过的模型sat493m版本如下所示就是将DINOv3的输出经过PCA之后得到的特征图他的特征表达能力还是很强的。所以基于这个思路也就是可以冻结SAM3的ViT编码器和DINOv3作为特征提取的主干然后对输出在做一个差异特征提取然后再对差异提取的特征加一个UNet风格的解码器来输出一个二值分割的图就可以了。在差异特征提取这个部分我尝试了直接两个特征做差、两个特征的双向交叉注意力等方式但是最后的结果都很不好随着训练epoch的增加IOU竟然都变为0了所以到此放弃了自己搭架构训练的方法还是找一个成熟点的框架来做这个时候还是发现了一个和我想法类似的成果。二、基于DINOv3的ChangeDINO从架构上看这个方法也是采用的变化检测中常用的双分支的孪生网络架构但是在主干上并没有直接选择DINOv3,而是选择了MobileNet这种轻量化的框架作为主干DINOv3只是作为特征增强融合训练的时候也都是冻结的。如下是使用了S2Looking建筑变化分割数据集经过100个epoch左右的训练但是总体的IoU一直上不去一直停留在45左右上不去所以后面也就停下来了如下是使用训练出来的权重来进行变化检测的结果(Pred)和样本(Label)的对比。总体的情况其实并不太理想当然看一些论文看大部分的论文的结果基本上S2Looking效果都比较差。所以到这里我基本上已经放弃了基于这些预训练大模型做「变化检测」的思路转而在看其他的一些SOTA的模型。三、基于视频小模型的Change3D这篇文章开篇就直接指出了当前基于双路分支的孪生网络架构来进行「变化检测」的建模思路是错误的存在两个方面的缺陷1、2D图像编码器的优化目标是提取单帧的空间语义与 “捕捉帧间变化” 的核心任务完全无关编码过程会丢失大量与变化相关的关键信息后续的变化提取器只能在信息损失后的特征上做后处理性能存在天然上限。2、模型 90% 以上的参数量集中在与任务无关的图像编码器核心的变化建模环节参数量占比极低导致模型学习重心偏离变化检测的核心目标。而「变化检测」的本质是建模同一空间场景在时序维度上的语义变化所以「变化」检测本质上是一个3D问题2D的空间1D的时间所以这也是这个模型为什么叫Change3D而视频建模的核心能力正是同时捕捉帧内的空间语义、帧间的时序关联与动态变化双时相图像对本质上是一个只有 2 帧的 「微型视频」。Change3D 具体的创新是将双时相图像对视作一个「微型视频」的两帧在两帧之间插入可学习的感知帧Perception Frame通过视频编码器直接建模帧间时空交互和输出的二值结果或者语义结果对齐从而在训练中端到端的学习这些变化信息。这个模型框架使用了X3D视频编码器预训练的权重X3D_L.pyth大小仅为50M然后使用S2Looking数据集经过80epoch偏少只是为了做有效性验证的训练得到如下的变化检测效果这也是我这么长时间验证以来取得的最好的变化检测的效果虽然还是一个参数不大的小模型对于大模型我们也不要盲目的依赖有时候甚至是为了用而用更多的时候还是需要从第一性原理出发当然对于这个模型后面我也会尝试将当前的视频小模型尝试换成一个视频大模型看看对应的效果怎么样现在很多「世界模型」本质上也是个「视频生成模型」。而且由于模型参数比较小一个显而易见的好处就是推理的速度很快如下是使用A10进行的验证推理时的速度显示同时目前的大模型在各行各业的应用中并不是「万金油」不可能包含所有的任务特定行业的任务需要做针对性的建模构建端到端的模型再进行训练所以最近我的认知也在刷新模型构建能力也是非常关键的能力。AI行业迎来前所未有的爆发式增长从DeepSeek百万年薪招聘AI研究员到百度、阿里、腾讯等大厂疯狂布局AI Agent再到国家政策大力扶持数字经济和AI人才培养所有信号都在告诉我们AI的黄金十年真的来了在行业火爆之下AI人才争夺战也日趋白热化其就业前景一片蓝海我给大家准备了一份全套的《AI大模型零基础入门进阶学习资源包》包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。有需要的小伙伴可以V扫描下方二维码免费领取人才缺口巨大人力资源社会保障部有关报告显示据测算当前****我国人工智能人才缺口超过500万****供求比例达1∶10。脉脉最新数据也显示AI新发岗位量较去年初暴增29倍超1000家AI企业释放7.2万岗位……单拿今年的秋招来说各互联网大厂释放出来的招聘信息中我们就能感受到AI浪潮比如百度90%的技术岗都与AI相关就业薪资超高在旺盛的市场需求下AI岗位不仅招聘量大薪资待遇更是“一骑绝尘”。企业为抢AI核心人才薪资给的非常慷慨过去一年懂AI的人才普遍涨薪40%脉脉高聘发布的《2025年度人才迁徙报告》显示在2025年1月-10月的高薪岗位Top20排行中AI相关岗位占了绝大多数并且平均薪资月薪都超过6w在去年的秋招中小红书给算法相关岗位的薪资为50k起字节开出228万元的超高年薪据《2025年秋季校园招聘白皮书》AI算法类平均年薪达36.9万遥遥领先其他行业总结来说当前人工智能岗位需求多薪资高前景好。在职场里选对赛道就能赢在起跑线。抓住AI风口轻松实现高薪就业但现实却是仍有很多同学不知道如何抓住AI机遇会遇到很多就业难题比如❌ 技术过时只会CRUD的开发者在AI浪潮中沦为“职场裸奔者”❌ 薪资停滞初级岗位内卷到白菜价传统开发3年经验薪资涨幅不足15%❌ 转型无门想学AI却找不到系统路径83%自学党中途放弃。他们的就业难题解决问题的关键在于不仅要选对赛道更要跟对老师我给大家准备了一份全套的《AI大模型零基础入门进阶学习资源包》包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。有需要的小伙伴可以V扫描下方二维码免费领取