NeurIPS | VMamba:基于状态空间模型的视觉骨干网络
一.论文信息论文标题:VMamba: Visual State Space Model论文作者Yue LiuYunjie TianYuzhong ZhaoHongtian YuLingxi XieYaowei WangQixiang YeJianbin JiaoYunfan Liu发表会议 NeurIPS2024论文代码https://github.com/MzeroMiko/VMamba二.论文主要贡献1提出 VMamba 视觉骨干网络论文提出 VMambaVisual Mamba一种基于 State Space Model (SSM) 的视觉模型用于视觉表示学习。VMamba 将 SSM 的长序列建模能力引入视觉任务中使视觉模型能够以 线性复杂度处理图像序列。2提出 2D Selective Scan (SS2D)为了让 SSM 适用于二维图像数据作者提出2D Selective ScanSS2D其核心思想是1.将二维图像 patch 转换为多个序列2.沿多个扫描路径处理3.再重新组合为二维特征图论文指出SS2D 填补了一维扫描方法与面向视觉数据的二维遍历需求之间的技术鸿沟。3在多个视觉任务中取得优秀表现VMamba 在多个任务中表现优异包括1.图像分类2.目标检测3.语义分割并且在多个任务上 优于 Swin Transformer 和 ConvNeXt 等主流视觉模型。三.论文创新点论文的核心创新主要体现在以下三个方面3.1.创新一提出 SS2D2D Selective Scan传统 SSM 只能处理 1D 序列。作者提出 SS2D 模块使其可以处理 2D 图像数据。SS2D 的主要流程包括1 Cross-Scan2. Selective ScanS6 block3.Cross-Merge3.2.创新二四方向扫描Cross-ScanSS2D 的关键在于 四个扫描路径左 → 右上 → 下右 → 左下 → 上这样每个像素可以从多个方向获取信息。这使模型能够建立 全局感受野Global Receptive Field。3.3创新三线性复杂度视觉模型Transformer 的计算复杂度为O(N2)O(N^2)O(N2)而 VMamba 的复杂度为O(N)O(N)O(N)论文指出VMamba 将模型的计算复杂度从二次方量级降低至线性量级。这使其在处理高分辨率图像时更高效。四.方法4.1.SSM的实现hteΔAht−1ΔBxth_te^{\Delta A}h_{t-1}\Delta Bx_thteΔAht−1ΔBxtytChtDxty_tCh_tDx_tytChtDxt其中ℎ表示隐藏状态x 表示输入y 表示输出4.2.SS2D的实现SS2D 的主要流程包括1Cross-Scan2.Selective ScanS6 block3.Cross-Merge如图该图用可视化方式清晰展示了 SS2D 模块的 “交叉扫描拆二维→S6 并行扫一维→交叉融合回二维” 全流程核心是证明VMamba 能在保留 Mamba 线性复杂度的同时处理二维视觉数据且不丢失空间信息4.3.VMamba的设计逻辑该图详细展示了以 Mamba 块为基础通过SS2D模块实现视觉适配再通过精简架构和工程优化最终实现“高精度 高吞吐 低算力”的高效视觉骨干网络。五.实验分析分类任务的性能比对下游任务目标检测 语义分割的性能对比分析结论VMamba 不仅在 ImageNet 分类上 “又快又准”在实际下游任务中同样表现优异是一个通用、高效、高性能的视觉骨干网络。VMamba 的适配性验证图以及资源消耗验证图六.个人声明本文为作者对原论文的学习笔记与心得分享受个人学识与理解所限文中对论文内容的解读或有不够周全之处一切以原论文正式表述为准。本文仅用于学术交流与传播内容均由作者独立整理完成不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议请及时与作者联系作者将在第一时间核实并妥善处理。