ICML 2025 | 仅需 6.5% 显存!GS-Bias:高效视觉语言模型测试时自适应新范式
ICML 2025 | GS-Bias: Global-Spatial Bias Learner for Single-Image Test-Time Adaptation of Vision-Language Models 导读最近面向视觉语言模型的测试时间适应Test Time Adaptation, TTA引起了越来越多的关注特别是通过使用单个图像的多个增强视图来提升零样本泛化。不幸的是现有方法未能在性能和效率之间取得令人满意的平衡要么是由于调整文本提示的过高开销要么是由于手工制作的、无训练的视觉特征增强带来的不稳定收益。本文提出了一种高效且有效的全新TTA范式——GS-Bias在TTA过程中引入了两个可学习的偏置分别为全局偏置和空间偏置。具体而言全局偏置通过学习增强视图之间的一致性来捕捉测试图像的全局语义特征而空间偏置则学习图像空间视觉表示中区域之间的语义一致性。值得强调的是这两组偏置直接添加到预训练VLM输出的logits中从而避免了对VLM的完全反向传播。这使得GS-Bias在实现15个基准数据集上的最先进性能的同时具备了极高的效率。例如它在跨数据集泛化方面比TPT提高了2.23%在领域泛化方面提高了2.72%而在ImageNet上仅需使用TPT内存的6.5%。论文地址https://arxiv.org/abs/2507.11969代码开源https://github.com/hzhxmu/GS-Bias 核心痛点性能与效率的“鱼与熊掌”在追求视觉语言模型的测试时自适应时研究者们长期被困在两难境地效率的“高昂代价”反向传播负载过重基于 Prompt Tuning 的方法如TPT需要让梯度流经整个深度网络导致成倍的显存消耗这对于实时性要求高的场景是不可接受的。性能的“不稳定性”语义对齐困难基于无训练聚类的视觉特征增强方法如MTA难以捕捉到深层的语义连贯性导致分类精度触及瓶颈。️ 技术创新Global-Spatial Bias Learner (GS-Bias)GS-Bias另辟蹊径不修改模型输入或内部特征而是直接在Logits(输出层)引入两类可学习的轻量级偏置 全局偏置Global Bias通过学习不同增强视图之间的一致性捕捉测试图像的全局语义特征 。空间偏置Spatial Bias利用视觉编码器中的空间特征通过 Top-K 策略选择与任务最相关的区域学习图像内部的语义连贯性。✨ 最大亮点优化仅发生在输出端彻底告别了全网络反向传播实现了极速、轻量的在线自适应 。 实验表现在涵盖跨数据集泛化、领域泛化等 15 个基准测试中GS-Bias 表现出色 更强性能在跨数据集泛化上比 TPT 提升了2.23%在领域泛化上提升了2.72%。极低显存在 ImageNet 上GS-Bias 仅需1308 MiB显存对比 TPT 的19997 MiB降低了93.5%。全面超越在 10 个跨数据集基准测试中GS-Bias 在所有数据集上均优于原始 CLIP 的方法 。 总结GS-Bias为大规模视觉语言预训练模型的下游部署开辟了低功耗、高精度的新路径。其“即插即用”且资源敏感度极低的特性展现了巨大的工业应用潜力。这种技术能够精准赋能于对实时性与可靠性有严苛要求的场景例如自动驾驶在恶劣天气下的鲁棒性感知以及医疗影像中病灶动态演变的精准分析。