通过测试-时强化学习实现即时VLA自适应
26年1月来自Missouri大学、港科大广州、美海军实验室、Lamar 大学、Meta AI和RIT的论文“On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning”。视觉-语言-动作VLA模型近年来已成为通用机器人学习的强大范式它使智体能够将视觉观察和自然语言指令映射到可执行的机器人动作。尽管VLA模型应用广泛但它们主要通过监督式微调或训练时强化学习进行训练这需要显式的微调阶段、人工干预或受控的数据收集。因此现有方法仍然不适用于具有挑战性的模拟或物理世界部署在这些环境中机器人必须自主且灵活地响应不断变化的环境。为了解决这一局限性提出一种用于VLA的测试-时强化学习TT-VLA框架该框架支持在推理过程中进行动态策略调整。TT-VLA构建一个密集奖励机制利用逐步任务进度信号在测试阶段优化动作策略同时保留通过监督式微调/强化学习训练的先验知识使其成为现有VLA模型的有效补充。在模拟和真实环境下该方法能够提升系统在动态且此前未曾遇到的场景中的整体适应性、稳定性和任务成功率。VLA泛化与自适应当前的VLABrohan2023Mees2022Pong2020Kwok2025主要通过对大型、精心整理的三元组进行监督式微调来优化Zitkovich2023Kim2024Plaat2024Jiang2025bKim2025Liu2024a。这种方法在静态、结构良好的环境中表现优异但由于缺乏自适应学习机制在分布变化的情况下表现脆弱鲁棒性有限Shenfeld2025Chen2025aXu2024Chen2025bWang2025a。为了克服这些局限性近期的研究探索将VLA与强化学习相结合。强化学习允许策略主动与预先收集的环境或演示进行交互从而实现超越静态监督的持续适应和性能提升Huang2025Zhang2025Mark2024Chen2025cYe2025Li2025aLu2025Jiang2025aChen Li2025Wu2021Guo2025b。通过结合交互驱动的反馈强化学习增强的VLA能够根据特定任务目标Huang et al., 2025; Zhang et al., 2025; Mark et al., 2024和环境变化Chen et al., 2025c; Ye et al., 2025; Li et al., 2025a; Lu et al., 2025; Jiang et al., 2025a; Chen and Li, 2025; Wu et al., 2021; Li et al., 2025b; Guo et al., 2025b改进其行为从而在未见过的场景中展现出更高的样本效率和更强的泛化能力。尽管取得这些进展但现有的强化学习方法仍然遵循训练-部署分离的范式缺乏模型部署后进行推理-时自适应的机制。这一缺陷使得VLA在测试期间容易受到意外动态的影响而由于时间或数据限制重训练又不切实际。测试-时训练测试-时训练TTT最初是为仅使用未标记的测试数据将预训练模型适应目标领域而提出的Sun et al., 2020; Hu et al., 2025; Yoon et al., 2024; Xiao et al., 2025; Zhu et al., 2024; Zuo et al., 2025。与SFTJia2022Mosbach2021Han2023Wang2025aLiu2025b2024bHu2022Zeng2024Wang2024b或传统强化学习Sutton1999aGuo2025aHuang2025Zhang2025Mark2024不同TTT利用自监督目标例如熵最小化在推理过程中校准模型从而在缺乏人工标注和外部反馈的情况下实现有效的域自适应。直观地看TTT 可以自然地扩展到VLA从而在推理过程中实现高效适应。然而与相对直观的单领域任务例如视觉、语言不同在这些任务中预训练模型表现出较高的泛化能力Brown2020Wei2022Goyal 2023且任务间差异相对较小Hu 2025Liu 2021Zhao 2023Han 2025机器人任务通常涉及视觉和语言模态之间显著的分布变化和不断变化的条件Pong 2020Wang 2025aKim 2024Liu 2024a。因此固定的、协议驱动的自监督目标变得不足且过于通用。最近的研究探索基于强化学习的替代方案以取代纯粹的自监督测试-时训练TTT目标。特别是EVOLVE-VLABai2025b利用任务进度作为奖励信号在部署期间优化VLA策略。然而它依赖于GRPO风格的优化算法导致计算开销巨大限制其在具有严格延迟约束的实时机器人环境中应用。TT-VLA从更广义的角度来看当前语言或视觉理解领域的研究已开始探索测试-时训练TTTZuo et al., 2025; Li et al., 2025c; Karmanov et al., 2024; Hu et al., 2024; Ma et al., 2023以便直接基于传入的测试流更新模型通常无需真实标签这凸显模型灵活调整的一个有前景的方向。这些进展已在其他领域出现而视觉语言动作VLA的测试-时自适应在很大程度上仍未得到充分探索。当前的测试-时训练无法直接应用于视觉语言动作模型因为其多模态特性会带来显著的分布变化并且还在不断演变。基于此本文提出一种用于VLA的测试-时强化学习框架TT-VLA。该框架无需重训练即可高效地进行在线推理-时策略微调在保留SFT/训练-时强化学习先验信息的同时利用密集推理-时奖励信号形成闭环。其中TTT为测试时自适应提供便利而强化学习则通过应对环境条件和底层分布的显著变化对其进行补充。如图所示如图所示TT-VLA的框架图a总流水线b效率分析图。在PPO中策略π_θ和价值函数V_θ是联合训练的。然而在VLA的测试-时自适应中学习可靠的价值函数通常是不可行的原因有二1样本有限测试-时自适应依赖于极其有限的交互数据单个episode这不足以进行准确的回报估计。2严格的时间约束VLA模型的测试-时更新必须在严格的延迟约束下在线执行。为了克服这些限制本文开发一种无价值的PPO它无需显式的价值函数即可实现策略自适应。密集的基于进度奖励。大多数现有的基于强化学习VLALi2025aLiu2025a依赖于稀疏的终端奖励通常在episode结束时指示任务的二元成功或失败。虽然这种奖励机制在离线训练中有效因为可以重放或重置训练片段但对于测试-时的自适应而言却不切实际策略更新会被延迟到任务完成时从而阻止任何训练过程中的修正或在线调整。因此使用稀疏奖励的机器人无法在推理过程中优化其行为导致其在动态环境中表现脆弱且缺乏适应性。令 p_t ∈ [0, 1] 表示时间步 t 的任务进度。直观地说当动作推进任务完成时p_t 应该增加当动作撤销或逆转先前取得的进度时p_t 应该减少。在 部分可观测Markov进程POMDP设置中直接从观测数据和语言指令估计进度如下所示p_t Φ(o_0:t1, l) 6其中 Φ 表示基于观测历史 o 和指令 l 的任务进度预测器。每步密集奖励定义为进度的时间差r_t p_t − p_t−1 7用视觉-语言-动作- critic模型 (VLAC) (Zhai et al., 2025) 实例化 Φ。VLAC 是一个预训练的多模态模型可用作任务进度估计的标量回归器。这种基于进度的奖励具有三个理想的特性。首先它在推理过程中不需要外部监督从而允许在测试-时进行完全自主的调整。其次它提供密集的、分步的反馈有助于在回合中持续进行策略调整。第三它鼓励单调地朝着任务完成的方向发展同时抑制振荡或倒退行为。训练目标。在测试时的 VLA 设置下在单个回合内学习一个精确的值函数 V_θ 是不切实际的。因此采用一种无值的 PPO 变型其移除值函数学习并直接使用每步奖励信号进行策略调整。从 PPO 目标函数出发移除辅助损失舍弃值回归和熵正则化项。虽然熵项鼓励训练期间的探索但测试-时自适应优先考虑快速适应当前任务而非广泛探索。因此目标函数仅关注稳定的策略优化同时保留截断的代理surrogate损失。PPO 目标函数变为L(θ) E_t [LCLIP_t(θ)] 8其中 L^CLIP_t(θ) 为截断的策略损失即其中r_t是新策略与旧策略的比值。为了使智体能够精确捕捉当前动作的即时价值进一步重新定义优势使其仅取决于该动作获得的奖励而非 GAE广义优势估计中使用的 TD 残差指数加权组合。换句话说关注的是每个动作如何促进即时进展而不是估计长期收益。为了实现这一点将平滑参数 λ 0 和折扣因子 γ 0 设置为 0从而将 GAE 简化为一步公式Aˆ_t δ_t r_t这里TD 残差 δ_t r_t因为移除了值函数使得 TD 残差成为即时奖励信号。这种简化确保策略更新能够直接反映每一步的进展使智体能够在不依赖值函数的情况下快速适应不断变化的情况。整体流程。在每个episode开始时预训练的 VLA 接收初始观测值 o_0 和指令 l。VLA 策略 π_θ 生成第一个动作 a_0。在每个后续时间步 tVLA 接收最新的观测值 o_t 并输出动作 a_t。执行完毕后进度估计器 Φ 计算任务进度 p_t 和相应的密集奖励 r_t。该奖励用于通过公式 8 以无价值的方式计算策略损失并据此更新策略参数 θ。更新后的策略 π_θ′ 随后用于生成后续动作从而在整个episode中实现持续改进。伪代码见算法 1实验设置环境和任务设置。TT-VLA 旨在解决当前 VLA 对不可预见的动态变化和域转换的固有脆弱性。为了评估其在未见过任务上的泛化能力在模拟任务和真实任务上测试 TT-VLA。对于模拟实验遵循 RL4VLALiu2025a的设置重点关注标准的抓取和放置操作场景。智体接收 RGB 观测值和自然语言指令并输出笛卡尔末端执行器增量以及二进制夹爪指令。具体而言与Liu 2025a相同从执行、视觉和语义三个维度评估泛化能力。在执行阶段机器人、物体和容器的初始姿态均随机化并引入额外的中途物体重定位条件以评估其对执行过程中动态变化的鲁棒性。在视觉阶段前景和背景的外观均通过动态纹理、未见过的桌面表面和图像级噪声进行变化。在语义阶段引入未见过的物体、容器和指令释义以及旨在评估组合和语言泛化能力的多物体、多容器和干扰项-容器任务。所有仿真实验均使用ManiSkill 3Tao2024和WidowX-250S机械臂进行。为了进行实际应用评估在Franka Research 3平台上研究抓取和放置操作任务。智体接收RGB图像和任务指令并输出笛卡尔坐标系下的末端执行器位移以及二进制的机械臂指令。评估九项未见过的任务的性能这些任务旨在评估智体对执行、视觉和语义变化的鲁棒性。实现细节。在模拟环境中每个任务使用640×480的RGB图像作为输入在三个随机种子下执行80次试验。在实际应用实验中每个任务在一致的实验条件下进行10次试验包括固定的摄像头视角图像分辨率为500×480、可控的光照和静态背景。使用LoRAHu2022对策略进行微调秩为{16, 32}。学习率取自{1 × 10⁻⁵, 5 × 10⁻⁵, 1 × 10⁻⁴}并使用 AdamW 进行优化。为了提高训练稳定性应用 0.2 的裁剪参数 ε。每个训练episode的训练周期固定为 160 步。