2025_NIPS_SAMPO: Scale-wise Autoregression with Motion PrOmpt for Generative World Models
SAMPO 论文核心总结与翻译一、主要内容本文针对现有自回归世界模型在视觉一致性预测、解码效率和运动建模方面的不足,提出了一种名为SAMPO(Scale-wise Autoregression with Motion PrOmpt)的混合框架。该框架旨在通过尺度感知自回归建模、非对称多尺度令牌化和轨迹感知运动提示,实现高保真、时间一致且高效的动作条件视频预测和基于模型的控制,为人工通用智能(AGI)中的环境模拟与决策提供支持。核心应用场景动作条件视频预测(低/高分辨率场景)视觉规划(机器人操纵任务)基于模型的强化学习(MBRL)关键实验结果在BAIR、RoboNet、1X World Model等数据集上,SAMPO的视频生成质量(FVD、PSNR、SSIM、LPIPS)优于现有SOTA方法;推理速度提升4.4倍,支持实时交互;在视觉规划基准VP²和Meta-World强化学习任务中,展现出更优的控制性能和样本效率;具备零样本泛化能力,可迁移至未见过的任务场景。二、创新点混合自回归架构:结合帧内粗到细视觉自回归与帧间因果时序建模,既保留空间局部性,又保证时间一致性,支持各尺度内并行解码,提升生成效率