这项由北京大学、香港科技大学、北京航空航天大学、福州大学等多家机构联合完成的研究发表于2026年神经信息处理系统顶级会议NeurIPS 2026论文编号为arXiv:2607.15278v1发布于2026年7月16日。有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。一、先想清楚再动笔还是边画边看你有没有见过那种下棋高手每走一步之前都会在脑子里推演好几步后续棋局然后才落子与此相反还有一种人下棋喜欢走一步看一步全凭直觉结果往往在关键岔路口做出错误决定后悔莫及。这两种下棋风格恰恰对应了当前视频生成AI领域的两种主流技术路线而研究团队正是从这个根本矛盾出发提出了他们的新方案。今天AI视频模型的能力已经相当惊人。它们不仅能生成逼真的视频画面还开始尝试解题——比如在视频里演示如何走出一个迷宫如何移动汉诺塔的圆盘如何用一笔画完一个图形。这类任务不只是好看而是要求AI在一帧一帧的画面里保持严密的逻辑一致性每一步都不能走错否则整个解题过程就会崩溃。问题来了现有的视频AI在这件事上表现得并不令人满意。背后的原因研究团队用一个极其清晰的框架做了拆解。目前有两大类视频生成方式。第一类叫做双向扩散可以理解为这类AI在生成视频时会把整段视频同时放在眼前反复修改前面的帧可以根据后面的信息来调整整体协调性很好逻辑推理能力也强。但这种方式的代价是极高的计算成本——每次修改都要把整段视频重新过一遍速度非常慢完全不适合实时流式输出。第二类叫做流式自回归扩散这类AI生成视频就像打字一样从左到右一帧一帧输出已经生成的帧不会再改变。这种方式速度快、延迟低适合实时应用但致命的弱点在于一旦某一帧出现了错误判断后续所有帧都只能在这个错误的基础上继续生成无法回头修正就像在一张白纸上写字写错了却没有橡皮擦。研究团队把这对矛盾称为核心张力要么推理能力强但速度慢要么速度快但逻辑容易前后矛盾。他们的目标就是同时拥有这两种优点。二、像建筑师一样先画草图再精修细节解决这个矛盾的核心思路研究团队借用了建筑设计里一个人人都熟悉的流程。建筑师不会一上来就直接画出每扇窗户的螺丝钉位置而是先画一张粗略的整体布局草图确认方向没问题再画各楼层的平面图最后才到具体的施工图纸。每一层图纸都在上一层的基础上增加细节随时可以在不影响整体方向的前提下做局部调整。这个框架就是HDRHierarchical Denoising for Visual Reasoning层次化去噪视觉推理的核心设计理念。具体来说HDR把视频的内容组织成一棵树形结构。树的顶端是最粗略的层次只有极少数几个节点每个节点代表整段视频的高层次摘要就像建筑师的总体布局草图画面模糊但方向明确。往树的下方走节点数量越来越多每个节点代表的时间段越来越短内容越来越具体直到最底层的叶节点才对应真正要输出的视频帧就像最终的施工图纸清晰精确。在生成视频时HDR从树的顶端开始往下走。顶层节点先被生成但故意保留一定程度的模糊性——用专业术语说是保持在较高的噪声水平用建筑类比来说就是草图还没画定可以随时改。这种模糊性是刻意设计的因为它意味着模型还没有把某个全局计划锁死仍然有余地进行全局推理和调整。等到顶层的全局方向大体确定下来再传递给下一层下一层在此基础上细化再往下一层继续细化最终在底层生成清晰的视频帧并流式输出给用户。这个过程有一个关键的设计细节每一层被去噪即从模糊变清晰的程度是不一样的。粗糙的高层节点只做少量去噪保持一定程度的不确定性可以同时维持多种可能的全局方案精细的底层节点则做充分去噪把高层确定下来的方向落实成具体的画面细节。研究团队把这套设计称为匹配层次的去噪预算并用信息熵的数学概念推导出了每一层应该分配多少去噪步骤。对于他们实验中使用的六层结构计算出来的各层去噪步骤分别是5、8、13、20、32、50步越到底层步骤越多越精细。三、只看必要的信息稀疏层次注意力机制解决了先谋后动的生成顺序问题还有另一个技术挑战需要攻克计算效率。在双向扩散模型里每个视频帧对应的计算节点都要和其他所有帧的节点互相看一遍这在技术上叫做全注意力。帧数越多需要互相查看的次数就以平方速度暴增计算量极大。HDR为此专门设计了一套叫做SHAPSparse Hierarchical Attention Pattern稀疏层次注意力模式的机制。其核心思想是不是每个节点都需要看所有其他节点只需要看少数几个关键邻居就够了。具体来说树形结构里的每个节点只需要关注三类信息同一层里紧挨着自己的前一个节点保持同层的时序连贯性、自己在上一层的父节点获取更粗粒度的全局方向、以及父节点旁边的兄弟节点获取邻近粗粒度区段的边界信息。此外所有节点都可以看到视频的第一帧作为整个生成过程的初始条件。这种设计让每个节点只需要查看固定数量的其他节点无论视频有多长这个固定数量都不会变。于是整个计算量从平方级别降低到了线性级别——视频长度翻倍计算量也只是翻倍而不是变成四倍。同时这种树形的稀疏注意力机制还天然支持跨层级的信息共享粗糙层生成后其对应的计算缓存KV缓存可以直接被精细层复用不需要重新计算进一步提升了效率。四、六项考验从迷宫到汉诺塔的严苛测试为了公平评估新方法研究团队专门构建了一套全新的测试基准因为现有的视频推理测试大多不适合评估这种需要长序列逻辑一致性的任务。这套测试包含六项任务每项都有鲜明的特点。迷宫导航要求AI生成一段视频展示一个小球从迷宫入口出发按照正确路径到达终点任何穿墙或走错路都会被判定失败。汉诺塔要求AI正确演示这个经典益智游戏的解法每次移动圆盘都必须符合规则。一笔画要求AI生成一段视频展示如何不重复地用一条连续线条覆盖给定图形的所有格子。滑块拼图即俗称的华容道要求AI演示正确的移动序列。推箱子Sokoban是另一个经典的逻辑推理游戏。倒水游戏要求AI演示如何将各种颜色的液体在试管之间转移最终让每支试管都只含一种颜色。测试集包含370个评测视频每项任务都按照难度分级而且刻意包含了超出分布OOD的案例——就是训练时从未见过的特殊情况用来测试模型是否真的学会了规则还是只是在死记硬背。评分使用两个维度成功率衡量任务是否被完整正确地完成平均进度衡量完成了多少比例的中间步骤后者可以反映模型的中间推理是否保持逻辑一致性即使最终没有完全成功。五、数字背后的故事HDR表现如何测试结果给出了清晰的对比图景。与速度最快的流式自回归基准方法CausalForcing相比HDR的总体成功率从34.22分提升到了60.29分相对提升幅度高达76.2%。平均进度从76.00提升到了89.56说明即便偶尔在最后一步出错HDR的中间推理过程也明显更为连贯和正确。六项具体任务中进步最为显著的是迷宫导航成功率从12分飙升至78分。汉诺塔从45分升至58.75分Sokoban从40分升至78.33分一笔画从48.33分升至70分。滑块拼图和倒水游戏的提升相对温和但也均有改善。与使用全局注意力机制的双向扩散基准相比HDR在不使用全局注意力的前提下总体成功率60.29已经与双向扩散60.00基本持平甚至略高而推理速度则相差悬殊——每生成一个视频片段HDR只需要0.70秒而双向扩散需要37.92秒整整快了54.2倍。另一个流式基准CausalForcing的速度是0.72秒与HDR几乎相同说明HDR在提升推理能力的同时没有牺牲速度优势。从定性案例中可以更直观地看到差异。在迷宫任务里CausalForcing到达一个分叉路口后会立刻选择一条路并把这个选择锁定如果选错了后续帧只能继续在错误的路上走下去最终无法到达终点。HDR面对同样的分叉路口先在高层次的粗糙表示里做全局规划确认正确路径后再在精细层次生成具体的移动画面因此能够做出正确的选择。类似的对比在一笔画任务中也清晰可见CausalForcing会漏掉某些格子导致路径不完整而HDR通过层次化规划确保了全覆盖。六、抗压能力减少数据和计算预算时的表现研究团队还设计了两组压力测试专门考察HDR在资源受限条件下的鲁棒性。第一组测试减少了去噪步骤数量。在正常情况下使用50步去噪当步骤减少到1步极端情况时双向扩散的成功率从60.00骤降至17.78CausalForcing从34.22降至11.25而HDR从60.29降至34.72保留了57.6%的完整性能远高于另外两者的29.6%和32.9%。高层次的粗糙节点即使在极少步骤的情况下仍然能提供有效的全局方向指引这是HDR抗压能力的来源。第二组测试减少了训练数据量。当训练数据只剩下全部数据的2%时双向扩散的成功率只剩下31.18分仅保留了52%的完整性能。HDR在同样条件下保留了82.9%的完整性能成功率达到50分。研究团队认为这说明层次化的结构为模型提供了一种归纳偏置帮助模型更有效地从少量数据中学习可迁移的推理规则而不是死记硬背训练样本。七、从虚拟到现实机器人实验室里的挑战为了验证HDR不只是在合成数据上好用研究团队还做了一个物理世界的机器人实验。实验场景是让一个机械臂控制一个毛绒玩具把它从迷宫的入口移动到出口迷宫由玩具积木搭建而成。这个场景充满了现实世界的复杂性积木摆放不够规整、光线条件多变、物体识别可能有偏差、摄像头视角存在遮挡。研究团队先用3000个虚拟迷宫视频做预训练然后只用50个真实机器人视频做微调生成的视频再由一个逆动力学模型转换为机械臂的实际操作指令。测试设置按照难度分为简单、中等、困难三个级别还专门设计了一个超出分布级别在这个级别里积木被斜放或叠放形成和训练时完全不同的不规则迷宫形态。在简单级别HDR成功率达到80/100CausalForcing也是80/100两者打平。在中等级别HDR达到60/100超过CausalForcing。在困难级别CausalForcing得0分HDR也只有0分说明这个难度对两者都是巨大挑战。在最具挑战性的不规则积木关卡HDR拿到了20/80而CausalForcing同样得0分。这组结果说明HDR确实能够把它在虚拟环境中学到的层次化推理能力迁移到真实物理场景中去。八、层次越深思考越深各层作用的分析研究团队还对层次数量做了系统分析从只有1层等同于普通流式自回归到完整的6层逐步增加。结果显示随着层次数量的增加模型表现呈现出稳定的提升趋势。1层时成功率34.222层升至38.383层升至40.124层升至59.155层升至60.316层达到60.29与5层非常接近。平均进度同样从76.00稳步升至89.56。这说明每一个额外的层次都在贡献真实的推理价值而不是其中某一个层次起了全部作用。此外研究团队还测试了不同去噪分配策略的效果。除了他们推导出的熵匹配策略5、8、13、20、32、50步之外他们还测试了所有层均使用50步的策略、前五层各用5步最后一层用50步的策略以及指数增长策略2、4、8、16、32、50步。熵匹配策略在总体平均进度上表现最佳在成功率上也名列前茅与理论预期一致过度去噪高层节点会过早锁定全局计划削弱层次化推理的灵活性。九、机器人技能泛化RoboDojo模拟平台上的测试研究团队还进一步把HDR的思路拓展到了机器人具身操作领域创建了HDR-WAM世界动作模型变体在RoboDojo模拟平台上进行了测试。这个平台包含42个机器人交互任务涵盖泛化能力、精度、长时程规划、记忆能力和开放场景五个维度。HDR-WAM在没有使用任何机器人专属预训练数据的情况下整体得分达到5.47平均成功率3.00%超越了同样没有使用机器人预训练的AHA-WAM4.82/2.39%和Fast-WAM3.48/2.03%在无预训练类方法中排名第一。特别值得关注的是长时程任务维度HDR-WAM得分9.85成功率4.75%在所有方法包括有预训练数据的方法中排名第一。这正好呼应了HDR的设计初衷层次化结构天然擅长维护跨越很长时间段的任务逻辑一致性。HDR-WAM的具体实现方式是把整个任务视频分成两个视角一个全局视角从整段任务视频中均匀采样9帧作为任务进度的稀疏锚点一个局部视角从当前时刻出发取最近的9帧加上4帧未来里程碑帧形成局部动作执行窗口。两个视角的信息通过精心设计的注意力掩码协同工作视频流负责预测未来画面动作流负责预测可执行的具体动作两者既共享视觉上下文又保持各自的计算独立性。十、残余错误的本质哪里还没做到位研究团队在论文中坦诚地呈现了HDR的失败案例并对其模式做了归纳。一个典型的迷宫失败案例里HDR成功路由到达了目标走廊中间推理完全正确平均进度满分1.0但在最后几帧迷宫墙壁消失了导致最终帧的迷宫结构是错误的被评判为失败。类似的现象也出现在Sokoban和倒水任务中推理逻辑基本正确但在接近尾声时出现了视觉上的状态漂移——箱子的墙壁突然消失或者两种颜色的液体合并成了一种颜色。研究团队把这类错误定性为后期状态一致性漂移与那种从一开始就走错方向的规划失败有本质区别。高层次节点通常已经正确编码了预期的任务结构精细层次也基本按照这个结构生成了画面但在需要精确保持几何细节、物体身份或终止状态的最后阶段模型的精确控制力还不够稳定。对此研究团队提出的改进方向是引入约束感知的精细化机制或者在生成末尾帧时加入轻量级的验证步骤。说到底HDR做的事情可以用一句话概括给AI视频生成加上了先谋后动的能力。它不是简单地让AI变快也不是单纯地让AI更聪明而是找到了一种结构让快和聪明可以同时存在。这对普通人意味着什么当你和AI互动希望它帮你演示一道复杂的数学题的解题步骤或者展示一个棋局的最优走法或者规划一段有多个约束条件的旅行路线这类需要多步骤逻辑一致的任务未来可以通过视频生成的方式得到更可靠的呈现。在机器人领域这项技术的意义更为直接机器人需要实时响应、快速动作同时又不能在复杂任务中走一步看一步导致后续失误HDR正是为这种需求量身定制的解决方案。当然论文也诚实地指出HDR目前仍然在某些困难任务如滑块拼图、倒水游戏的高难度关卡上表现不够理想且在物理机器人的困难级别测试中成功率仍为零。通往真正的通用物理世界模型这项研究是一个有意思的起点但距离终点显然还有很长的路要走。对这项研究感兴趣的读者可以通过arXiv编号2607.15278查阅完整论文项目演示页面也包含了大量可视化案例。---QAQ1HDR视频生成和普通AI视频生成有什么区别A普通流式AI视频生成是从左到右一帧一帧输出一旦某帧出错就无法纠正。HDR在正式输出前会先建立一个从粗到细的层次结构先在模糊的高层次节点里做全局规划确认整体方向后再逐层细化最终才输出清晰帧相当于先有草稿再有定稿避免了早期错误的连锁传导。Q2HDR处理视频比双向扩散模型快多少A在流式输出阶段HDR每生成一个视频片段只需0.70秒而双向扩散需要37.92秒HDR快了约54倍。这是因为HDR采用稀疏层次注意力机制每个节点只需关注少数几个邻居节点而双向扩散需要让每一帧都和所有其他帧互相计算计算量随帧数平方增长。Q3HDR用少量数据训练效果会不会变差很多A相比双向扩散HDR对数据量减少的抵抗力更强。当训练数据减少到只剩2%时双向扩散的成功率保留了52%HDR保留了82.9%。研究团队认为这是因为层次化树形结构提供了一种有效的归纳偏置帮助模型从少量数据中学习可迁移的推理规则而不是死记训练样本。