自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning
参数冻结,能力暴涨
自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 量子位
自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning
这是Zeva最反直觉的地方,也是清华AIR与域变换联手给出的新答案。
在多个典型具身基准任务上,将冻结模型的累计成功率从26%提升到73%;在真实化学实验室,机械臂在多次尝试中越用越稳。
Zeva是首个实现In-Context Causal Learning(ICCL)的具身WAM。
它让模型可以在不更新权重的情况下,从自己的交互经验中持续学习。当这种能力逐步成熟,具身智能将迎来属于自己的“GPT时刻”。
论文题目:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
项目主页:https://air-embodied-brain.github.io/Zeva/
传统思路里,想让机器人适应新环境,通常要重新采集数据、微调模型或做test-time training。
但这些方法依赖梯度更新,速度慢、成本高,还可能在适应新任务时破坏已有能力。
另一类in-context learning方法可以让模型根据演示或任务描述调整行为,但主要解决“任务理解”,并没有让模型从自己的动作后果中学习物理因果。
过去我们谈跨域,更多是sim-to-real、跨本体迁移、跨任务泛化。这些方法大多依赖数据对齐或表征对齐,本质上是在不同域之间搬运“任务经验”。
Zeva更进一步:它迁移的是“动作与状态变化之间的因果关系”。
同一个模型,在仿真里学到的物理因果,可以被带到真实机械臂;在一次尝试里积累的失败经验,可以指导另一个相似物理过程的尝试;人类的一次演示,也可以直接变成机器人的因果上下文。
这种跨域迁移通过上下文完成。模型在上下文中推断环境因果结构,并把因果知识用于下一次动作生成。这就是Zeva所定义的In-Context Causal Learning。
示例一:从放置称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。
示例二:从称取试剂至称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。
△Zeva总体框架。模型通过Causal Interaction Extraction、Dual-timescale Causal Memory、In-Context Policy Injection,在不更新权重的情况下实现部署中自进化。图片来源:论文
Zeva是一个模型。它的Causal Transition Encoder、Dual-timescale Causal Memory、In-Context Policy Injection,都属于模型推理链路的一部分。
在每个环境步,Zeva提取三类信号:视觉状态、动作编码、观察到的状态变化。
它们被递归编码为Causal Interaction State,并进一步投影为Phase Token和Causal Interaction Signal。
这些因果信号被组织成双时标上下文:Brief Interaction Trace负责当前尝试内的连贯执行,Persistent Interaction Memory跨尝试累积可复用经验。
决策时,Zeva检索与当前任务阶段匹配的交互证据,构造Causal Prompt,注入冻结的Cosmos3动作生成模型。整个过程零梯度更新。
亮点一:Causal Transition Encoder,让模型看见“动作→结果”。
模型显式学习动作引起的状态变化。训练目标包括因果效果预测、任务聚类和阶段进度,让Causal Interaction Signal真正携带物理因果信息。
BIT保证当前执行的连贯性,PIM把一次失败、一次修正、一次成功沉淀为后续可检索的上下文。同一个模型在repeated attempts中越用越强。
亮点三:In-Context Policy Injection,让冻结模型直接消费因果上下文。
通过Causal Prompt把任务、阶段和交互证据注入生成模型,不加额外噪声、不参与flow loss,只作为条件影响后续动作。这是“不调权重也能进化”的关键设计。
和传统Test-Time Training相比,Zeva的差异很直接:
在RoboCasa365-Atomic5上,Zeva平均成功率76.8%,效果最优。
更重要的是部署后的self-evolution曲线:累计成功率从Evolve 1的26%提升到Evolve 4的73%。
真实化学实验室ChemLab-Evo上,三个原子任务同样呈现单调增长:Pick Up Test Tube从65%到100%,Place Beaker从25%到70%,Pour Water从30%到80%。
Zeva还支持one-shot human demonstration enhancement:一次人类演示初始化PIM后,模型无需微调即可复现关键操作。
量化结果显示,人类warm-up在Place Beaker上最高带来20个百分点的提升,在Pour Water上带来15个百分点的提升。
△RoboCasa365上,Zeva在模型权重完全冻结的情况下,累计成功率从Evolve 1的26%提升到Evolve 4的73%。图片来源:论文
△真实化学实验室中,三个原子任务累计成功率随尝试里程碑提升。模型参数未更新。图片来源:论文
△One-shot人类演示warm-up对三个原子任务的影响。虚线为有人类演示初始化,实线为纯自进化。图片来源:论文
Zeva的深层意义,是把具身模型的scaling从“参数空间”延伸到“上下文空间”。
Zeva展示的另一种scaling是:在部署过程中不断增加可供模型消费的因果上下文。
每一次尝试都会产生新的interaction evidence,这些证据被压缩为Causal Interaction Signal并进入双时标记忆。
这里的理论基础是:模型可以把每个新场景的环境属性作为隐变量,在推理时从过去的动作-效果证据中推断出来。
物体质量、关节约束、接触特性、摩擦条件,都可以通过交互信号被隐式估计。冻结策略因此可以在不改变参数的情况下,不断逼近当前物理系统的真实动态。
更进一步,Zeva的Causal Interaction Signal是一个效应空间中的紧凑表示,直接编码物理效应信息。
跨任务effect retrieval实验显示,不同物体、视角和任务指令下的等价物理效应,会在该空间中彼此靠近。
这意味着模型学到的是“这类物理效应如何产生”,同时也覆盖具体任务的做法。这种表示天然支持跨域迁移,也让“域变换”成为一个可计算、可检索、可复用的技术概念。
如果把VLA看作“任务理解与动作生成”的基础设施,世界模型看作“经验想象”的基础设施,那么Zeva定义的ICCL就是“现场因果学习”的基础设施。
它把部署从“能力消耗”变成“能力积累”,把每一次失败从噪声变成可检索的因果证据。
如果ICCL成立,具身智能的scaling将多出一条独立于参数规模的曲线:交互次数越多,因果上下文越丰富,模型对当前物理域的辨识越准,任务成功率越高。这才是“域变换”作为新范式的真正含义。
清华AIR与域变换联手发布的Zeva,重新定义了具身模型的自进化:
不调权重,也能越用越强;不重新训练,也能从一次人类演示中学会新操作。
域变换开启的,可能是一条新的scaling路径:让机器人在真实物理世界中,自己学会因果,自己完成进化。
[1]论文:Zeva: In-Context Causal Interaction Memory for Embodied Action Generalization
[2]项目主页:https://air-embodied-brain.github.io/Zeva/
清华AIR(Institute for AI Industry Research, Tsinghua University)是清华大学面向第四次工业革命的国际化、智能化、产业化的研究机构,被视为中国AI产学研结合的第一梯队。
域变换是清华AIR面向物理智能自进化时代孵化的公司,由刘云新教授和曹婷教授发起,本次发布的Zeva是清华AIR在具身智能方向从前沿研究走向产业落地的重要标志。
清华大学智能产业研究院副院长、博导、万国数据冠名教授、首席研究员,国家级高层次人才、IEEE Fellow
获得了MobiCom、MobiSys、SenSys等多个国际顶级学术会议奖励,以及CCF科技进步一等奖等奖项。
获顶级会议最佳论文奖四次,工作入选ACM/Microsoft研究亮点等,其中ACM研究亮点由图灵奖获得者David Patterson亲自撰文推荐。
AIVC只是前菜!复旦提出生命算子,统一生命建模2026-09-01
被高估的视触觉:容易复制的生意,有多大投资价值?2026-08-28
AI重塑商业,信任决定未来商业能走多远丨Visa大中华区总裁张文翊2026-08-24
“具身智能小镇”来了!机器人逛超市买菜满街跑,来自上海AI Lab
世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型
你的模型真的会"举一反三"吗?RoboChallenge Table30 V2 正式发布,泛化时代开幕
Table30 V2将为全球具身智能研究者打造了一个精准的“泛化标尺”与公平、开放的真机竞技场
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
小宇宙推出《AI趋势报告》:AI创作、AI办公、协作型AI等成讨论新趋势
Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了
智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1