news_article.exe
📰
#GPT#Claude#多模态

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

2026年9月1日1 次浏览来源:量子位 阅读原文

参数冻结,能力暴涨

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 量子位

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

这是Zeva最反直觉的地方,也是清华AIR与域变换联手给出的新答案。

在多个典型具身基准任务上,将冻结模型的累计成功率从26%提升到73%;在真实化学实验室,机械臂在多次尝试中越用越稳。

Zeva是首个实现In-Context Causal Learning(ICCL)的具身WAM。

它让模型可以在不更新权重的情况下,从自己的交互经验中持续学习。当这种能力逐步成熟,具身智能将迎来属于自己的“GPT时刻”。

论文题目:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation

项目主页:https://air-embodied-brain.github.io/Zeva/

传统思路里,想让机器人适应新环境,通常要重新采集数据、微调模型或做test-time training。

但这些方法依赖梯度更新,速度慢、成本高,还可能在适应新任务时破坏已有能力。

另一类in-context learning方法可以让模型根据演示或任务描述调整行为,但主要解决“任务理解”,并没有让模型从自己的动作后果中学习物理因果。

过去我们谈跨域,更多是sim-to-real、跨本体迁移、跨任务泛化。这些方法大多依赖数据对齐或表征对齐,本质上是在不同域之间搬运“任务经验”。

Zeva更进一步:它迁移的是“动作与状态变化之间的因果关系”。

同一个模型,在仿真里学到的物理因果,可以被带到真实机械臂;在一次尝试里积累的失败经验,可以指导另一个相似物理过程的尝试;人类的一次演示,也可以直接变成机器人的因果上下文。

这种跨域迁移通过上下文完成。模型在上下文中推断环境因果结构,并把因果知识用于下一次动作生成。这就是Zeva所定义的In-Context Causal Learning。

示例一:从放置称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。

示例二:从称取试剂至称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。

△Zeva总体框架。模型通过Causal Interaction Extraction、Dual-timescale Causal Memory、In-Context Policy Injection,在不更新权重的情况下实现部署中自进化。图片来源:论文

Zeva是一个模型。它的Causal Transition Encoder、Dual-timescale Causal Memory、In-Context Policy Injection,都属于模型推理链路的一部分。

在每个环境步,Zeva提取三类信号:视觉状态、动作编码、观察到的状态变化。

它们被递归编码为Causal Interaction State,并进一步投影为Phase Token和Causal Interaction Signal。

这些因果信号被组织成双时标上下文:Brief Interaction Trace负责当前尝试内的连贯执行,Persistent Interaction Memory跨尝试累积可复用经验。

决策时,Zeva检索与当前任务阶段匹配的交互证据,构造Causal Prompt,注入冻结的Cosmos3动作生成模型。整个过程零梯度更新。

亮点一:Causal Transition Encoder,让模型看见“动作→结果”。

模型显式学习动作引起的状态变化。训练目标包括因果效果预测、任务聚类和阶段进度,让Causal Interaction Signal真正携带物理因果信息。

BIT保证当前执行的连贯性,PIM把一次失败、一次修正、一次成功沉淀为后续可检索的上下文。同一个模型在repeated attempts中越用越强。

亮点三:In-Context Policy Injection,让冻结模型直接消费因果上下文。

通过Causal Prompt把任务、阶段和交互证据注入生成模型,不加额外噪声、不参与flow loss,只作为条件影响后续动作。这是“不调权重也能进化”的关键设计。

和传统Test-Time Training相比,Zeva的差异很直接:

在RoboCasa365-Atomic5上,Zeva平均成功率76.8%,效果最优。

更重要的是部署后的self-evolution曲线:累计成功率从Evolve 1的26%提升到Evolve 4的73%。

真实化学实验室ChemLab-Evo上,三个原子任务同样呈现单调增长:Pick Up Test Tube从65%到100%,Place Beaker从25%到70%,Pour Water从30%到80%。

Zeva还支持one-shot human demonstration enhancement:一次人类演示初始化PIM后,模型无需微调即可复现关键操作。

量化结果显示,人类warm-up在Place Beaker上最高带来20个百分点的提升,在Pour Water上带来15个百分点的提升。

△RoboCasa365上,Zeva在模型权重完全冻结的情况下,累计成功率从Evolve 1的26%提升到Evolve 4的73%。图片来源:论文

△真实化学实验室中,三个原子任务累计成功率随尝试里程碑提升。模型参数未更新。图片来源:论文

△One-shot人类演示warm-up对三个原子任务的影响。虚线为有人类演示初始化,实线为纯自进化。图片来源:论文

Zeva的深层意义,是把具身模型的scaling从“参数空间”延伸到“上下文空间”。

Zeva展示的另一种scaling是:在部署过程中不断增加可供模型消费的因果上下文。

每一次尝试都会产生新的interaction evidence,这些证据被压缩为Causal Interaction Signal并进入双时标记忆。

这里的理论基础是:模型可以把每个新场景的环境属性作为隐变量,在推理时从过去的动作-效果证据中推断出来。

物体质量、关节约束、接触特性、摩擦条件,都可以通过交互信号被隐式估计。冻结策略因此可以在不改变参数的情况下,不断逼近当前物理系统的真实动态。

更进一步,Zeva的Causal Interaction Signal是一个效应空间中的紧凑表示,直接编码物理效应信息。

跨任务effect retrieval实验显示,不同物体、视角和任务指令下的等价物理效应,会在该空间中彼此靠近。

这意味着模型学到的是“这类物理效应如何产生”,同时也覆盖具体任务的做法。这种表示天然支持跨域迁移,也让“域变换”成为一个可计算、可检索、可复用的技术概念。

如果把VLA看作“任务理解与动作生成”的基础设施,世界模型看作“经验想象”的基础设施,那么Zeva定义的ICCL就是“现场因果学习”的基础设施。

它把部署从“能力消耗”变成“能力积累”,把每一次失败从噪声变成可检索的因果证据。

如果ICCL成立,具身智能的scaling将多出一条独立于参数规模的曲线:交互次数越多,因果上下文越丰富,模型对当前物理域的辨识越准,任务成功率越高。这才是“域变换”作为新范式的真正含义。

清华AIR与域变换联手发布的Zeva,重新定义了具身模型的自进化:

不调权重,也能越用越强;不重新训练,也能从一次人类演示中学会新操作。

域变换开启的,可能是一条新的scaling路径:让机器人在真实物理世界中,自己学会因果,自己完成进化。

[1]论文:Zeva: In-Context Causal Interaction Memory for Embodied Action Generalization

[2]项目主页:https://air-embodied-brain.github.io/Zeva/

清华AIR(Institute for AI Industry Research, Tsinghua University)是清华大学面向第四次工业革命的国际化、智能化、产业化的研究机构,被视为中国AI产学研结合的第一梯队。

域变换是清华AIR面向物理智能自进化时代孵化的公司,由刘云新教授和曹婷教授发起,本次发布的Zeva是清华AIR在具身智能方向从前沿研究走向产业落地的重要标志。

清华大学智能产业研究院副院长、博导、万国数据冠名教授、首席研究员,国家级高层次人才、IEEE Fellow

获得了MobiCom、MobiSys、SenSys等多个国际顶级学术会议奖励,以及CCF科技进步一等奖等奖项。

获顶级会议最佳论文奖四次,工作入选ACM/Microsoft研究亮点等,其中ACM研究亮点由图灵奖获得者David Patterson亲自撰文推荐。

AIVC只是前菜!复旦提出生命算子,统一生命建模2026-09-01

被高估的视触觉:容易复制的生意,有多大投资价值?2026-08-28

AI重塑商业,信任决定未来商业能走多远丨Visa大中华区总裁张文翊2026-08-24

“具身智能小镇”来了!机器人逛超市买菜满街跑,来自上海AI Lab

世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型

你的模型真的会"举一反三"吗?RoboChallenge Table30 V2 正式发布,泛化时代开幕

Table30 V2将为全球具身智能研究者打造了一个精准的“泛化标尺”与公平、开放的真机竞技场

神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡

小宇宙推出《AI趋势报告》:AI创作、AI办公、协作型AI等成讨论新趋势

Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

> 分享: