五大高校联手发榜!首份机器人三视角世界模型评测结果出炉,榜单持续更新中
三视角世界模型谁更稳?
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
五大高校联手发榜!首份机器人三视角世界模型评测结果出炉,榜单持续更新中
近日,由北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起的TriWorldBench Challenge,正式公布首周榜单更新结果。
作为首个面向机器人三视角世界模型的评测榜单,TriWorldBench旨在建立更加全面的具身世界模型评价体系,推动世界模型从“视觉生成”迈向“世界理解”。
榜单综合评估模型在三视角一致性、任务执行、物理空间理解等方面表现,面向全球相关研究团队开放参与,目前已收录多个公开评测结果,后续将持续更新评测结果。
(榜单地址:https://www.triworldbench.com/#leaderboard)
第一周的比赛中,来自CASIA-DRL的WoVR_Plus模型、来自TONGJI Spatial Intelligence Team的BetaBWM模型、以及来自Fysics AI的Fysiverse-Video模型占据了榜单的前三席。
从“生成视频”到“理解世界”,具身世界模型的新评价标准得到参赛者认可
TriWorldBench自发布以来,网页总访问量已破万,测评工具下载量超200,网页日访问量逾千;短短一周时间已经有14个正式参赛队伍。
这表明,三视角世界模型的竞争焦点已从单一视图的视觉保真度,转向多视角(head view、left-wrist view、right-wrist view)间的时空一致性与物理逻辑自洽性。
当前排名差异主要源于模型在多视角几何对齐、任务执行准确性及物理动态理解等维度的表现,而非单帧图像的感知质量。
TriWorldBench旨在建立一套系统化评估框架,对上述多维能力差距进行精确量化与可解释性分析,从而推动世界模型从“视觉生成”向“具身认知”范式演进。
该榜单聚焦机器人操作场景中的head view(头部视角)、left-wrist view(左腕视角)、right-wrist view(右腕视角)多视角视频生成与理解能力,希望建立更加全面的世界模型评价标准,推动具身世界模型从“视觉生成”迈向“世界理解”。
但对于具身世界模型而言,仅仅生成一段“看起来真实”的视频远远不够。
不同视角之间并不是简单的信息重复,而是共同构成机器人对世界的完整认知。
因此,一个真正可靠的具身世界模型,不仅需要生成单个视角下合理的视频,还需要保证:
针对多视角一致性这一核心挑战,TriWorldBench Challenge提出了一套面向机器人操作场景的综合评测体系。
相比传统单视角视频评价方式,TriWorldBench更加关注模型是否具备真实世界理解能力。
换句话说,三路视频不能只是分别“看起来合理”,还需要共同描述一次完整、连贯的机器人操作过程。
TriWorldBench进一步评估模型对于机器人操作过程的理解能力,包括:
其中,头部视角主要用于判断任务指令、机械臂轨迹和最终结果;腕部视角则进一步检查抓取是否稳定、是否发生滑移,以及夹爪与物体之间的局部交互是否正常。
这意味着,画面看起来足够清晰、流畅,并不代表机器人真正完成了任务。
TriWorldBench希望让世界模型评价从“看起来像”进一步走向“真正可用”。
TriWorldBench希望通过多视角评测,进一步探索世界模型对于真实环境的理解能力。
不只是排名:TriWorldBench更希望成为帮助研究团队优化模型的诊断工具
更重要的是,它能否解释模型为什么得分高或低,并把清晰的改进方向反馈给研究者。
TriWorldBench因此没有把三路视频压成一个简单平均分,而是建立了从同步数据、动作状态到多层结果的完整评测链路。
基准包含500个三视角同步episode,覆盖50个机器人操作任务。
系统围绕三视角一致性、任务对齐、物理与3D一致性、运动质量、时序一致性和视觉质量六个维度,汇总19项评测信号,并以TWB-Score作为榜单总分。
每个生成视角先与对应的真值相机进行对照,再通过head-wrist语义判断和联合三视角问答,检查机械臂状态、动作阶段、接触关系以及目标物体是否相互兼容。评测并不要求视角差异巨大的头部画面与腕部画面在像素上相同,而是判断它们能否共同解释同一次操作。
与此同时,指标会被分配到证据最可靠的相机。头部视角更适合判断任务指令、全局进度、机械臂轨迹和最终结果;
这样既不会让腕部遮挡影响全局任务判断,也不会让清晰的头部画面掩盖夹爪附近的失败。
TriWorldBench从参考机器人轨迹中构建STATE标注,识别当前动作阶段、活动机械臂,以及每个视角预期处于运动还是静止。
该动的腕部如果长时间冻结会被扣分,不该动的相机出现多余运动同样会被识别。
由此,稳定不再等同于“全程不动”,运动丰富也不再天然代表模型理解了任务。
当头部轨迹错误,或三路视频在机器人和物体状态上发生冲突时,系统会对视觉质量进行任务约束后的修正,避免一段精致但错误的视频凭借“好看”获得不合理优势。
在VLM语义评测中,评测协议还会先与人类专家的打分和排序进行对齐,再冻结规则用于正式测试。
榜单除了报告TWB-Score,还保留六大维度、单项指标、逐视角、head-wrist配对和联合三视角结果。
研究团队因此不仅能看到排名,还能判断问题究竟出在任务、运动、画质,还是三个摄像头之间的世界状态没有对上。
这让TriWorldBench更像一套面向研发的“体检报告”:它不只回答谁更强,也帮助解释模型下一步应该改进哪里。
TriWorldBench Challenge面向全球相关研究团队开放报名。
无论是专注视频生成能力,还是探索机器人交互与空间智能方向的模型,都可以通过统一的数据和评测体系参与挑战。
通过公开榜单,TriWorldBench希望为不同技术路线提供公平比较的平台,同时推动具身世界模型领域形成更加统一、科学的评价标准。
未来的机器人,不仅需要看到世界,更需要理解世界、预测世界,并在真实环境中完成复杂任务。
TriWorldBench Challenge希望推动行业共同回答一个关键问题:
首周榜单结果只是一个开始。随着更多前沿模型加入这场挑战,TriWorldBench正在成为观察具身世界模型技术进化的重要平台。
未来,谁能让机器人更准确地理解空间、预测变化并完成复杂任务,将在持续更新的榜单中逐渐揭晓。
TriWorldBench Challenge已开放官方网站及GitHub开源仓库,欢迎全球研究者参与交流:
TriWorldBench官网网站:https://www.triworldbench.com/ GitHub开源:https://www.github.com/TriWorldBench/TriWorldBench
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文2026-08-04
WorkBuddy重大升级,AI时代的Office来了2026-07-30
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超Nano Banana
刚刚,机器人顶会RSS三项最佳论文出炉!708篇送审,仅8篇杀入决赛
突发,Jeff Dean离职创业!谷歌股价应声蒸发1.34万亿
Artificial Analysis榜单:阿里Qwen3.8Agentic能力得分全球第一
MiniMax H3登顶开源社区第一,定义视频模型领域“斩杀线”
超级算力枢纽远景乌兰察布星河基地投产,全球最大AI算力超级单体落地
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1