具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
机器人大脑新SOTA
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜 量子位
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
这次,原力灵机的DM0.5,登顶了具身「珠峰」——RoboDojo。
魔鬼级的具身评测,由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等全球近20所顶尖学术机构共同发起。
这么说吧,截至2026年7月,仿真榜单头部模型平均成功率仅8.80%,真机榜单仅12.8%。
机器人先从左到右盖住随机排列的红、绿、蓝三个积木。当颜色被完全遮挡后,再根据此前观测,按红、绿、蓝的顺序依次揭开。
反映在数据上也很直观,RoboDojo榜单中的Memory维度,DM0.5直接猛砍了47.74分,显著领先。。。
RoboTwin 2.0:简单和复杂场景下成功率分别达到 93.6% 和 93.3%,
VLA-Arena:不同难度设置下的成功率分别达到 89.0%、53.6%、44.1%。
RoboChallenge Table30 v2:综合得分54.42,成功率43%。
榜单数字终究是抽象的。DM0.5的真实能力到底如何,还得看demo。
但回过头来仔细一样,这些看似分散的demo,其实指向同一件事:
毕竟物理世界场景稀碎,你模型做得再好,总有泛化性覆盖不到的长尾任务,这类场景下鲁棒性会骤降特别多。
目前业内的共识解法是:不追求预训练解决一切,而是在落地环节引入Human-in-the-Loop。让人类工作者拍摄一段示范视频,机器人便能像开了「写轮眼」一样即时对齐并跟随完成复杂任务。
DM0.5原生支持最长60秒的记忆能力,机器人能深度记住并连贯审视自己此前做过的所有动作序列。
基于这份长记忆,模型可以直接跨越语言限制,理解人类演示的视频片段。
其实今年7月我在上海WAIC看过这个demo,说实话,比视频里的精彩得多。
是的,6台机器人,耗时15小时,用 81920块微型积木拼出长3.5米的长城模型。
积木拼装,最小的组件宽度不到1厘米,机器人必须在0.1到1毫米的尺度内完成抓取和扣合。这个精度,已经超越了人手约0.3到1毫米的自然抖动极限。
与此同时,微型积木存在工艺公差,直接大力出奇迹的话,极易错位卡死。
毕竟是模型嘛,高精度任务确实没法追求把把zero-shot,还是得靠Loop保证稳定性。
比如这个削黄瓜的demo,一刀下去,黄瓜形态会变。模型需要实时闭环调整。
刀深几分、力道几何,如何削得干净又不伤果肉……全在毫厘之间的拿捏。
今年北京亦庄的WRC,原力灵机将快递流水线搬到了现场,直击物流中转站最大痛点——
传送带不停,每个包裹的尺寸、材质、摆放姿态都不一样,传统机械方案根本干不了这类任务。
DM0.5不依赖预设脚本,纯靠实时视觉识别和决策,平均3秒一单,准确率超99%。
说实话,论论情绪价值,我个人觉得还得是工业场景,超解压啊,跟看清洁直播一样。
真实世界不是实验室,相机随时可能骤变视角,人类随时可能「空降」捣乱。
DM0.5的解法是分层双系统,即业界主流的System1与System2架构。
Sys2是深思熟虑的高阶大脑。负责理解、拒绝与大局预判,剑指zero-shot;
Sys1则是动作专家网络。就像人类的直觉反射,负责handle长程复杂任务中的琐碎细节。
在这套架构加持下,即便外部视点剧烈变化,DM0.5通用Picking的鲁棒性依然极强。
哪怕人类强行打断任务,机器人也能准确理解当前实际状态,自适应修正后续动作。
现在大家都冲百万小时数据,但光看数据量,或许并不符合第一性原理。
如果基模没有强泛化,每个场景都单独训一个模型,demo再多,也不过是一堆散落的珍珠。
这也是我觉得DM0.5最有意思的Takeaway吧,具身模型本身的能力正在被看见,并且上限可以做到很高。
答案分为三层,也是具身绕不开的三个核心变量:数据、架构、延迟。
数据决定智能上限,这也是整套具身工程中,最重要的一环,没有之一。
1、真机:5万小时高精度操作,覆盖100+种丰富动作,实现秒级精细指令动作对齐。
2、Ego:10万小时场景视频,支持毫米级高精度3D Landmark生成,实现精准标注。
3、仿真:100万平空间数据建模复杂室内环境,高精度重建解决Sim2Real Gap。
数据量的方式则用omni融合思路解决,也是目前行业比较主流的方案,风险最小化。
这个前面提到过,为了降低DM0.5的落地门槛,原力灵机引入了原生长记忆。
具体而言,团队在上下文抽象层做了大量工作,通过高效的信息压缩技术,让4B参数的VLM在预训练阶段就能原生学习并记住历史信息。
毕竟不管怎么说,语言确实是最方便蒸馏人类思考能力的模态了,有Language这一层赋能,就是很吃香。
为此,DM0.5设计了具身思维链任务,用11项推理任务驱动模型,对指令、本体、环境进行三方联合建模,赋予动作生成以语义理解和世界预判能力。
这个过程中,团队可以构造了「反事实任务」,故意给出错误指令,迫使模型真正「看懂」而非机械匹配。
传统动作监督是对点式的,预测轨迹与真值轨迹之间的偏差会不断累积,最终炸掉。
原力灵机做的事对齐式的动作监督,利用约束动态规划高效计算最优匹配,一次性解决动作轨迹不一致的问题。
为此,原力灵机做了一系列优化,这里就不多做赘述,大家可以直接看官方技术报告。
API 延迟:p50 67.75 ms,p90 70.01 ms
「登顶」确实很惊艳,但说实话,这可能真还不是最值得关注的事情。
具身天上一天地上一年,冠军频繁易主,仅仅是成绩单,很容易过期。
不仅仅是模型权重,DM0.5的训练框架、下游任务工作流……已陆续在GitHub与Hugging Face开放,供开发者复现、魔改、扩展。
比如下面这个demo,就是原力灵机基于DM0.5,结合开源机械臂套件,监督微调出来的。
LLM领域,开源早不是啥新鲜词,从最开始的DeepSeek,到如今的GLM、Kimi、MiniMax……大家早已习惯了开源的声音。
如果谷歌当年没有放出Transfomer,OpenAI或许永远也摸索不出通往ChatGPT的路。
RoboDojo的火爆,推动了评估从「单点Demo展示」走向「标准化全科考试」。让具身真的可以被统一度量、被复现、被挑战。
DM0.5的登顶与开源,则进一步兑现了这个Benchmark的价值。让所有人看到登顶的方法论,也让方法论可以被带走、被复用。
GitHub:https://github.com/dexmal/opendm
Hugging Face:https://huggingface.co/Dexmal/DM05
Tech Blog:https://www.dexmal.com/blog/dm0.5
他给了王兴兴第一个200万,现在给下一个「宇树」当董事长2026-08-23
WRC最忙机器人:猛干15分钟家务,收纳、补货、叠衣服…2026-08-21
深度体验DeepSeek Harness,我原谅它涨价了2026-08-14
对话原力灵机周而进:模型2.4B就够用,关键是“具身原生”;能闭环才是最高效方法
技术获 NVIDIA、Pi 双重认可!原力灵机 DM0 模型重塑具身智能新范式
原力灵机 DM0 模型,正让机器人 “又聪明又敏捷” 的理想照进现实
基于数万次真机评测,RoboChallenge首份年度报告发布
模型、框架、应用量产工作流,原力灵机三箭齐发,开启具身智能"原生时刻"
原力灵机提出GeoVLA:让机器人看懂三维世界,打破2D视觉枷锁
闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5
匿名牛来大模型被扒出智谱血缘,也有人怀疑Cursor拿开源GLM训的
写2000字提示词,不如先生成3D白模!AI视频创作进入“预演时代”
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1