
不是刷题机器,是真能扛事的‘全能选手’。DM0.5这次在RoboColiseum拿下四个第一,不是靠某项绝活硬撑,而是把‘听懂人话’‘看懂空间’‘环境一乱不慌’‘动手就干’全拿捏了。这四个维度,恰恰是机器人落地最常卡壳的地方——你说‘把红杯子放到左边抽屉里’,它得先分清哪是左、哪是抽屉、哪是红杯子;旁边突然有人撞了下桌子,杯子滑了,它得立刻重算位置;换台没见过的机械臂,还得照样干活。过去很多模型,Demo拍得飞起,一换场景就哑火。DM0.5偏不这样,LIBERO、RoboTwin 2.0、VLA-Arena、RoboChallenge Table30 V2、RoboDojo……六套完全不同的考卷,它全交了满分卷。

更狠的是,这些考试根本不讲情面。RoboChallenge Table30 V2直接拉上ARX5、UR5、ALOHA、Dexmal-Mirror四种不同构造的真机,塞进30个杂糅任务;RoboDojo专挑‘记性差’‘动作抖’‘理解跑偏’的软肋打,结果DM0.5在Memory维度甩开第二名三倍多;这次RoboColiseum又把能力掰开揉碎,单拎出空间推理一项,它就干出0.6146的高分,远超其他模型。这不是堆参数堆出来的厚脸皮,而是从数据、架构到训练方式都做了系统性升级——一个4B规模的模型,没靠蛮力,靠的是更扎实的底层逻辑。
说白了,具身智能的终极门槛从来不是‘能不能做对一道题’,而是‘换道题、换个地方、换个机器人,还能不能做对’。DM0.5连续六次登顶,不是运气,是在用事实告诉行业:通用能力,真的可以练出来。而且练得不玄乎——它开源、可复现、GitHub和Hugging Face都挂着,连技术博客都写得明明白白。当别人还在为‘某个场景调参三天’发愁时,它已经稳稳站在了泛化能力的起跑线上。
这事儿有意思在哪?不是它多快,而是它多“稳”。你见过哪个学生考试,换考场、换监考老师、换题型、连笔都换成左手写的,还能回回年级第一?DM0.5干的就是这个。它没靠偷偷背下所有考题库——LIBERO里那些家庭场景任务,连杯子摆放角度都随机生成;RoboTwin 2.0直接用仿真+真机双轨验证,一个动作在虚拟世界跑通不算数,得在物理机械臂上也稳稳落点;VLA-Arena更绝,把语言指令、视觉观测、动作执行全打散重排,比如先给你看一段视频,再口头问“刚才第三秒发生了什么”,接着才让机器人去复现对应操作。这种考法,根本没法“套路化”应对。
背后其实是实打实的工程取舍。团队没盲目扩参数,反而砍掉了冗余的视觉编码分支,把更多算力留给跨模态对齐——让“左”这个词,真能和摄像头里抽屉的几何坐标、机械臂末端的空间朝向,在神经网络里连成一条通路。论文里写了,他们在训练时故意加了30%的传感器噪声、15%的指令歧义样本(比如把“靠近”说成“挨着”、“顺手”说成“顺带”),还塞进大量未标注的日常视频片段做自监督预训练。这不是炫技,是提前把现实世界的“不讲理”全喂给模型嚼过一遍。
有人问:开源了,别人抄得走吗?还真没那么容易。GitHub上代码齐全,但关键的多阶段课程学习策略、真实-仿真联合蒸馏流程、甚至机械臂动力学补偿模块的初始化方式,全写在配套技术博客里,连调试时踩过的坑都标了时间戳。清华、港科大、苏黎世联邦理工已经有三个实验室基于它复现并微调出自己的作业机器人原型,最快一周就跑通厨房整理任务。这不是又一个“看着很美”的空中楼阁,而是一块已经铺好的地基。
说到底,具身智能不该是实验室里的盆景,得能进厨房、修设备、帮老人拿药。DM0.5没喊口号,但它在六个 benchmark 上交出的每一分配资门户网官网首页,都在悄悄改写行业默认的“能力边界”——原来通用,真的不用等十年。
富华配资提示:文章来自网络,不代表本站观点。