2026年的WAIC,机器人正在从“秀肌肉”转向“秀大脑”。

过去两年,人形机器人热度居高不下,但出圈的动作往往是走路、跑步、跳舞、翻跟头。热闹是热闹,但看完总让人想问一句:所以它到底能干什么活?

今年的WAIC上,人形的密度低了,吸引了最多关注的机器人,基本都不是双足,但它们真的变聪明了。

原因很简单,竞争的焦点从Locomotion(运动)转移到Manipulation(操作)。而且,不再是分拣、叠衣服这样的单一技能,而是长程任务和协调能力。

比如,银河通用的Galbot G1在展台上做早餐:烤面包、倒饮料,双臂交替配合。工作人员把面包、水壶、杯子位置打乱,机器人仍能重新定位目标、调整路径,把任务继续做下去。苏度科技则展示了机器人手脚协同,边移动边操作的能力。

这就是今年WAIC最值得关注的变化:具身大脑不再是“单细胞”了。它不再只是看到一个物体、触发一个技能、完成一次抓取,而是开始把感知、预测、规划、控制和纠错组织在一起。

不过也要看到,当下具身大脑所谓的“世界模型”,与理想中的AGI还相去甚远,其本质是基于场景和任务的动作生成,而不是真正理解这个世界。

或者说,机器人只是开始长出了器官,学会了干活,但还远远没有成为人。

机器人不再只会“抓一下”

机器人行业过去很喜欢展示“原子技能”。

走一步,抓一下,放一下,拧一下,挥一下手。每个动作都可以调得很好看,但动作和动作之间并没有真正的连续关系。它更像一个技能菜单:用户点一道菜,机器人上一个动作。

问题是,真实世界不是菜单。

我们不希望去命令机器人去“抓起杯子”,而是只要说一句“我想喝水”,它就能去寻找杯子,并且还要知道杯子是不是空的、杯口朝哪边、旁边有没有障碍、抓起来以后会不会洒、下一步是不是要倒水。抓取只是入口,后面跟着一整串物理后果。

所以,今年WAIC上,真正有价值的演示不是抓取,而是“抓完之后还能继续做什么”。

银河通用的早餐任务就是一个典型例子。烤面包和倒饮料,实际考验的是长时序闭环。面包盘被挪走,机器人要重新识别;水壶位置变化,它要重新规划;杯子移动,它还要保证倒水动作不失效。单个动作成功不难,难的是动作之间不断传递状态,还不能崩。

机器学习领域的著名学者苏昊领衔的苏度科技,今年第一次参加WAIC,也展示了强大的复杂任务执行能力。

今年4月,苏度就曾凭借高度泛化的抓取能力引起关注:其具身智能平台R1可以抓取此前没见过的刚性、柔性、透明、反光物体,首次抓取成功率约98%,两次内接近100%。

短短几个月后的WAIC,苏度把抓取扩展成了一组操作能力,包括边移动边操作、双手协作、动态抓取和亚毫米级装配等。它不再只是证明“我能抓”,而是想证明机器人能够在真实场景中干活。

通向世界模型之路

过去一年,很多机器人已经在干活了,但其原理更多是基于VLA。

VLA就是Vision-Language-Action,视觉-语言-动作模型。在这样的三层结构中,起到决策作用的是语言模型,它让机器人看懂场景、听懂指令,然后生成动作。人类说一句“我渴了”,语言模型就把它翻译成“拿杯子”。

但VLA有一个天然短板:它往往只能做到“条件反射”,而无法执行长程任务。

因为语言是离散、语义化、低频的;机器人动作是连续、几何化、高频、受动力学约束的。语言模型可以给出语义命令,比如“红色杯子在左边”“把垃圾放进垃圾桶”;但机器人真正需要的是:目标物体的 6D pose、可抓取点、避障轨迹、接触力、夹爪闭合时机、失败恢复策略。

VLA尽管拥有了一个发达的大脑,但肢体仍然只懂得少数经过训练的原子技能。

于是,今年行业都在谈论世界模型。

世界模型不是完全基于语言去理解世界,而是从一开始就把动作数据纳入训练,让模型学会基于物体当下的状态和运动轨迹去预测下一步状态。

它石智航展台上的一个互动形象地展示了这一过程。观众只要戴上一个手部运动采集装置,无需借助摄像头,它石的AWE 3.5模型就能在虚拟空间中生成人手抓取各种物体的场景。

今年WAIC上,最值钱的那些具身智能企业都在讲世界模型的故事,而且各自的技术路线百花齐放。

最基础的做法是类似于传统的图像和视频生成模型,基于扩散模型的视频生成能力来预测符合物理约束的未来状态序列,再与VLA相结合完成机器人闭环。

例如魔法原子就宣称,其Magic-Mix 搭载视频与动作双专家协同训练模式,能够持续学习真实物理规律,让机器人理解并遵循基础牛顿力学,在行动之前提前预判后果。

也有不少企业试图更进一步,引入类似于大语言模型的自回归架构。

眸深智能创始人穆泽林对我们解释说,纯扩散模型的优势在于流式生成,但泛化性可能存在一定问题。而自回归架构的优势在于离散任务的处理,能够基于Token去做随机的组合,所以有更强的泛化性。

因此,眸深智能的时空一体世界模型STI World Model采用了扩散和自回归的“双塔”架构。这条路线上名气更大的,是英伟达不久前发布的Cosmos 3。

蚂蚁灵波也是这条路线里比较激进的代表。LingBot-VA 2.0用自回归因果建模组织时间,用 MoT 双流 Transformer 联合建模视频和动作,用视频世界预测辅助机器人策略生成,本质上是在做一个“会想象未来的机器人策略模型”。

能理解物理世界,会想象未来,这样的词汇完全击中了过去视频生成模型的痛点,因此,具身世界模型从一开始就被赋予了通向AGI的巨大意义。

但问题来了,有了世界模型,机器人就真的能快速接近人类意义上的AGI了吗?至少目前来看,这一幕还有点远。

今年已经关闭独立运营的Sora,曾经代表着OpenAI探索AGI的雄心,其兼具视频生成和时空推理的能力,看上去与具身世界模型并无二致。

区别在于,Sora被高昂的成本拖垮,而具身世界模型则走了更廉价的路线。

以大晓机器人为例,其开悟(Kairos)模型不久前曾经刷新多项全球SOTA,但最新发布的 3.1 的参数量仅为 8B。而英伟达Cosmos 3.0系列的最大参数量为64B。

这是因为,当下的具身模型并不追求“生成视频好不好看”,仅仅是为了实现机器人实时控制。

蚂蚁灵波首席科学家沈宇军直言,其训练采用的动作数据往往并非高画质的视频,而是经过压缩的点云。

大晓机器人首席科学家陶大程近日也发文详细阐述了这一理念。他指出:

“具身世界模型不应追求做物理世界的“全量复印机”。真实世界的信息量是无限的,机器人既不可能、也完全没必要模拟完整的世界。它的核心使命,是在有限的观察能力、计算资源与试错成本约束下,提取并持续维护那些足以支撑行动决策的核心信息,让机器人尽可能少犯昂贵的错误。

“换句话说,具身世界模型的本质,可以理解为一套以控制充分状态为核心、以降低行动代价为设计原则的未来推演系统。它不应以视觉逼真度为唯一标尺,而应以“能否帮机器人做对动作、避开风险、降低长期部署成本”为重要评判标准。像素只是表象,控制才是根本。”

Vibe coding把行业下限抬高了

今年WAIC还有一个容易被忽略的现实:不是所有抓取进步都来自最前沿的世界模型。

很多传统机器人公司,用简单VLA、多模态模型、3D视觉、规则程序、行为树、运动规划和力控,也把抓取做得更好了。

这条路线不性感,但很有效。

梅卡曼德就是典型案例。它在WAIC 2026展示了透明物体泛化抓取、人形机器人自主货架取货、海量物品分拣、高速小零件无序上料、Mech-GPT多模态人机交互等六大单元。梅卡曼德本来就是工业3D视觉和机器人软件公司,它的优势不是讲一个“巨型端到端模型包办一切”的故事,而是把“眼、脑、手”拆开做深。

谈到这些传统机器人公司的突飞猛进时,多位从业者都谈到,模型技术的进步其实大大降低了机器人的开发难度。

如身机器人创始人师云雷指出,过去基于规则的机器人控制算法需要高度复杂的建模才能实现,但是进入神经网络时代后,YOLO这样的算法就连本科生都能快速上手。

此外,大家也普遍提到了一个令人有些意外、又在情理之中的因素——vibe coding。

梅卡曼德创始人邵天兰对我们谈到,机器人是一个高度跨学科的领域,过去一家企业需要有软件工程师、机械工程师、电子工程师等不同分工,大量时间被花费在跨学科的对齐上。而且,由于技术突飞猛进,AI领域七大顶会一年能发表2万多篇论文,这是任何一个人都不可能读完的。

因此,用AI读论文,用vibe coding去实现,已经是行业内的普遍做法,极大提升了企业的开发效率。

这解释了为什么今年很多公司进步很快。

一部分进步来自基础模型能力变强,另一部分进步来自工程效率暴涨。过去只有顶尖研究团队能快速复现的东西,现在中小团队也能跟上;过去传统机器人公司可能看不懂的大模型论文,现在可以用AI辅助拆解;过去一个世界模型小实验需要很多算法人力,现在借助开源框架和代码助手,也能更快跑起来。

结果就是,具身智能行业的技术上限由头部模型公司拉高,技术下限则被AI编程工具抬高。

但这也意味着,市场在评估一家具身智能企业的价值时需要多一分冷静:一些“看上去很聪明”的机器人,不一定是有了革命性大脑,也可能是因为工程师有了更强的外脑。

数据不再是借口

2026年具身智能的进化,还有一个重要趋势:数据不再被视为不可逾越的瓶颈了。

过去,具身智能行业最常说的一句话是:机器人缺数据。

AI大模型的基础是Scaling Law,人类在互联网时代积累了海量的文本、图片、视频数据,这是大语言模型和图像、视频的免费养料。但机器人数据不一样,它不仅要图像、视频这样的视觉数据,还需要触觉、力觉等等多维度数据,而这样的数据在互联网上是不存在的。

为了得到这样的数据,过去的路径有两种。一是用机器人真机去采集,又贵又慢;二是用仿真器去生成虚拟数据,但生成效果难以完全拟真,导致训练效果要打折扣。

但到了WAIC 2026,行业对数据的态度变了。越来越多企业不再把“缺数据”当作停滞的借口,而是开始各自找粮食。

苏度走的是仿真数据路线,但是苏度工作人员强调,一方面仿真技术本身仍有很大的提升空间,另一方面,好的训练算法也能够大大降低Sim2Real的gap。

据称,苏度仅仅依靠几万条仿真数据,就能够在特定动作上实现超过99%的成功率。

眸深智能则大量使用了互联网视频数据。其数据“配方”中,仅10%采用真人遥操的机器人采集数据,而90%都来自公开互联网视频数据。

穆泽林对我们解释了其中的诀窍:一方面,他们对视频做了伪3D处理,模型看到的不再是一个平面视频,而是三维的动作轨迹。另一方面,其数据质量也经过了严格筛选,去掉了互联网上那些诸如“超人飞行”这样不符合物理规则的视频,只保留正常的人体动作。

这实际上也可以视为另一种仿真——不是用物理仿真器去做仿真,而是用人类视频去做仿真。

穆泽林甚至预言,未来绝大部分具身大脑公司都会转向用视频数据去做动作学习。

在低成本的原则下,多类数据混合使用的确在成为趋势。

大晓机器人还额外引入了真人行为数据,其采集成本相比于用机器人采集大大降低。Kairos技术报告中强调了跨本体数据结构,把开放世界视频、人类行为数据和机器人交互放进一个递进训练路径。

捅破数据不足的天花板后,具身智能有望迎来又一次能力跃升。

工厂已经能看到曙光,家庭还在雾里

不过正如我们一开始提到的,无论是世界模型的进化,还是数据飞轮的驱动,都还远远没有让具身大脑接近AGI的概念。这意味着,机器人想要走进真实生产和生活场景,还有相当一段距离。

今年WAIC上,各家公司披露了不少漂亮的成功率数字:95%、98%、甚至99.5%。但是谈到商业化落地,各家展台的工作人员都相当谨慎。

一方面,相对成熟的落地场景都集中在工厂、仓库、零售前置仓这样的半结构化场景。

物体种类有限,任务目标明确,空间可以改造,流程可以拆解,安全边界可以设置,失败可以定义,这是目前机器人能够理解的世界。而且也有客户愿意为前瞻性探索付钱。

但是一旦进入更加开放的商超、家庭场景,

苏度科技工作人员对我们直言,尽管对自家产品在行业内的领先性绝对自信,但目前的产品想要用于商超场景,在抗干扰能力上仍然不够好。

银河通用尽管在动作流畅度上已经相当接近真人,但仍然有网友拍到其机器人在空抓后没有纠错,直接进行下一步动作的场面。

而专注养老场景的如身机器人创始人师云雷指出,机器人进入家庭更是一个长期过程,现阶段仍处于测试和收集数据阶段。

师云雷也谈到,除了能力之外,机器人带来的隐私问题、安全责任分配问题,同样还缺少完善的解决方案。

2026年,我们还没有看到机器人的“ChatGPT时刻”,但我们的确看到,机器人的“大脑”开始变复杂了,它不再是简单遵从指令的工具,开始有了自主决策能力。

本文系观察者网独家稿件,未经授权,不得转载。