}

来源:环球网

【环球网科技报道 记者 李文瑶】“如果机器人要完成一个长程任务,它可能是10个动作、20个动作的集合。哪怕每个模块做到99%,失败率也极高。”在2026世界机器人大会(WRC)上,墨奇智能联合创始人兼CTO黄青虬向记者形容长程任务对系统稳定性的苛刻要求。

在展台,这家成立仅半年的公司对外展示了长达15分钟的家务长程任务演示——MORPHI KINO轮式机器人自主完成了客厅清洁、冰箱补货、衣物洗烘折叠等一系列操作,引发不少观众驻足。


“实验结果可能会有一部分留下来有用,也可能有一部分被推倒重来,但人才和Infra是会在这个过程中沉淀下来的。”黄青虬说。在他看来,具身智能仍处在行业发展的极早期,技术路线远未收敛,真正的壁垒不在于某一项算法的突破,而在于那些需要时间积累的东西——数据基建、人才梯队,以及对场景的理解。

谈投资:估值70亿,“投资人更多是投团队”

墨奇智能成立不到一年,产品刚刚亮相,估值已超过70亿元。当被问及对这一估值的看法时,黄青虬没有回避行业过热的话题。

“现在整个具身行业肯定存在一定的泡沫,因为现在落地产生的价值还远远跟不上各家具身公司的估值。”他说,但他并不认为这是坏事,“在具身这样一个大赛道长周期的行业,早期有一定泡沫是正常现象,也有一定的正向作用,能加速这个行业往前迭代发展。”

在他看来,投资本质上是投人。“技术路径会持续迭代,我们今天选择这个技术路线,随着行业的演进,肯定会动态调整。”黄青虬说:“从投资人的角度,更多的是投人,以及这群人在一些核心事情上的思考,肯定不是只投给我一个人,是投给我们整个团队。”

谈数据:“三个真实”比1万小时摆拍更有价值

数据短缺是具身智能行业公认的瓶颈,但黄青虬认为,问题的关键不在于数量,而在于质量。

“有些数采场地通过场景摆拍采集了1万小时数据,其中可能有9000小时重复,增加的时长未必能给模型带来更多变化。”他说,“我们认为,更高质量的数据是人佩戴轻量化采集设备,在日常工作中补充真实操作轨迹。”

黄青虬用“擦桌子”这个简单动作解释其中的差异:“在专门的数采场地里,数采员的目标往往是完成一条规定动作轨迹;但保洁人员的目标则是把桌子擦干净,会观察污渍,根据实际情况调整方向、力度和次数,没擦干净还会再来一次。”

墨奇对高质量数据的标准可以概括为“三个真实”——真实的人,在真实的环境,干真实的活。为此,墨奇自研了MORPHI Sense Kit真实世界数据采集系统,可在弱纹理、高反光等极端场景下实现毫米级轨迹重建,并深入酒店、商务公寓等商业场景采集一线作业数据,避免摆拍带来的分布偏差。


在数据处理环节,墨奇也搭建了一套系统工程。“采回来的数据要做严格的数据质量筛选,筛选之后还需要做分类,”黄青虬说,“今天要十万个叠衣服的,明天要一百万个放杯子的,我要有一个数据挖掘系统,给这些数据打上标签,保证随时能挖掘我想要的数据。”

但他也坦承,数据是一个系统性工程,目前并没有单点突破的解决方案。“从采集到门禁,到挖掘,到自动标注,到送进模型训练,它的卡点更多的是散落在中间的每一个点,而不是说有个单点突破就彻底解决了。”

谈场景:为什么墨奇选择“先难后易”的家庭场景

当大多数具身公司选择从工业物流等垂直场景切入时,墨奇却选择了家庭、酒店等更为复杂的场景。

“你选什么场景,就意味着你能拿到什么样的数据;你能拿到什么样的数据,就意味着你能训练出什么样的模型。”黄青虬说,“只有选择一个足够复杂的场景,才能回流多种多样的数据,在此基础上训练出来的基础模型的能力才会足够强。当有了一个足够强的基础模型之后,经过简单的微调,再去落地物流、工业这样垂直领域的场景,我认为是没有问题的。”

在具身形态上,黄青虬认为终局是全人形。“物理世界是为人类打造的,人形肯定能够最大程度适配我们的物理环境。相反,如果不做人形,那就要对物理世界做一些改造,但改基建的周期就会特别长。”

但墨奇在实现路径上选择了务实路线。“如果一上来就做最难的形态,可能就会陷入纷繁无尽的问题里,所以我们要先简化问题。”他说,“可以在人形的基础上去做裁剪,比如我现阶段还不想去解决双足稳定性的问题,那我先用一个底盘;我现阶段不想去解决五指灵巧手这种高自由度的控制问题,那我先用夹爪去干60%-70%的工作。”

他强调,这种“裁剪”与做异形产品有本质区别——“如果在人形基础上去做裁剪,数据是可复用的”,但如果做一个三头六臂的机器人,“可能都采集不到这样的数据,因为现在数据其实是靠模仿人去采集”。

谈未来:两个“ChatGPT时刻”,一个3年一个5年

对于行业高度关注的具身“ChatGPT时刻”,黄青虬给出了两个不同的定义和时间判断。

“第一种,就是它可以规模化地进入一个行业,可能是物流、零售这种简单的行业,也可能是to B的商用服务场景或者工厂,如果能够有1000台机器进去真实作业,会是一个比较大的突破点,”他说,“未来三年之内应该可以实现。”

“第二种,从能力的角度来说,具身的ChatGPT时刻是机器人能够进入80%左右的陌生场景、能够自主完成约80%的任务。这个定义其实描述的是具身大脑的泛化性,”黄青虬说,“从这个定义出发,我认为至少需要5年时间。”

至于C端家庭场景,他持更谨慎的态度。“C端场景更复杂,基本上就是要处理任意case,才能真正把机器人放到家庭里去。同时,C端也会有安全和隐私的问题,”他说,“走向C端,还是一个比较漫长的过程。”