}

文 | Leading
从L1到L3,自主交互正在成为具身智能最容易被低估的能力分水岭

过去一年,具身机器人最常见的进步,是动作越来越像人。

它们开始叠衣服、整理房间、端咖啡、分拣物品,也能在舞台上奔跑、跳舞甚至完成高难度动作。到了2026年,行业讨论的重心已经明显从“能不能动”转向“能不能干活”。在世界机器人大会等行业活动中,数据、VLA、世界模型、泛化能力和商业化,成为具身智能公司反复讨论的关键词。

但机器人真正进入家庭、校园和养老机构后,很快会碰到一个比“会不会干活”更麻烦的问题:

它什么时候应该主动?

孩子一个人坐在走廊里,机器人要不要靠近?老人一上午没有明显活动,系统是否应该询问?用户嘴上说“我没事”,但语气、表情和行为和平时不同,机器人应该继续追问、提供建议,还是保持安静?

太被动的机器人只是一个长了腿的智能音箱;过度主动的机器人,则可能成为一个没有边界感的陌生人。

具身智能下一阶段的难题,已经不只是让机器人学会行动,而是让它知道什么时候可以介入,介入到什么程度,以及什么时候必须把判断交还给人。

这意味着,行业需要补上长期缺失的一张能力表:自主交互分级。

行业给机器人的手脚分了级,却没有给“边界感”分级

目前,具身智能的大多数能力体系,都围绕感知、规划、控制和执行展开。

机器人能否识别物体,能否在动态环境中行走,能否完成长程任务,遇到失败后能否重新规划,决定了它在物理世界中的自主程度。2026年发布的人工智能终端智能化分级,也将终端能力划分为响应、工具、辅助和协同等不同阶段,说明AI终端正在从执行单一指令,走向理解上下文和跨设备协作。

但这些分级主要回答的是:机器人能独立完成多少任务。

进入人类生活以后,还需要回答另一个问题:机器人可以在多大程度上主动影响一个人?

移动、抓取和操作物体,属于任务自主;主动问候、提醒、安慰、追问和联系家属,则属于交互自主。前者影响物理环境,后者直接介入人的情绪、关系和决策。

过去,交互被看作机器人的附属界面:只要语音识别准确、回答自然、屏幕流畅,就算“会交互”。但当机器人拥有摄像头、麦克风、长期记忆和主动行动能力之后,交互本身已经成为一种行为。

机器人走向一个孩子、持续注视一个老人、主动提起一段过去的经历,和手机弹出一条消息并不是同一回事。具身存在会放大机器的在场感,也会放大每一次错误判断的影响。

所以,衡量自主交互不能只看“像不像人”,还要看它是否知道边界。

L1:被动响应,机器人仍是“有身体的工具”

自主交互的L1阶段,是被动响应。

用户说一句,机器人回答一句;用户发出明确指令,机器人完成相应动作。它可以回答问题、播放内容、完成测评、带领训练,也可以执行“把水拿过来”“打开灯”“提醒我吃药”等任务。

这一阶段的系统逻辑比较简单:

用户发起请求,机器人识别意图,调用相应能力,再返回结果。

L1的优势是可控。机器人的权限来自用户的明确指令,开发者只需重点解决识别准确率、响应速度和任务成功率。即使出现错误,影响范围通常也局限在一次交互中。

但它的局限同样明显。

老人没有主动说身体不舒服,机器人就不会询问;孩子遇到挫败却不愿开口,系统也无法提供帮助。机器人看似24小时在场,实际上仍然在等待人类按下一个看不见的按钮。

很多所谓“陪伴机器人”仍停留在这个阶段。它们能够说出温柔的话,却无法理解一句话为什么在此刻出现;能够记住用户名字,却不知道一段旧记忆是否已经失效。

L1解决的是“机器人能不能回应”,还没有解决“机器人是否理解正在发生什么”。

L2:理解上下文,但主动权仍然属于人

进入L2阶段,机器人开始具备情境理解能力。

它不再只处理一句话,而是把语言、表情、行为、事件和历史互动放在一起,判断用户当前处于什么状态,以及什么因素可能引起了这种变化。

例如,一个孩子在完成拼图任务时连续失败,动作速度变慢,回答变短,随后把拼图推到一旁。L1机器人可能只会等待下一条指令;L2系统则可以把这些变化组织成一个事件:

任务连续失败,参与度下降,用户暂时中止任务,建议降低难度或询问是否需要休息。

这里最重要的进步,不是机器人给孩子贴上了“焦虑”“厌学”或“性格内向”的标签,而是它开始理解状态如何随着事件变化。

观察和结论必须分开。

“用户沉默时间变长”是观察;“用户可能出现挫败感”是带有置信度的状态假设;“用户存在心理问题”则已经超出了普通机器人应有的判断边界。

因此,L2可以提供选项,但不应擅自替人作出高影响决定。

它可以问:“要不要休息一会儿?”也可以提供“继续尝试、降低难度、找老师帮忙”等选择,但最终的互动方向仍由用户、老师、家长或照护人员确认。

L2真正的技术门槛,不只是多模态识别,而是把事件、状态、记忆和策略连接起来,同时允许用户纠正模型。

如果机器人判断错了,用户能不能说“我不是难过,只是在想事情”?这次纠正会不会更新后续策略?过去的状态记录是否会随时间降低权重?

一个不能接受纠正的情感模型,只是在用更复杂的方式固化偏见。

L3:有限自主,机器人开始决定“是否介入”

L3是自主交互真正发生质变的阶段。

这一阶段的机器人可以在特定条件下主动发起互动,并根据用户回应调整策略。它不必等待明确指令,但它的自主性受到场景、权限、风险等级和置信度约束。

比如,居家机器人发现老人长时间没有出现在常用区域,可以先进行一次温和询问;如果老人正常回应,事件被记录并结束;如果多次询问仍无回应,系统才将信息交给子女或照护人员。

在校园中,机器人发现学生在一次任务失败后明显减少互动,可以提供短暂休息或简单放松选项;如果状态持续变化,则把事件摘要交给老师,而不是自行进行所谓“心理干预”。

因此,L3并不意味着机器人什么都能自己决定。恰恰相反,真正成熟的L3必须同时具备四种能力:

发现变化,判断可信度,选择低风险策略,并在达到边界时完成人工接管。

这套逻辑的关键,不是“主动”,而是“有限自主”。

机器人可以主动问候,但不能无限追问;可以提示关注,但不能给出诊断;可以调用经过确认的历史记忆,但不能把一次偶然倾诉变成永久人格标签;可以通知老师或家属,但必须说明触发提醒的事件和依据。

L3的最高能力甚至不是更积极地采取行动,而是知道什么时候不行动。

这也是它与传统主动营销、推荐算法最大的区别。推荐系统猜错一次,用户可能只会看到一条不感兴趣的内容;家庭机器人判断错一次,却可能打扰真实关系,制造不必要的焦虑,甚至让用户产生被监视的感觉。

自主交互越深入,企业承担的责任就越重。

从L1到L3,增加的不是功能,而是责任

如果只从产品界面看,L1、L2和L3之间似乎只是功能越来越多。

但从产业角度看,这三级能力对应的是三种完全不同的责任结构。

L1的责任主要在任务执行:机器人有没有听懂,动作有没有完成。

L2增加了解释责任:系统为什么认为用户状态发生了变化,使用了哪些信息,判断是否允许被纠正。

L3则增加了介入责任:机器人为什么在此刻主动靠近,为什么发出提醒,为什么选择通知某个人,以及谁对后续行动负责。

这意味着,具身机器人不能只建立“感知—决策—执行”的技术闭环,还要建立“观察—判断—交互—确认—人工接管”的责任闭环。

近期钛媒体对陪伴机器人产业的观察提到,数据安全、真实亲密关系与工程成熟度,正在构成情感陪伴机器人商业化必须跨越的三重门。产品可以量产,但信任无法随着产量同步复制。

自主交互分级的意义,正是把抽象的“信任”转化为可以设计和验证的系统能力。

企业需要明确每一种状态下机器人的权限:哪些变化只记录,哪些可以询问,哪些需要提醒,哪些必须转交真人。每一次策略调用还应留下依据、置信度、用户反馈和后续处理结果。

没有这套机制,所谓自主交互,很容易退化成“机器人想说什么就说什么”。

具身智能的下一批数据,可能不是动作数据

当前具身智能行业的竞争重心仍然集中在数据。

企业正在采集大量抓取、行走、操作和任务执行数据,希望模型获得更强的物理泛化能力。行业普遍认为,机器人要从Demo走向规模化部署,需要建立数据、评测和真实场景反馈之间的持续循环。

但如果机器人未来需要服务人,仅有动作数据还不够。

自主交互模型真正需要的,是另一类连续数据:

发生了什么事件,人的状态如何变化,机器人采取了什么策略,用户如何回应,真人是否修正了模型,以及这次互动最终有没有产生积极效果。

这不是简单的“情绪标签库”,而是一套事件、状态、策略和结果之间的时序关系。

同样一句“我没事”,可能意味着平静、回避、疲惫,也可能真的只是不想继续交流。模型不能仅根据表情或语气给出答案,而要结合事件背景、个人基线和后续反馈不断修正判断。

这类数据的价值,在于教会机器人如何与人相处,而不仅是如何模仿一句共情话术。

EmoGPT真正需要证明的,也不是“更会聊天”

一些情感智能企业已经开始探索这种分层路径。

例如,领本AI尝试将EmoGPT放在机器人、Pad、APP和后台系统之间:机器人承担现场感知和具身接近,Pad为用户提供明确、可选择的互动入口,模型负责组织事件、状态和建议策略,老师、家长或照护人员则负责复核和后续跟进。

这类架构的价值,不是让机器人变成“比真人更懂用户”的情感替代品,而是让不同终端共同完成一条可追溯的协同链路。

不过,任何一家企业要证明自己真正进入L2甚至L3,都不能只展示一段顺畅对话。

它还需要回答更难的问题:误触发率是多少?状态判断如何被纠正?长期记忆何时更新或遗忘?不同设备之间如何隔离权限?机器人主动提醒后,真人是否真正接手?系统有没有记录最终结果?

这些指标或许没有机器人跳舞直观,却更接近家庭、校园和养老客户真正愿意持续付费的原因。

具身智能的“GPT时刻”,可能先需要一张交互驾照

2026年的具身智能正在从表演期走向部署期。行业开始追问机器人到底能不能创造真实价值,而不只是完成一段精心设计的演示。

但从实验室走进人类生活,机器人需要跨越的不只是技术成熟度。

工业机器人可以在围栏内追求效率,家庭机器人却必须理解尊重;仓储机器人可以按照订单持续工作,校园机器人却不能因为识别到一个状态变化就持续追问;机械臂的优秀体现为动作准确,陪伴机器人的优秀有时反而体现为适时退后。

未来评价一台机器人,或许需要同时看两张能力表。

一张衡量它能完成多少物理任务,另一张衡量它能以多大自主程度介入人的生活。

L1解决回应,L2解决理解,L3解决有限自主。越往上走,机器人越聪明,企业也必须越克制。

具身智能真正成熟的标志,不是机器人终于可以替人决定一切,而是它学会了在关键时刻,把责任交还给人。