21世纪经济报道记者 孙燕
随着模型蒸馏、量化压缩等技术的成熟,以及手机、PC、汽车等终端设备硬件能力的跃升,大模型正在经历一场“下沉运动”。
北京智源人工智能研究院联合端侧实验室在WAIC 2026上发布的《端侧智能2026——规模化落地元年》报告指出,大模型正在经历第二次结构跃迁:从以云端为唯一算力中枢的单点智能,走向端云分工、彼此协同的分布式智能系统。
“端侧主内,云端主外。”面壁智能CEO李大海告诉21世纪经济报道记者,在终端上,所有上下文都应该由端侧模型进行处理,才能确保端上的隐私得到有效保护;但终端不掌握世界信息,需要云端的智能协同才能做到。
李大海进一步指出,意图理解与分发最终一定由端侧主导。这是因为,端侧掌握了用户的需求,也了解需求的背景,同时要把背景剥离开保护好隐私,再把对应拆开的任务分给云端。“一定要由端侧主导。”
7月15日,国家网信办公布最新一批生成式AI服务备案,三星“盖乐世A”正式获批,其端侧大模型能力由面壁智能MiniCPM系列提供,支持文本理解与多模态感知双引擎。这是中国端侧AI大模型首次规模化赋能全球顶级终端厂商。
“手机的端侧智能化还处于早期阶段。参考智能汽车上自动驾驶技术的发展,我们会观察到,自动驾驶技术是70%由第三方来提供、30%自研的状态。”李大海指出,随着手机的发展,可能也会出现类似的情况。
在手机之外,MiniCPM也已落地汽车、具身智能、航天等多元终端。
大模型从云端走向终端,背后是端侧对时效性与隐私性的双重追求。当AI走进物理世界,延时成为了不可容忍的缺陷:自动驾驶汽车需要在毫秒级时间内判断路况,智能家居需要对用户的语音指令做出即时反应,这些场景都无法忍受数据往返云端带来的网络抖动。更重要的是,真实世界的数据包含了大量的个人隐私、生活习惯甚至生物特征,将计算留在本地,让数据不出域,成为了AI走进物理世界的基石。
端侧大模型加速落地的同时,端云协同的重要性愈加凸显。
李大海举了这样一个例子:曾有自动驾驶公司因云端控制逻辑出现技术故障,导致所有车辆同时瘫痪在马路上。“这就是过于依赖云端控制带来的问题。从安全的角度上讲,更应该做端侧控制,云端则应该做协同:云端要把一些策略想清楚,然后分发到端上,端上根据各自的情况做控制,这才是更加安全的做法。”
“完全靠终端也有后续的升级以及协同问题。所以要有端侧的智能,也要有云端的能力做协同,我相信两者一定会长期共存。”李大海指出。
端侧大模型的加速落地,直接将压力传导给了底层的芯片——要在体积受限、功耗敏感的终端设备上运行原本需要庞大算力支持的AI大模型,这对芯片设计提出了近乎苛刻的要求。
端侧模型要落地于实际场景,需要在芯片有限的算力、带宽、散热与功耗限制下推进:不仅需要在有限面积内通过集成NPU实现算力密度的质变,以支撑大模型的高效推理;还需攻克内存带宽与能效比的瓶颈,在高强度的长时间运行中平衡性能与功耗;更要求具备高效的异构协同能力,调度多类单元实时处理多模态信息。
面壁智能副总裁周树峰也指出,算法和芯片的融合难度非常大,需要芯片厂商和模型厂商紧密合作,甚至芯片厂商需要调整芯片上的算子,模型厂商适配完后也要做模型的校准,从而在芯片上保持尽量接近于原模型的精度。
同时,端侧AI芯片路线也并未收敛,传统NPU优化、SRAM存算、RRAM存算、光计算等技术路线多元并进。
面壁智能总裁雷升涛告诉记者,本质上这些技术路线都在解决端侧推理效率的问题。而影响端侧推理效率最根本的是带宽瓶颈,也就是在计算时得把权重、上下文搬运到GPU、NPU。“各条技术路线都有可取之处,我们不会单押某一条技术路线,我们追求的是把端侧模型的知识密度提升到极致。”
“根据第一性原理,我们相信未来一定能够做出跟人脑效率一样高的端侧智能,即能够用低于30瓦的功耗具备类似于普通人甚至更强的智能。要做到这件事,需要在模型上面不断提升各种能力,也需要更低功耗的芯片。”李大海指出,各种存算一体的芯片都是很好的方向,也期待比存算一体更进一步的芯片范式产生。
在他看来,随着端侧芯片和端侧模型的快速发展,可能3—5年后,端侧AGI就能够到来。“云端的算力更大,AGI会到来得更快一点,端侧通常会比云端慢1—2年。”