2026 云栖大会正在进行时……
当 Agent Native 成为 AI 的新主流叙事,产业焦点从云侧 AI 基础设施开始转向端侧,中国 AI 的另一个半场浮出水面。
千问发布 Qwen Intelligence 进入 AI 手机;千问 AI 眼镜、AI 耳夹式耳机、AI 录音硬件、千问原生桌面终端同期亮相……
阿里巴巴集团旗下斑马智能首席产品官蔡明表示:「相比手机和眼镜等智能终端,车对 AI 尤其是对 Agent 的诉求更加迫切,车也将会成为 AI 体验最好的具身智能终端。」
AI 竞争的一次转向
昨天上午,杭州国际博览中心举办了一场论坛「原生智能・端上生长——Agentic AI 重构下一代终端」。会场外停着八辆车,来自腾势、神行者、红旗、智己、MG 等不同品牌,其中一辆是首款搭载高通骁龙 8397 平台与斑马智能 AutoOmni 的量产车。
这辆车的核心亮点是,它的智能座舱模型跑在车规芯片上,而非云端。按斑马智能的定义,AutoOmni 是一个面向智能终端的全模态端侧大模型系列,负责座舱里的听、看、理解与调度。本次云栖大会上,该产品线迎来新一代主力型号:AutoOmni 2.0-23B-A3B。
两周前,工业和信息化部发布的《“人工智能+软件”专项行动实施方案》专门指出,支持软件企业与智能手机、智能家居、智能网联汽车等终端厂商联合创新,加速轻量化模型与终端软件融合部署应用,探索发展具身智能系统软件。
这里,我们看到了当下 AI 竞争的一次转向,从国家政策到产业选择:竞争的胜负手正从云端模型的能力转向端侧,即模型能不能在有限的内存、算力和网络条件下,把事情稳定且安全地做完。
9 月 18 日,中汽信息科技(天津)有限公司技术总监康凯在泰达论坛发布了《中国具身智能产业发展报告 2026》,报告提出三个关键判断:
-
第一,具身智能已走过技术验证阶段,当前处于价值验证阶段;
-
第二,汽车产业与具身智能在感知、决策、执行底层逻辑上高度相似,产业链复用性强,汽车工业是具身智能落地工业场景的关键试金石;
-
第三,降本与商业化闭环将决定大规模应用,尤其是 toC 领域。
康凯强调,「具身智能若不能在汽车行业大范围应用,就难以在工业领域真正铺开。」与之呼应的是,斑马智能首席技术官司罗认为「智能汽车是具身智能最大的中试场,规模化压测平台」。
大模型上车的第一阶段是一道模型题,核心关注点是「模型与车的连接」。第二阶段是系统工程题,要回答的是装进去之后扛不扛得住内存、时延、越狱注入以及欧洲的认证审核……
如今,第一阶段的成绩与第二阶段的困境正在同时发生。
AI 上车了,然后呢?
先来看几组数据。
第一组是渗透率。按工信部披露的数据,2026 年上半年具备 L2 级组合驾驶辅助功能的乘用车新车渗透率达到 70.5%,具备领航辅助(NOA)能力的车型装车率超过三成。硬件层面的普及已经基本完成。
第二组是付费率。据多家行业调研数据,国内高阶智驾的付费订阅与买断整体渗透率不足 10%,多数自主品牌自研智驾的付费激活率不足 30%,而在 20 万元级以下的走量家用车型上,付费率甚至低于 2%。
更值得注意的是认可度与付费意愿之间的错位。麦肯锡《2026 中国汽车消费者洞察》显示,约八成受访者将城市 NOA 视为购车时的重要选项;另有罗兰贝格等多家调研机构的结果显示,多数用户认为核心智驾与座舱的基础功能应当免费标配。也就是说,用户认可这项能力的价值,但不认为它应该被单独收费。
「核心原因在于,行业尚未形成真正的超级智能体交互范式。」斑马智能首席战略官邢悦这样解释智驾软件付费转化偏低的原因。
座舱侧也有同样的落差。据斑马智能提供的数据,从 2024 年中启动全面 AI 转型至今,该公司对主流车企的服务覆盖率达到 68%,在端侧智能与端模型应用领域的市场份额为 63%。
但装机不等于使用。斑马智能首席产品官蔡明的判断是:「AI 上车不是终点,更是一个更重要问题的起点:用户的深度使用。」
斑马智能首席产品官蔡明认为,深度使用的核心在于,基于意图驱动、AI 真正懂「我的世界」,这就需要在端侧发生一场交互范式变革,需要以用户为中心的跨端上下文和记忆连通。
因此,AI 上车大潮之后进入第二阶段的竞争,发生在模型与硬件的交界处,即端侧。
端侧的三堵墙与产业约束
把端侧理解为「云端模型的缩小版」,是这个领域最常见的误解。端侧的约束不是尺寸,而是三堵墙:
-
内存墙:车规级芯片的运行内存远低于服务器,且要和座舱系统的其他进程共享。一个模型能不能跑起来,往往不取决于算力峰值,而取决于权重能否驻留。
-
时延墙:座舱交互的容忍度以百毫秒计,主动安全类的提醒更短。云端往返的网络抖动可能吃掉全部预算。
-
并发墙:真实的座舱不是单任务环境,语音、视觉、车控、导航、音乐往往同时在线,模型需要在多路任务下保持稳定,而不是在单任务 benchmark 上刷高分。
这三堵墙之外,还有两项来自产业的约束:
-
隐私,座舱内的语音、图像、位置属于高敏数据,全量上云在多数市场已不可行。司罗判断:「车是一个非常重要的半封闭的场景,需要保护隐私的场景。」
-
成本,Agent 时代的 token 消耗是持续性支出,全部由云端承担意味着车企要为每一辆在用车支付长期账单。
斑马智能首席技术官司罗认为:车主和 OEM 厂商在车本身的芯片能力上已经花了很大成本,端模型的价值就是把这部分已付出的硬件价值释放出来,「把端上的能力变成我们真正的端上的 token 工厂」,从而大规模降低传上云的流量与云端 token 消耗。
顺着这两项约束,司罗给出了三个趋势判断:
-
端 AI 随着端侧算力与资源的快速提升进入快速发展期,且端上做的不是云端能力的简单迁移,而是差异化能力;
-
云侧 AI 从级联式的小模型链路全面转向大模型驱动,端云一体的整体架构从 2026 年开始出现、之后会成为主流;
-
舱驾融合加快落地,2026 年以两个系统互相调用的形态出现,之后走向模型层面的融合。
其中第一条便是这篇文章的起点:端侧的价值在于做云端做不了的事:长聆听、长睁眼、善记忆,从而形成主动服务。
这一趋势在产业层面还有另一重含义。当端侧承担起感知、理解与执行的完整闭环,它就更接近一层基础设施:AI 能力要落进汽车、机器人这类实体产业,都要从这一层过。
如果放到全球 AI 角逐与产业竞争的视角,斑马智能在谋求的,是建设产业级甚至国家级的端侧 AI 基础设施,其价值在于把操作系统、端侧模型、执行框架、芯片推理与云上生态做成可以量产的整体。这个目标能否成立,要看后面几层能力是否真的握在自己手里。
端侧的解可能是稀疏化
内存墙的存在,使得稀疏架构在端侧的意义比在云端更重要。
在云端,MoE 解决的主要是训练与推理的经济性问题,即用更少的激活参数换取更大的总参数容量。
在端侧,这件事的性质大不一样,它决定的是一个模型能否被放进芯片。总参数决定能力上限,激活参数决定单次推理的内存与算力开销,二者解耦之后,端侧才有机会在有限的物理资源上获得接近中大型模型的能力。
斑马智能的 AutoOmni 走的正是这条路线。司罗在演讲中把端模型的竞争要素概括为四句话:「首先基模是支柱,同时量化与部署在端上是壁垒,系统是围栏,能够有差异化的场景是非常重要的特色。」四个词各指一层:基础模型决定能力上限,量化与部署决定能不能真的装进车里,系统决定它的行为边界,场景决定它值不值得用。在端侧,第二和第三层才是真正的分水岭。
在工程指标上,斑马智能这套端侧方案可概括为多、快、好、省四项:多指 8 路以上多任务稳定并发,快指大模型推理提速 5 至 6 倍,好指 99% 以上的量化保真度,省指运行内存占用减少 50%。
这四项里,最能说明端侧工程性质的是后两项。量化是端侧部署的必经之路,但激进量化会以精度损失为代价,保真度指标衡量的正是「压缩之后还剩多少」;内存占用减半则直接决定了模型能否与座舱其他进程共存。
在此之前,斑马的端侧主力是 4B 的稠密模型。据司罗介绍,相比通用领域的大模型,AutoOmni-4B 在智能座舱的全场景平均能力提升达到 20%,其中座舱文本(车控、导航、娱乐等)的理解提升 22%,视觉相关的场景理解提升 17%,音频尤其是情绪与语音理解的提升更大,达 122%,同时在通用领域的能力与头部通用大模型保持一致。
端模型的天花板在哪?
4B 能做的事已经不少。现场放出的实车视频里,它完成了多意图与跨意图的连续车控,也通过手车互联直接操作了微信、读取并转述消息。但司罗把一个更关键的问题摆了出来:端模型的天花板在什么地方?是不是能够接近云侧大模型的能力?
这正是 AutoOmni 2.0-23B-A3B 要回答的。按他给出的口径,这个激活 3B 的 MoE 端模型在智能座舱场景下,普通任务基本相当于 10 倍参数量的云侧模型,复杂任务的处理能力相当于 10 倍参数量云模型的 80% 到 90% 之间。
评测覆盖四类复杂任务,端侧表现均已接近云侧大模型:
现场播放的实车视频里,一条连续指令包含调整座椅位置、打开前排按摩、开启全车通风三个动作;随后的导航任务则经历了「去王总公司」「去之前先把王总的儿子和女儿接上」「在附近找一个加油站并添加为途经点」的多轮追加与重规划。
比数字更有说服力的是司罗对迭代速度的一段自述:「就在一个月前、三周前,当时我第一次来评测我们自己模型的能力的时候,差距是非常非常大的,我当时一个判断是在一季度内我们不可能做展示。但是就在短短的几周之内,通过我们快速的迭代以及能力的提升,已经提升到在很大程度上接近云侧模型。」
一位 CTO 在发布现场承认三周前自己还判断「不可能展示」,这句话透露的信息量不小:端模型能力提升速度,比从业者自己的预期还快。
支撑这套能力落地的是大算力芯片适配。据介绍,斑马智能已经合作包括高通、英伟达、紫光展锐、小鹏图灵在内的十家芯片厂商;这条路径始于 2025 年云栖大会与高通联合发布的 8397 首个座舱 AI 端侧方案,到 2026 年已有多个量产车型落地,也就是会场外那辆搭载骁龙 8397 的车。
端云协同与大小脑分工
端侧变强不等于云端退场。真正的架构问题是分工。
斑马智能的分工方式是把理解与执行分开:AutoOmni 承担多模态理解与规划,相当于大脑;AutoClaw、System Agent 与 Harness 承担意图拆解、任务路由与受控执行,相当于小脑。
司罗在演讲中清晰地说明了这套框架的职责:以端侧模型为底座的端云一体框架,除了模型能力与上层的 Harness Engineering 框架能力之外,还要统一安排什么样的任务放在云上、什么样的任务放在端上,以及数据如何分配(比如哪些隐私数据必须留在端上,哪些记忆数据可以经过总结之后放到云上)。
这样一来,端云协同就不再只是愿景,而变成了两个能实际解决的问题:任务按什么标准切分?数据按什么标准留存?
在此之下,端上的 Agent Group 按领域拆成导航、媒体、主动视觉、GUI 等分支,由 SystemAgent 统一负责分域与拒识、主动参与、记忆信号提取,以及端云后仲裁(端侧与云侧各自给出结果,再由系统裁决采信哪一个)。记忆则单独成层,通过 Memory 接口完成实时信息提取、个人信息注册与记忆增强,底下用 SQLite 与 RAG 落地存储。
拒识这一项,现场的 demo 给了一个很直观的注脚。视频里两位乘客正在聊天,车机始终在听,却不作声;直到其中一人说出「外面太吵了,可以把车窗关上吧」,它才响应。司罗在旁解释:「它可以分辨什么时候是人人对话,什么时候是人机对话。」全车全时免唤醒的难点其实不在「听得见」,而在「知道什么时候不该应答」;这正是拒识的工作。
而端侧记忆走 SQLite 与 RAG 则是蔡明所说的「我的世界」在实现层的落点:愿景是让 AI 懂每个用户,代码层面就是一张本地数据库加一套检索。按司罗给出的数字,斑马目前已与合作伙伴一起搭建了数十个主动智能场景,能力概括为「长聆听、长观察、善记忆」。
云端的角色则是知识与复杂推理。蔡明把这套端云一体架构概括为三个连通:「首先是端上和云上的算力和服务的连通,这是元神 AI 的主体;第二,实现了围绕着用户的各个智能终端的连通,所有的数据和场景被打通,AI 能够真正完整地理解我的世界;第三个,实现了用户与服务的连通,围绕用户所有服务都可以完全实现跨场景、跨端、跨 APP 的整合与联动。」
下一步:把这层执行框架推到智驾侧
座舱之外,斑马把同一套思路延伸到了智能驾驶。据介绍,公司正与头部智驾厂商合作,第一阶段是用座舱的自然语言理解与规划能力,去调用智驾系统提供的 API 接口,以此实现更好的出行体验;第二阶段则是更深的耦合,座舱与智驾在模型层面融合。
按其技术方案的描述,这条链路从传感器输入与用户需求出发,先经过一道由规则加提示词构成的安全边界,再通过工具和协议去调用自动驾驶能力,智驾方案商把能力封装成 activate_noa(destination)、lane_change(direction) 这类函数交给座舱侧调用。到了第二阶段,座舱大模型的 VLM/VLA 识别与推理结果将直接影响智驾行为,用于增强场景理解与规划、协助处理长尾场景。
这套设计里最值得注意的是那道安全边界被单独画成了一个环节。模型负责理解「离前面那辆货车远一点」,而系统负责保证这个理解不会变成一次危险的变道——这正是前面所说的执行框架在智驾侧的形态。
端侧 AI 的安全与合规问题
端侧要把模型部署到车上,但也会带来两个问题:
-
一道对内:模型拿到执行权之后,系统能不能管住它?
-
一道对外:这套东西能不能被第三方认可,从而进入不同的市场?
前者决定 AI 在车里敢做多少事,后者决定这辆车能开到哪里去。用司罗的话说,「随着端能力的出现,端安全变成了一个新兴的至关重要的功能」。
把模型的不确定性关进系统的笼子
「数据不出车」是端侧最常被引用的安全论据,但它只回答了数据去哪儿的问题,没有回答模型在车内做什么的问题。座舱里的 Agent 有权调用车控、导航、支付和通讯,一次越狱注入或一次工具劫持,都可能造成严重后果。真正的安全不是离线,而是让数据、模型和执行权都处在可控边界内。
据斑马智能介绍,其车规级端侧 AI 安全体系分为三层纵深:
-
环境层用模型可信加载、推理进程沙箱、资源隔离、强制访问控制与运行时入侵检测,保证模型的运行环境本身隔离、可审计;
-
框架层用身份透传与权限保持、MCP 安全协议、上下文与记忆隔离、风险监测与全周期审计,约束 Agent 对工具和服务的每一次调用;
-
内容层则在端侧部署轻量化安全模型,完成生成侧的合规校验。
三层之上还有一层云端安全运营,负责安全模型的训练更新、内容安全策略的运营与信息安全态势感知,通过一条可信端云通道与车端联动。这一层的存在回答了一个自然会被问到的问题:端侧的安全模型如果不联网,如何应对不断出现的新攻击手法。斑马的答案是策略与模型在云上迭代、经可信通道下发,而每一次校验仍在车内完成。
实测结果很亮眼:这套体系对越狱攻击的召回率在 98% 以上。
比防御效果更能说明端侧特性的是成本账:在云端,安全模型的开销可以被弹性算力吸收;在端侧,它要和业务模型抢同一块内存和算力,必须自己养活自己。据介绍,其自研端侧安全模型的准确率达到行业专用 Guard 模型的同等水平,吞吐率提升 4 倍,对系统整体性能的影响控制在 3% 以内。
由于校验全部在端侧完成,敏感数据无需上传即可完成审查,更关键的是安全校验本身也不再依赖网络,不会随网络条件变化而失效。
认证是出海的前置条件
中国智能座舱在体验维度上的领先已是行业共识。如今,宝马 iX3 及全系新车、大众、保时捷等国际品牌均已接入中国智能技术体系。司罗此前表示:「中国智能座舱相较于欧美市场,已领先一至两个技术代际,核心优势在于场景挖掘、资源整合、服务闭环的完整落地能力」。
但体验领先不等于可以直接出海。欧洲市场的准入有一组硬性要求:数据侧有 GDPR,网络安全与软件升级侧有联合国 UN R155 与 UN R156 法规,驾驶员控制辅助系统侧有 UN R171,2027 年还将有中国国家标准的相关要求生效。
据斑马智能介绍,国内部分基于原生 Linux 开发的智能驾驶车型尚难以完全满足上述车规级安全标准,为此该公司自研了安全增强型的 Banma Safety Linux 操作系统,已通过 ASIL-B 车规级功能安全认证;在 AI 工程侧,该公司已于 2026 年 1 月通过 ASPICE 4.0 CL2 认证——该标准由德国汽车工业协会联合二十余家欧洲主要车企制定,4.0 版本显著强化了对 AI 与机器学习的适配。
认证在 AI 行业长期被视为流程性工作,但在车上它是准入前提:一个模型能不能上车,取决于它所在的软件工程体系能否被第三方证明可控,这与它在榜单上的位置无关。把操作系统、端侧模型、执行框架、芯片推理与云上生态五层能力同时握在手里,并让它们通过认证进入量产车,是斑马智能对自身定位的概括。
实际上,这也构成了端侧技术主权的一个落地样本,议题核心是从内核到应用的整条信任链能否被自己掌握、并被外部证明。
车只是第一站
回到那八辆停在会场外的车。
它们代表的其实是同一个判断的不同表述:云端决定中国 AI 能达到多高,端侧决定 AI 能否在真实世界里被允许去做事。蔡明在演讲中说,在意图经济中,「token 是 AI 进行意图理解、需求达成的燃料,是水电煤,是满足消费者意图的新货币」;而这套货币要在车上真正流动起来,前提是端侧能把理解、执行与安全这三件事在本地闭环。
也因此,端侧被越来越多地当成基础设施来讨论。如果说云端的竞争关乎中国 AI 的高度,那么端侧关乎的是它的深度与安全边界,而技术主权最终要落在这一层,落在可量产的终端里。
正如司罗所说,对整个端侧 AI 赛道来说,「智能汽车是具身智能最大的中试场和规模化压测平台」。它同时提出了内存、时延、并发、隐私与成本五项约束,而这五项约束在手机、眼镜、可穿戴和机器人上会以不同权重重复出现。斑马智能把这条外溢路径称为是从 AutoOmni 到 EdgeOmni:从一辆车的端侧大脑,到围绕同一个用户的多个终端,从单体智能到群体智能。谁先在车上把这道系统工程题解完,谁就握住了向其他终端迁移的模板。
昨天的论坛,交出的是这道题的一份阶段性答卷。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com