当 AI 走出屏幕:2026 具身智能的爆发与 VLA 架构进化史
2026 年 7 月的 WAIC 现场,近 60 台人形机器人在会场各角落承担导览、问询,不再只是供人拍照合影的"演员";工信部预判全年国内人形机器人出货量有望突破 10 万台,行业将这一年定义为"具身智能部署态元年"。几乎同一时间,特斯拉弗里蒙特工厂原 Model S/X 产线停用、首代 Optimus 专用产线正在安装,目标年产 100 万台;Figure 03 已在宝马斯巴坦堡工厂累计助力生产 3 万辆 X3,第 1000 台 Figure 03 正式下线。
把镜头从工厂拉回到架构层面,这场爆发的底层逻辑其实是一条清晰的技术主线:VLA(视觉-语言-动作)模型把"感知-决策-执行"塞进了同一个神经网络,世界模型补上了物理推演能力,跨本体泛化让一颗"大脑"能驱动不同躯壳。 本文试图沿着这条主线,拆解 2026 年具身智能从"Demo 表演"走向"产线交付"的技术拐点。
一、从"缸中之脑"到 VLA:一条被大模型重写的路径
腾讯首席科学家张正友在 WAIC 2026 上的一句判断,精准概括了过去几年 AI 的处境:今天最聪明的人工智能本质上仍是"缸中之脑"——缺乏与物理世界直接互动的闭环。GPT 能写诗、能解题,但它"看不见"面前的桌面、"摸不到"桌上的杯子,更无法把"把那个红色杯子递给我"这句话转化成一串关节角度。
VLA 模型要解决的正是这个断层。它的核心思路是把视觉感知、语言理解和动作控制统一到同一个端到端框架里:摄像头画面和自然语言指令作为输入,经过视觉编码器和语言编码器进入跨模态融合模块,最终由动作生成模块输出可执行的机器人控制信号,实现"看、懂、做"的闭环。从 RT-2 到 OpenVLA,再到 2026 年百花齐放的行业基座模型,这条路径的成熟度在一年内被快速验证。
理解 VLA 为何能成为行业共识,关键是抓住三处架构跃迁。
第一处是"动作即语言"的范式转换。 银河通用 6 月发布的 AstraBrain-WBC 0.5——全球首个 humanoid"小脑"GPT 基座模型——把这件事做到了极致:它用 GPT 式因果 Transformer 处理运动控制,把全身协调重定义为连续序列预测问题,不再输出孤立的关节指令,而是把运动理解成一种连续的"运动语言"。这个 8040 万参数的模型在 20 亿帧人类运动数据上训练,零样本泛化成功率 92.58%,端到端推理延迟仅 0.39 毫秒,论文被 CVPR 2026 接收。
第二处是"慢思考-快执行"的分层架构。 上海创智学院罗剑岚团队与智元机器人 7 月联合发布的 τ(0)-VLA 把高层任务规划与低层动作执行解耦,首次将 Test-Time Scaling 推理与世界模型推演引入具身智能上层决策,让机器人能完成超过几十个连续决策步的长程任务衔接。这对应的是 LLM 领域"System 1 / System 2"双系统思路在机器人侧的迁移——快的反射交给底层策略,慢的规划交给世界模型推演。
第三处是跨本体泛化。 蚂蚁灵波 7 月发布的 LingBot-VLA 2.0 支持 17 家厂商的 20 种机器人构型,动作范围从机械臂扩展到头部、腰部、末端执行器和移动底盘等全身自由度,靠的是数据管线、动态建模和空间感知(融合 LingBot-Depth)的协同。谷歌 DeepMind 7 月底的 Gemini Robotics 2 走得更远——用同一个模型检查点同时驱动不同第三方平台,实现"一权重跑通多硬件"。
VLA 的真正意义,不是让机器人多会一个动作,而是把"理解世界"和"控制身体"塞进了同一个可端到端训练的网络。 这意味着机器人第一次可以像大语言模型一样,靠 Scaling Law 吃数据变强,而不是靠工程师逐个任务编程。
二、2026 年核心玩家:一张格局速览表
为便于横向参照,下表汇总了截至 2026 年 8 月具身智能领域的主要玩家与代表模型(数据综合自厂商公告与第三方报道):
| 玩家 | 代表模型 | 技术路线 | 落地亮点 |
|---|---|---|---|
| NVIDIA | Cosmos 3 / GR00T N1.7 | 全模态世界基础模型,Mixture of Transformers 架构 | 3 月发布,首个统一合成世界生成、视觉推理与动作仿真的世界基础模型 |
| Google DeepMind | Gemini Robotics 2 | 单权重跨硬件,全身控制 | 7 月发布,同一检查点驱动多个第三方机器人平台 |
| Figure AI | Figure 03 + Helix 02 | 自研 VLA,System 0/1/2 三层架构 | 宝马斯巴坦堡工厂 11 个月运行、累计 1250+ 小时、助力 3 万辆 X3 生产 |
| Tesla | Optimus Gen 3 | 复用 FSD 视觉 + Cortex 2.0 超算 | 弗里蒙特专用产线年产能 100 万台,2026 年下半年启动量产 |
| Physical Intelligence | π0.7 | 组合泛化,多样化上下文条件 | 4 月发布,跨上下文技能重组解决未训练新任务 |
| 千寻智能 | Spirit v1.6 | 自研 VLA,"Act to Sense"反馈闭环 | ICRA 2026 盲测力压 Cosmos3 与 π0.5,登顶全球第一 |
| 腾讯 | Hy-Embodied 三件套 | VLM + RxBrain + VLA 全栈开源 | 日化工厂实测成功率 >95%、节拍 <6 秒/件 |
| 智平方 | NeuroVLA(类脑 VLA) | "皮层-小脑-脊髓"三层类脑架构 | 惠科 3 年 1000 台订单,金额近 5 亿元 |
| 银河通用 | AstraBrain-WBC 0.5 | GPT 式"小脑"运动控制 | 零样本泛化 92.58%,CVPR 2026 接收并开源 |
| 蚂蚁灵波 | LingBot-VLA 2.0 | 跨本体 VLA + 空间感知 | 支持 17 家厂商 20 种机器人构型 |
| 阿里 | Qwen-Robot 系列 | Manip/Nav/World 三模型 | 6 月发布,首个完整开源具身 AI 模型套件 |
| 字节 | Seedance / 机器人方向 | 世界模型 + 多模态生成 | 视频世界模型技术复用至机器人仿真 |
数据来源综合自各厂商 WAIC 2026 发布、ICRA 2026 现场报道与技术博客。
这张表透露出几个值得玩味的信号。其一,世界模型正在成为新的统一底座——NVIDIA Cosmos 3 把语言、图像、视频、音频、动作序列放进同一个模型联合处理,被定位为"Physical AI"的基础设施。其二,中国军团在算法层已从"提供躯干"走向"定义大脑",千寻智能 Spirit v1.6 在行业盲测中力压 NVIDIA 与 PI,成为第一梯队里最耀眼的中国大脑。其三,类脑架构开始进入主流叙事,智平方 NeuroVLA、银河通用 AstraBrain 都在借鉴"皮层-小脑-脊髓"的分层思路,以应对训练效率、算力和能耗挑战。
三、量产元年:从"会动作"到"会干活"的产业拐点
如果说架构层的故事是"把 AI 装进身体",那产业层的故事就是"让身体真正干活"。2026 年的赛道风向已经剧变——单纯跳舞、翻跟头的演示不再具备说服力,长序列自主作业、稳定干活才是核心竞争力。
几个被反复验证的工业级数据,比任何 Demo 都更有说服力。智平方 AlphaBot 2 在惠科复刻的 PCB 上下料"地狱级"产线上稳定完成全流程,核心部件无故障运行 2 万–5 万小时,本质区别于演示型机器人;其全球首条多机器人协同汽车 BMS 精密装配中试线部署 6 台 G2 机器人,全工序 7×24 小时无人化流转,并线作业稳定率达 99.9%。优艾智合的"隙锋"人形机器人仅需最低 50 条样本数据训练即可达到 90% 任务成功率,实现"当日进厂培训、次日达熟练工水平"。千寻智能的 Moz 机器人在宁德时代电池 PACK 生产线实际作业中,插接成功率持续超过 99%。
海外阵营的产能爬坡同样在加速。特斯拉把弗里蒙特工厂原 Model S/X 产线改造为 Optimus 首条专用产线,规划年产能 100 万台,得州超级工厂第二条产线长期设计年产能 1000 万台,2026 年全年生产目标定为 5 万台,马斯克在 Q2 财报会上称之为"特斯拉有史以来量产难度最大的产品"——整机所有零部件全新研发,无现成供应链可对接。Figure 03 自建 BotQ 工厂产能已提升至每小时 1 台、整机良率超 80%,创始人 Brett Adcock 的目标是四年内交付 10 万台。
2026 年的具身智能,正在经历从"技术验证"到"商业验证"的跨越。 申万宏源 8 月研报将其定义为"具身智能驱动的新阶段",三条主线是核心零部件、具身模型与本体、训练数据服务——而真正稀缺的,是跨本体、跨环境、跨任务的真实示教数据。
毕马威在 WAIC 期间发布的报告《跨越奇点》给出更宏大的判断:世界模型正在推动具身智能跨越商业化的"奇点"。科技部、工信部 6 月联合启动的实景实训专项行动设定了硬目标——到 2026 年底凝练出 100 个以上高价值应用场景,带动万台级规模落地。这意味着上半场比的是"谁更聪明",下半场比的是"谁更便宜、更稳定、更易部署"。
写在最后:具身智能的"ChatGPT 时刻"还有多远
宇树科技创始人王兴兴 7 月给出过一个判断:具身智能的"ChatGPT 时刻"最快两三年内到来。这个判断的底层支撑,是三道墙正在被同时推倒——大脑层靠 VLA 和世界模型把决策成本压到可商用,小脑层靠模仿学习和强化学习让机器人自学步态,硬件层靠中国供应链把电机、力传感器、灵巧手的成本逐年打下来。
把这条线索收拢,2026 年具身智能的爆发可以浓缩成一句话:VLA 统一了"感知-决策-执行"的架构,世界模型补上了物理推演,跨本体泛化让一颗大脑驱动多个躯壳。 这三步走完,"机器人干活"的定义已经从"精心布置的 Demo"变成了"工厂里 7×24 小时的稳定节拍"。
值得持续观察的是世界模型与 VLA 的路线收敛。智平方郭彦东在 2026 智源大会上终结了行业"世界模型 vs VLA"的路线之争,提出类脑架构是下一代物理世界 AI 的破局关键。NVIDIA Cosmos 3 则用 Mixture of Transformers 把推理模块和生成模块放进同一个世界基础模型,让"想象未来"和"决定动作"成为一件事。这条收敛路线的尽头,可能就是机器人真正离开训练场、进入千家万户的那一刻。
至于那个被反复追问的问题——"人形机器人什么时候进入家庭"——2026 年 8 月的答案比一年前清晰了一些:在工业场景,它已经在替代;在商业服务场景,它正在试点;在消费级家庭场景,主流预期是 2027 年之后。但技术曲线一旦越过某个临界点,时间表往往会比预期更激进。毕竟,三年前很少有人相信,一个能理解"把那个红色杯子递给我"并自主完成抓取的机器人,会在 2026 年的工厂里跑出 99.9% 的稳定率。
内容由 Qific2.1flash 模型辅助生成
Qific2.1flash 模型是千策人工智能研究院开发的旗舰多模态推理模型。基于 217B 总参数 / 23B 激活参数的稀疏 MoE 架构,原生支持图片和视频理解。