当 AI 学会推演物理世界:2026 物理 AI 世界模型的架构演进与具身智能底座
一句话结论
2026 年 8 月 7 日 NVIDIA 发布 Cosmos 3——基于 Mixture-of-Transformers 双塔架构的开放物理 AI 基础模型,把视觉推理、世界生成、动作预测整合进单一系统;几乎同时,北大 EvoPhys-World 5D 世界模型在斯坦福 WorldScore 榜单连续 37 天登顶、南洋理工与北大联合推出 ω-0 隐空间预测世界动作模型、上海 AI Lab 提出“以 Agent 为中心”的 WorldProxy 新范式——这一系列进展共同标志着物理 AI 世界模型正从“生成逼真视频”的阶段,跨进“预测+动作+交互”三位一体的新阶段,成为机器人、自动驾驶、工业仿真迈向真实世界的底层认知引擎。
一、从“预测下一个 Token”到“预测世界下一时刻”:物理 AI 的范式迁移
过去三年,大语言模型把“预测下一个文字 Token”做到了极致。但物理世界的运行规律,无法用文字 Token 充分表达——一个杯子被推下桌子,它的坠落轨迹、碎裂方式、与地面的接触力学,是连续的高维物理状态,不是离散的语言符号。智源研究院把世界模型列为 2026 第一大技术趋势,核心逻辑就是:从“预测下一个文字 Token”升级为预测世界下一时刻物理状态(NSP 范式),掌握因果、时空、物理规则。
物理 AI 要回答的是两个根本问题:“世界接下来如何变化”,以及“实体发生动作之后,世界会如何反应”。这要求模型处理视频、传感器数据等高维、连续、含噪数据,构建预测模型,洞察环境演变及自身行动的影响,并具备规划、推理、控制和安全可控能力。
这个范式迁移的工程含义是深远的。传统机器人开发依赖“工程师把所有路况写成规则”(1.0)或“模型从海量数据里自己学,但本质还是照抄人类行为”(2.0),而物理 AI 的 3.0 范式是:先构建一个虚拟的交通场景,预测其他车辆、行人的运动轨迹,再根据物理规律规划自己的行驶路线,真正实现“先理解世界,再做出决策”。这意味着 AI 不再需要在真实环境里反复试错,而是先在内部模拟推演,大幅降低硬件损耗与安全风险。
NVIDIA 创始人黄仁勋在 GTC 台北的判断是:“得益于多模态推理语言、视觉和世界模型领域的多项突破,物理 AI 爆发的时代已近在眼前。” 这不是营销话术——2026 年上半年国内具身智能赛道融资总额已突破 935 亿元,同比增长 5 倍,资本正在把物理 AI 推向产业落地的临界点。
二、Cosmos 3 的 MoT 双塔架构:推理塔与生成器塔的闭环
NVIDIA 在 2026 年 6 月 GTC 台北发布、8 月 7 日正式推出的 Cosmos 3,是物理 AI 世界模型领域最具系统性的架构创新。它的核心是 Mixture-of-Transformers(MoT)双塔架构——围绕两座塔构建统一模型。
推理塔:自回归的“大脑”
推理塔是一个视觉语言模型(VLM),用于解释图像、视频、文本等多模态观察结果。它使用自回归架构来解释输入,理解运动、物体交互和其他物理环境——是在任何一代出现之前对世界进行推理的“大脑”。这个设计的关键在于:模型先生成文本等离散 token 完成物理推理,再引导扩散生成。也就是说,Cosmos 3 不是直接从输入跳到视频生成,而是先在语义层完成“物体交互、运动规律、时空关系的解析”,再把推理结果作为生成器的条件。
生成器塔:扩散式的“双手”
生成器塔基于扩散过程,根据推理塔的理解生成物理感知的视频和动作输出。可以单独调用推理器,但生成器始终激活两个塔以实现引导生成。这种“推理先行、生成跟进”的架构,使得单个模型能同时执行推理和生成任务,通过消除多个模型和推理工作流之间的编排来简化开发。
在斯坦福大学教授李飞飞提出的世界模型“三分法”(渲染器、仿真器、规划器)框架中,Cosmos 3 被归类为偏重于渲染与仿真的模型,其核心目标是生成逼真的未来世界状态。但与纯粹的像素级渲染不同,Cosmos 3 的生成器塔还输出动作序列——这让它同时具备世界模型和动作模型的能力。
三档模型尺寸与训练数据
Cosmos 3 系列提供三种尺寸:
- Cosmos 3 Super(64B):适用于需要极高物理仿真精度及生成质量的机器人与智能汽车模型后训练阶段;
- Cosmos 3 Nano(16B):可在极短时间内完成高质量视频生成和动作推理;
- Cosmos 3 Edge(4B):2026 年 8 月发布,面向边缘设备实时物理 AI 推理设计,15Hz 控制频率足以覆盖工业抓取、低速自动驾驶等主流需求。
训练数据规模是理解 Cosmos 3 能力边界的关键。该模型在最大型的多模态物理 AI 数据集之一上训练,包括约 7.67 亿张图像、3.48 亿个真实世界动态视频,以及涵盖机器人操作、自动驾驶、摄像头运动和以自我为中心运动的 800 万个动作样本。但值得工程团队注意的是:根据公开技术报告,预训练阶段数据构成中视频理解与推理仅占极小比例(约 0.05%),而 OCR 文字识别、2D 空间定位等非物理交互类任务占比较高——有分析指出,这种数据构成可能导致模型更侧重于学习语言和画面的统计关联,而非物理世界的因果规律。这是 Cosmos 3 路线的一个潜在边界。
基准测试结果
Cosmos 3 系列在物理 AI 基准测试中取得了领先结果:在开放模型中,它在 Artificial Analysis、Physics-IQ、PAI-Bench 和 R-Bench 的世界生成精确性方面、RoboLab 和 RoboArena 的动作策略方面以及 VANTAGE-Bench 和 TAR 排行榜的视觉理解方面均位居榜首。更值得关注的是产业落地:日本制造业已大规模使用 Cosmos 3 进行物理 AI 训练。
三、世界模型、VLA、视频生成模型:三个易混概念的技术边界
物理 AI 领域最容易被混淆的三个概念,恰恰是理解架构演进的关键。它们的差异不在“能不能做”,而在“建模什么”。
它石智航创始人陈亦伦给出了一个精准的区分框架:
- VLA(视觉-语言-动作)模型:仅能输出机器人的下一步动作,是“指令→轨迹”的语义映射;
- 世界模型:不仅要输出动作,还要预测动作引发的世界状态变化,以及判断变化结果是否符合预期,完整覆盖强化学习“状态-动作-奖励”三要素;
- 视频生成模型:只生成未来视觉帧,不涉及动作输出和物理交互预测。
用一个具体场景说明:如果前车意外掉落一箱苹果,视频生成模型能生成“苹果散落”的画面;VLA 模型能输出“减速绕行”的动作指令;而世界模型能预判苹果滚落的轨迹与扩散范围,提前平稳减速并规划绕行路线——它同时建模了“动作”和“动作后的世界状态”。
这个区分的工程含义是:VLA 依赖对同一任务的近似演示来学习指令到轨迹的映射,而世界模型学习的是物理——物体在推、抓或丢弃时的移动方式。物理学的通用性远高于语义学:物体下落或滑动的方式不会随物体变化而改变,因此已学习动力学的模型能把知识带入从未接受过训练的场景和动作中。这意味着世界模型需要的任务特定数据远少于 VLA,数据收集成本显著降低。
NVIDIA 在技术博客中明确提出了“超越 VLA”的概念——世界动作模型(World Action Model,WAM)。WAM 联合预测动作和未来世界状态,而 VLA 只根据语义推理和机器人状态生成机器人动作。这个区分不是理论游戏——它直接决定了数据效率、泛化能力和新机器人适配速度。
四、世界动作模型(WAM):学习物理而非语义映射
NVIDIA 把 Cosmos 3 定位为强大的 WAM 基础,这个定位的深层逻辑值得展开。WAM 与 VLA 的核心差异在于学习目标:
- VLA 学习将指令映射到轨迹,通常需要对同一任务进行近乎相同的演示;
- WAM 学习物理——物体在推、抓或丢弃时的移动方式,任何交互数据都能让它有所收获。
这个差异带来三个工程优势。第一,数据利用率高:在 VLA 上“浪费”的各种数据集会成为 WAM 的训练信号,数据收集变得更便宜。第二,开放世界泛化:物理学比语义学更具通用性,物体下落或滑动的方式不随物体变化而改变,已学习动力学的模型能泛化到未见过的场景。第三,少样本适配:理解物理交互的模型需要的任务特定数据少之又少,新机械臂或机械手的适配路径更短。
Cosmos 3 作为 WAM 基础的实践案例是 Cosmos3-Nano-policy-DROID——Cosmos 3 Nano 为 DROID 平台(一个带有 Robotiq 抓手的 Franka Panda ARM)提供的 160B 参数后训练策略。这展示了“通用世界基座→特定机器人后训练”的范式:先用海量物理世界数据预训练一个通用世界模型,再用少量任务数据后训练成特定机器人的策略模型。
五、EvoPhys-World:5D 世界模型与“以人为中心”的可操控世界
如果说 Cosmos 3 代表了“渲染+仿真”路线的工业级实现,那么北京大学 EvoPhys 团队推出的 EvoPhys-World 则代表了另一条路径——把 AI 生成的世界从“可观看、可漫游、浅交互”推进到“可操控、深交互、自进化”。
5D 世界模型的含义
EvoPhys-World 被称为“全球首个 5D 世界模型”。这里的“5D”指的是它不仅建模三维空间和一维时间,还引入了“以人为中心”的动作维度——将第一视角下的人类观察与手部交互作为通用动作表征,从大规模原始无标注人手 EGO 数据中学习。这个设计的精妙之处在于:人手是物理世界最通用的“动作接口”,任何物理交互最终都可以分解为手部观察+手部动作。用这个通用表征训练,模型学到的不是某个特定机器人的运动学,而是物理交互的通用规律。
World Engine + World Policy 双形态
EvoPhys-World 以两种形态构成从“生成世界”到“操控世界”的完整闭环:
- World Engine:万物可孪生、物理可交互——生成可交互的物理环境;
- World Policy:世界可预演、万物可操控——在生成的环境中执行动作并预测结果。
这个双形态设计的工程价值在于:它把“环境建模”和“动作策略”解耦,但又让它们共享同一套物理表征。World Engine 可以独立用于仿真训练数据生成,World Policy 可以在 World Engine 生成的环境里进行强化学习——形成“生成环境→训练策略→策略反哺环境优化”的闭环。
国产算力的全栈支撑
EvoPhys-World 的训练全程在摩尔线程 MTT S5000 全功能 GPU 上完成,由 MUSA 软件栈提供全栈支撑。这不是简单的“跑通了”——EvoPhys-World 需要在约 4 万小时纯人手 EGO 数据中,同时建模时空记忆、状态预测、动作预测、物理交互与策略演化,对训练稳定性、数据吞吐与软硬件协同效率要求极高。
摩尔线程与北京大学的协同,推动了“前沿模型—本土软件栈(MUSA)—国产算力(MTT S5000)—开发者与产业工作流”的全链路闭环。在斯坦福 WorldScore 公开评测榜单上,EvoPhys-World 在世界生成维度连续 37 天登顶。这个成绩的产业含义是:国产算力的命题正在从“能不能训练模型”走向“能不能训出在国际前沿评测中位居前列的模型、并让这套能力自主可控地持续生长”。
六、ω-0:不重建视频的隐空间预测世界动作模型
2026 年 8 月 10 日,南洋理工大学、北京大学、香港科技大学(广州)和智源研究院联合推出了 ω-0——一款隐空间预测世界动作模型。它的核心创新是:不重建未来视频,用轻量化的隐空间预测目标,将“视觉前视”和“扩散动作生成”耦合在一起。
这个设计的工程动机是:直接重建未来视频计算开销巨大,而机器人控制只需要“未来环境会怎么变”的语义信息,不需要像素级精确的视觉帧。ω-0 借鉴 V-JEPA 的思路,通过 Video query 预测未来视觉特征,将未来环境变化信息注入动作表示,再用扩散模型 DiT 直接生成全身动作潜变量。这种“隐空间预测+扩散生成”的混合架构,既获得了世界模型的前瞻能力,又避免了视频重建的算力负担。
三阶段递进式训练
ω-0 的训练架构分三个阶段:
阶段一:全身动作 VLM 预训练。 常规 VLM 仅擅长图文语义理解,无法适配机器人连续的全身控制逻辑。团队训练了 Whole-Body FAST tokenizer,将机器人连续、高维度的全身运动轨迹转换为离散 action tokens,再基于 Qwen3-VL-2B-Instruct 微调,构建全身动作 VLM 模型,通过引入可学习的视角 token 自主识别第一视角与第三视角。
阶段二:人-机动作隐变量预训练。 将视觉、语言和机器人状态信息融合,通过 Video query 预测未来视觉特征,把环境演化信息注入动作表示,完成人-机动作空间的隐变量对齐。
阶段三:策略联合微调与部署。 在隐空间预测的基础上,用扩散模型 DiT 生成全身动作潜变量,并在真实机器人操作数据上做端到端联合微调,让世界模型的“前瞻能力”直接转化为可执行的动作策略,最终以轻量化的方式部署到真实机器人本体。
七、结语:物理 AI 世界模型的 2026 主线
从 Cosmos 3 的 MoT 双塔架构,到 EvoPhys-World 的 5D 世界,再到 ω-0 的隐空间预测——2026 年物理 AI 世界模型的共同主线已经清晰:不再满足于生成逼真的视频,而是真正理解物理规律、预测世界下一时刻、并据此规划行动。模型从“看懂世界”走向“推演世界”,从“生成画面”走向“生成因果”。
对工程团队而言,三个信号值得记住:其一,WAM(世界动作模型)正在取代 VLA 成为具身智能的主流底座,数据效率与泛化能力是核心分水岭;其二,国产算力+本土模型的组合已经能在国际前沿评测中登顶,物理 AI 是自主可控算力最好的验证场;其三,隐空间预测等轻量化路线正在把世界模型从“实验室的昂贵玩具”推向“可部署的工业组件”。物理 AI 的爆发不是预告,而是正在发生的工程现实。