世界模型:物理 AI 的新一代基础模型
大语言模型学会的是文本的统计规律;下一代基础模型的战场,换成了物理世界的动力学。2026 年,这个方向正式从研究命题变成了基础设施——而且正在 CUDA 与昇腾两套栈上被同时建造。

过去三年,AI 的重心几乎押在同一个赌注上:把模型放在互联网文本上规模化训练,智能就会自己长出来。这个赌注换来了惊人的语言系统,也留下了一个奇特的盲区——模型能写出「玻璃从桌上掉落」这样的句子,却完全不懂玻璃掉下来之后会发生什么。它们预测的是文字,不是世界。
这个盲区,如今正被一个快速收敛的领域正面进攻。无论叫它物理 AI、具身智能、世界模型还是空间智能,主线都是同一件事:构建能理解空间、时间与因果,足以在物理世界中感知、推理并行动的系统。今年的信号不是某篇孤立的论文,而是一场协调一致、耗资数十亿美元的转向——而且关键在于,它正在两套平行的技术栈上同时成形。在 CUDA 这一侧,NVIDIA、Google DeepMind、李飞飞的 World Labs、杨立昆的 AMI Labs 交付的是真实产品,不是宣言。在昇腾这一侧,华为也竖起了一套完整对位的栈——CloudRobo、MoWorld-3D、盘古——用国产算力复刻了同一套逻辑。两条路线并非互相照搬,而是各自独立收敛到同一个判断,同时在底层铺下两条互不相容的供应链。
先厘清概念:什么是世界模型?它的任务不是预测「下一个词」,而是模拟一个环境的动力学——给定当前状态与一个动作,预测下一状态。问的是「机器人合拢夹爪抓住物体会怎样」「行人踏下路缘后会做什么」,而不是「下一句话是什么」。NVIDIA 对这次认知转向的概括很到位:大语言模型学的是符号之间的相关性,世界模型学的是动力学——空间、时间与因果。机器人不能只会「识别」一把椅子,它必须知道椅子可以被移动、倚靠或绕行;在真实硬件上执行之前,它还需要一个内在的世界模型,先在脑中把决策推演一遍。
这套思路今天已经落进训练流程。世界基础模型(WFM)被当作现实的「替身」:你在它生成的仿真里训练机器人或自动驾驶的策略,在数千种场景变体上评估,等它在仿真里足够可靠,才转到真实环境测试。它要解决的瓶颈既具体又残酷——真实世界的数据慢、贵、险,「儿童冲入车道」「爆胎」这类边缘场景,实地复现往往危险甚至不可能。NVIDIA 的 GR00T-Dreams 蓝图,据称用 36 小时就生成了需要人工采集约三个月的合成机器人数据。真正的奖赏是这种加速度,而不是单纯的模型规模。
还有第三种「世界模型」的写法值得一开篇就点明,因为它正是华为技术押注所在,也会改变你阅读整个领域的方式。世界模型不必预测下一个视频帧(生成式),也不必预测下一个潜空间 token(预测式),它还可以直接输出一个结构化的三维场景——深度图、相机位姿、物体语义——让机器人的规划器无需渲染任何像素就能直接推演。华为的 MoWorld-3D 是这种「三维原生」写法最清晰的量产实例,也是贯穿华为整条物理 AI 栈的那根线。
这个方向最清晰的宣告,是 NVIDIA 在 2026 年 6 月 1 日台北 GTC(Computex)上发布的 Cosmos 3——它号称第一个完全开放的物理 AI「全能模型」,也是 CUDA 一侧的旗舰。「全能」不是修辞:此前的 Cosmos 2 与 2.5 把感知与生成拆成独立模型,且只能处理文本、图像与视频;Cosmos 3 则把它们压进同一个系统,原生生成文本、图像、视频、环境音,以及机器人动作数据——关节角度、夹爪位置、轨迹航点。机器人需要的是运动指令,不是像素;Cosmos 3 两者都给。
架构上,它采用混合 Transformer 架构(MoT):一个自回归的推理模块先把场景整理为结构化的内部表征,再由一个扩散式的生成模块基于这份表征生成输出。这种「先推理、后生成」的设计,正是为了规避早期世界模型「生成物理上不可信画面」的失效模式。模型分两档:Nano(16B)跑在 RTX PRO 6000 工作站上,做实时机器人推理;Super(64B)面向数据中心的合成数据生成与策略后训练。它以 OpenMDW 1.1 许可证(Linux 基金会的一种模型许可证)开源:权重在 Hugging Face,代码与训练配方在 GitHub,并通过 Azure、CoreWeave 等渠道提供 NIM 微服务。NVIDIA 还同步发起了 Cosmos 联盟——Agile Robots、Black Forest Labs、Runway、Skild AI 等都是成员——从第一天起就让生态围绕它生长。
有一点需要提醒:NVIDIA 宣称 Cosmos 3 在其参加的全部基准(Physics-IQ、PAI-Bench、R-Bench、RoboLab、RoboArena、VANTAGE-Bench、TAR)上都位列开源模型第一。这些成绩是发布方自报,独立复现还需要时间。
华为的 CloudRobo + MoWorld-3D:昇腾一侧的旗舰
如果说 Cosmos 3 是「生成式视频、CUDA 原生」的旗舰,华为的答案就是「三维原生、昇腾原生」的旗舰——而且它建立在一条刻意不同的技术主线上。华为明确不造机器人,而是造机器人赖以训练与运行的基础设施层。WAIC 2026(7 月)上,华为云发布 CloudRobo 全栈具身智能开发平台,覆盖数据生产、模型开发、仿真与机器人部署,内置国产 Real-Sim 仿真评测体系,已聚拢 20 多家机器人伙伴(含优艾智合、华沿机器人等)。
真正在技术上有辨识度的一块,是 MoWorld-3D——由华为联合国家具身智能应用中试基地与魔芯科技发布,据中国网、新华网等权威媒体报道,是首个全栈基于国产昇腾(Ascend)NPU 构建的三维世界模型。当 Cosmos 3 预测视频与动作时,MoWorld-3D 做的是「4D 空间建模」:它输出的不是一段视频,而是带深度、相机位姿与物体语义的完整三维模型。这是一种不同的产品哲学——机器人的规划器并不需要一张逼真的渲染图,它要的是一个可直接推演的可操作空间表征,而 MoWorld-3D 恰好给的就是这个,且逼近了实时边界。据可信报道,它可维持约两分钟场景记忆、支持 1080p 实时交互与六自由度相机控制,而最关乎落地经济性的指标是:因整套训练与推理跑在昇腾芯片上,最高可达 50 FPS 实时推理,成本仅同等规模 GPU 方案的约 30%。(不同媒体对参数量的报道有出入——一说约 14B、一说约 28B——我们把它当作「数十亿参数的 MoE」,并锚定在可验证的能力指标上。)
华为的盘古多模态模型把同一套逻辑延伸到自动驾驶:从单张图像生成高精度数字-物理空间、预测碰撞、产出驾驶视频与激光雷达点云,据称支撑华为 ADS 端到端模型做到「两天一个版本」。CloudRobo + MoWorld-3D + 盘古构成了一条垂直栈,其主线与 NVIDIA 完全相同——把数据 + 仿真闭环的成本打下来,生态便会围绕你的算力成形——但它的底层算力、仿真器与模型家族,完全是华为自己的。
两套栈上,生态都已实打实跑起来
无论在哪一侧,这都不只是演示。在 CUDA 栈上,波士顿动力、Figure AI、Skild AI、Serve Robotics、Zipline、Uber、Magna 都在 Cosmos 与 Omniverse/Isaac 仿真栈上做开发;Serve Robotics 已完成超过 10 万次最后一公里配送,每月向仿真器喂约 1700 亿个图像-激光雷达样本;CES 2026 上,NVIDIA 把同一套命题延伸到驾驶,发布开放权重的自动驾驶模型家族 Alpamayo,外加开源仿真器 AlpaSim 与 1700+ 小时的开放驾驶数据集。在昇腾栈上,华为的 CloudRobo 已聚拢 20 多家机器人伙伴,盘古驱动的 ADS 迭代节奏同样展示了同一条「仿真优先」的生产闭环。两套栈贯穿的图案是同一个:合成数据 + 仿真优先训练,弥合「实验室可行」与「真实路面可行」之间的鸿沟;不同的只是你被锁定进哪块算力、哪套仿真器、哪个伙伴生态。
这套布局背后,有几条更本质的判断。
其一,物理 AI 的难题从来不是架构,而是数据。真实世界的数据慢、贵、险,而且仿真训练出的策略不会自动迁移到现实——这正是经典的「仿真到现实」鸿沟。世界模型攻击的正是这一点,稀缺资源也随之转移:真正可守的护城河不再是原始模型规模,而是环绕模型的「数据治理→仿真→策略训练→验证」闭环。而这道护城河现在有了两种实体形态:NVIDIA 的整条垂直栈——Omniverse(仿真)、Cosmos(世界模型)、Isaac(机器人学习)、DGX(训练)、AGX(部署);以及华为的一套平行栈——CloudRobo(开发+仿真平台)、MoWorld-3D(世界模型)、CANN + 昇腾(算力底座)。谁掌握数据与仿真闭环,谁就掌握智能体——这正是去年多模态智能体转向教给我们的同一课,如今正在两条互不相容的供应链上同时上演。
其二,两家巨头都在重演「掌控底层」的老路。NVIDIA 没有去做「物理世界的 OpenAI」——把闭源前沿模型攥在自己手里——而是把 Cosmos 3 的权重、代码、数据集、训练配方全部开源,并牵头组建联盟,正如当年它靠掌控底层(CUDA)而非应用层,赢下了 AI 训练;Nano 免费、可用自定义机器人演示数据微调、单台工作站就能跑。华为在昇腾上跑的是同一套剧本:把 CloudRobo 平台与 MoWorld-3D 模型向国产伙伴生态开放,而不是卖成品机器人,掌控的是底层(CANN,即昇腾算子库,是 CUDA 的字面意义上的对位)而非应用层。这是围绕「物理 AI 操作系统」在两片大陆上同时发生的圈地:先降低门槛,让生态围绕你的栈成形,再靠算力与平台变现。给观察者的启示是:基础模型生意正在分叉——语言智能与物理世界智能正变成两条独立的基础设施层——而两家不同的巨头正各自全力抢占第二条。
其三,「输出动作」才是那把真正的钥匙,且两套栈都压扁了技术栈。Cosmos 3 最决定性的细节,是它输出动作向量,而不只是视频;这一笔把价值的单位从「模态覆盖」改写为「物理世界中的能动性」:过去要拼三个模型——视觉语言模型、世界模型、独立的策略网络——如今压缩进一次前向推理,而且强制先推理、后生成。华为的盘古-自动驾驶从另一方向展示了同一种压扁:单一多模态模型同时感知场景、预测碰撞、产出驾驶视频与点云——感知、预测、行动被压缩进一个系统。这正是我们在原生智能体模型(如 UI-TARS)身上见过的同一种变化:原本属于编排工程的能力,正一点点收进模型内部。机器人世界的「会点击的智能体」,就是能闭环「看见→仿真→行动」的模型——而 CUDA 栈与昇腾栈现在都演示过了。
其四,架构上的分歧其实是三种写法,且它是用例的分歧,不是路线之争。生成式视频世界模型——World Labs 的 Marble、NVIDIA 的 Cosmos、Google DeepMind 的 Genie 3——渲染逼真、可漫游的世界,输出本身就是产品(合成数据、可探索的环境)。潜空间/预测式模型——杨立昆 AMI Labs 采用的 JEPA(联合嵌入预测架构)——则刻意不生成像素,而在压缩的表征空间里预测,因为对机器人来说有意义的输出是决策,渲染纯属浪费。而现在出现了第三种「三维原生」写法——华为的 MoWorld-3D 与 World Labs 的空间工作——输出的是带深度、位姿、语义的结构化三维场景,而非视频或 token,专为被机器规划器直接消费而优化。三者都自称「世界模型」。务实的解法是按需选择:给人类观看与创作的世界,用生成式;给机器规划的世界,用潜空间或三维原生。它们是互补的基础设施,聪明的构建者按用例来选,而不是按阵营站队——而落到地上,这也意味着先选好算力阵营。
其五,别把「仿真像现实」误当成「仿真就是现实」,且这道诚实的边界两套栈都要受。最需要警惕的炒作,是把「模型生成了一段机器人成功的逼真视频」当作「机器人真的能成功」。三个诚实的局限仍然摆在那里,且对两条战线同样有效:时间一致性——即便最强的模型,几分钟后也会开始漂移,几何扭曲、物体忘记自己存在过,「能保持一致几分钟」已是前沿,遑论「永远」;幻觉物理——从观察中学到的物理是近似的,它「看起来对」的次数远多于「真的对」,若在安全攸关的训练中被盲目信任,极其危险;评估尚未解决——「这次仿真是否表现得像现实一样?」远比给基准打个分更难,仿真与现实的鸿沟依旧真实。所以准确的说法是:无论世界模型跑在 CUDA 还是昇腾上,2026 年都是它成为可用工具、而非解决物理 AI 的年份。落地的闸门是信任与评估,不是能力——与去年智能体转向是同一条主线。
其六,技术栈正在沿「算力主权」、而非仅沿架构路线分裂——而这道分叉可能比技术分叉更持久,这是纯技术报道普遍漏掉的一层。两套基础设施打法——NVIDIA 的 Cosmos/Omniverse/Isaac 跑在 CUDA 上,华为的 CloudRobo/MoWorld-3D/盘古跑在昇腾上——竞争的远不止模型巧思,而是两套完整、各自主权化的技术栈:不同的芯片、不同的算子库(CUDA vs CANN)、不同的仿真器、不同的模型家族、不同的伙伴生态。生成式/潜空间/三维原生的分歧(其四)是技术分叉;CUDA 与昇腾的分歧则是地缘分叉,而且可能更持久。对构建者而言,这意味着 2026 年「可即取用的开放世界模型」越来越与算力阵营绑定:要么是用 Hugging Face 权重、默认假设 CUDA 的方案,要么是华为云上、默认假设昇腾的服务。基础模型生意不仅按「语言 vs 物理」分叉(其二),也正裂成两条互不兼容的物理 AI 供应链。谁在某区域定下默认栈,谁就掌握当地每一台机器人与自动驾驶的训练闭环。回头看,2026 年或许正是物理 AI 世界模型被「建了两遍、彼此并行、且渐渐不再对话」的年份。
「基础模型」这个词正在被改写。十年来,它意味着「在互联网文本上训练的大模型」;2026 年的修订版增加了第二根支柱:一个在物理世界动力学上训练、能推演接下来会发生什么并据此行动的模型。各方不约而同地收敛到同一方向,是因为「只靠符号」的智能,其局限终于大到无法忽视。我们等的不再是更聪明的聊天机器人,而是一层新基础设施的成形:开放的世界模型、仿真优先的训练闭环,以及一组为「看见、规划、行动」而分化又互补的架构。而这层基础设施正在被建了两遍——一遍在 CUDA 上,一遍在昇腾上——并且两套栈未必会收敛。那些理解世界——而不只是描述世界——的模型,已经在两条战线上开始交付;接下来的十八个月,取决于我们能否信任它们所仿真的一切,以及我们最终会建在哪套栈上。
- NVIDIA. (2026). NVIDIA Cosmos: A World Foundation Model Platform for Physical AI. NVIDIA Developer. https://developer.nvidia.com/cosmos
- NVIDIA. (2026, June 1). NVIDIA launches Cosmos 3 at GTC Taipei (Computex). NVIDIA Newsroom. https://nvidianews.nvidia.com
- NVIDIA. (2026, March 13). Scale Synthetic Data and Physical AI Reasoning with NVIDIA Cosmos World Foundation Models. NVIDIA Developer Blog. https://developer.nvidia.com/blog/scale-synthetic-data-and-physical-ai-reasoning-with-nvidia-cosmos-world-foundation-models
- NVIDIA. (2025, August 11). NVIDIA Opens Portals to World of Robotics with New Omniverse Libraries, Cosmos Physical AI Models. NVIDIA Blog. https://blogs.nvidia.com
- Encord. (2026). Best Foundation Models for the Physical World in 2026: Cosmos, GR00T, and What's Next. Encord Blog. https://encord.com/blog/foundation-models-physical-ai-2026
- Google DeepMind. (2026). Genie 3 and Project Genie: Experimenting with Infinite, Interactive Worlds. Google DeepMind. https://deepmind.google/genie ; https://deepmind.google/blog/project-genie-experimenting-with-infinite-interactive-worlds
- StartupHub.ai. (2026, August 5). Fei-Fei Li's $5B World Labs and the Spatial AI Race No One Agrees On. https://www.startuphub.ai
- Singularity.kiwi. (2026). Three Titans Pivot Away from LLMs: LeCun, Musk, and Fei-Fei Li Bet on World Models. https://singularity.kiwi/lecun-musk-world-models-pivot
- Il Sole 24 Ore. (2026). CES 2026: Nvidia launches Alpamayo, a family of AI models for autonomous driving. https://en.ilsole24ore.com
- AgentFlow Academy. (2026). World Foundation Models Explained: How AI Learns to Simulate Reality. https://agentflow.academy/blog/world-foundation-models
- Li, F. (2026). From Words to Worlds: Spatial Intelligence Is AI's Next Frontier. World Labs / Substack.
- LeCun, Y., et al. (2026, March 23). LeWorldModel (LeWM): A Joint-Embedding Predictive Architecture. AMI Labs.
- Huawei. (2026, July). 国地中心联合华为发布具身智能实训场样板点 (National Center & Huawei launch embodied-AI training-ground pilot). Huawei Enterprise. https://e.huawei.com/cn/news/2026/industries/manufacturing/national-geographic-center
- China Net (中国网). (2026, July 20). 国家具身智能应用中试基地发布全球首个全栈国产NPU三维世界模型 (National pilot base releases first full-stack domestic-NPU 3D world model, MoWorld-3D). http://dicn.china.com.cn/2026-07/20/content_43463910.shtml
- Xinhua (新华网). (2026, August 6). MoWorld-3D世界模型发布,打通AI从"对话交互"到"物理交互"的关键一步. https://www.news.cn/info/20260806/0331f633fba44b58b6d412711c8ebfee/c.html
- Pandaily. (2026, July). WAIC Observation: Huawei Enters Embodied AI With CloudRobo Platform. https://pandaily.com/huawei-cloudrobo-embodied-ai-platform-jul2026