一个正在发生的范式转移
2026 年,具身智能不再是实验室里的概念验证。
几个真实数据点:
- 2025 年全球人形机器人出货量约 1.3 万台,同比增长 508%
- 2026 年预计突破 5 万台
- 宇树科技 2025 年营收 17 亿元、净利润 6 亿元,毛利率 60%——这是一家真正赚钱的机器人公司
- Figure 03 已在宝马斯巴达堡工厂持续运行;Tesla Optimus Gen 3 正在弗里蒙特工厂量产爬坡
- 智元机器人在 2026 年中突破 1 万台出货,从 5000 到 10000 台只用了 3 个月
这些不是 PPT 数字。
但更重要的问题是:具身智能到底在往哪里走?它的天花板在哪里,瓶颈在哪里,奇点什么时候到来?
理解具身智能的三层架构
要看清未来,先要理解当前的技术框架。业界已经收敛到一套共识架构,通常被称为"大脑 - 小脑 - 肢体"。
- 大脑(认知决策层):负责理解语言指令、感知环境、规划任务。这一层的核心是 VLA(Vision-Language-Action)模型——一种把视觉感知、语言理解、动作生成统一在一个端到端框架里的大模型。它是机器人的"智识"。
- 小脑(运动控制层):负责实时的平衡、协调、关节控制。这一层需要极高的响应频率(目标 100-200Hz),依赖深度强化学习和精密的力控算法。它是机器人的"本能"。
- 肢体(执行层):电机、减速器、传感器、灵巧手。这是把算法意图变成物理动作的硬件基础。
当前的核心矛盾:大脑层(VLA 模型)的泛化能力和小脑层的实时控制之间存在巨大张力。大脑模型越通用、越复杂,推理延迟就越高,无法满足小脑需要的毫秒级响应。这就是为什么几乎所有主流方案都采用"慢系统 + 快系统"的双系统架构——大脑慢速规划,小脑快速执行。
大模型怎么塞进本体
VLA 基础模型动辄几十亿参数,机器人本体的计算资源有限。解法有两条并行的路:让模型变小(蒸馏 + 量化),或者让芯片变强(边缘 AI 芯片)。
模型蒸馏(Knowledge Distillation):用大模型(Teacher)教小模型(Student),让小模型学会大模型的「知识」而不是「参数」。Student 模型学到的不只是「正确答案」,还有 Teacher 对「错误答案的置信度分布」——包含了更丰富的知识。结果:7B 蒸馏模型往往能达到 70B 原始模型 80-90% 的性能,但推理速度快 10 倍、内存占用减少 90%。
量化(Quantization):把模型权重从 FP32(32 位浮点)压缩到 INT8(8 位整数)甚至 INT4(4 位整数)。FP32 → INT8 模型大小缩小 4 倍,推理速度提升 2-4 倍,精度损失通常在 1-2% 以内。英伟达的 FP4 格式(RTX Spark 支持)是新一代量化标准。
边缘 AI 芯片:机器人本体用的不是数据中心 GPU,而是边缘 AI 芯片——在有限功耗(电池供电)和有限散热条件下,完成实时(毫秒级)的感知和动作推理。英伟达 Jetson AGX Thor 已被定位为「机器人里的计算机」,是目前人形机器人最主流的计算平台。
VLA:从"会指令"到"会思考"
VLA 模型是当前具身智能最热的技术赛点。
发展脉络
- 2023 年:Google DeepMind 发布 RT-2,首次把大型视觉-语言模型和机器人动作结合,证明了"一个模型控制多种任务"的可行性
- 2024 年:Physical Intelligence(π 公司)成立,发布 π0 模型,展现真正的多任务泛化能力——同一个模型可以折叠衣物、整理桌面、装载洗碗机
- 2025 年:π0.5 实现在未见过的环境中 zero-shot 完成复杂任务;Google 发布 Gemini Robotics,把多模态推理能力延伸到物理操作
- 2026 年:VLA 技术路线全面分化,国内头部企业已形成各自的技术壁垒
2026 年中国 VLA 格局
| 企业 | 代表模型 | 技术特点 |
|---|---|---|
| 智平方 | GOVLA(FiS-VLA) | 全域全身 VLA,控制频率 117.7Hz,超越 π0 达 30% |
| 宇树科技 | UnifoLM-WMA / WVLA2.0 | 世界模型 + 动作头并行架构,全球首创 |
| 智元机器人 | EI-Brain / GO-1 | 分层架构 + 在线后训练(SOP),边用边学 |
| 小鹏汽车 | 第二代 VLA | 跨域驱动汽车/机器人/飞行汽车,已量产 |
| 银河通用 | GraspVLA | 专注零售/抓取场景,基于合成数据预训练 |
三大技术趋势
趋势一:世界模型与 VLA 融合
纯粹的"看→做"已经不够,机器人需要能在"想象中"预演动作的后果,再决定是否执行。宇树的 UnifoLM-WMA 架构就是把世界模型作为可交互的仿真器嵌入决策回路——机器人在"大脑里"先跑 10-20 轮模拟,再真正动手。
什么是世界模型?世界模型的核心思想是:让 AI 在脑子里模拟世界,先「想」再「做」。不需要真的在物理世界试错,而是在内部模型里预演多种可能,选出最优方案再执行——人类就是这样工作的。OpenAI 在发布 Sora 时明确表示:Sora 是一个世界模型的雏形,它不只是「生成视频」,而是学会了预测「给定当前帧,下一帧应该是什么」,并在这个过程中内化了物理规律。Meta 的 Yann LeCun 力推的 JEPA(Joint Embedding Predictive Architecture)则是另一条路线:不预测像素,而是预测「抽象表示空间里的下一个状态」,更高效,也更接近人类的认知方式。
趋势二:从单点任务到长线程自主
宇树 WVLA2.0 的核心突破是"长线程、高自主、强鲁棒"——机器人不再只能完成单步指令,而是能在外部干扰下自主完成一系列连续任务(整理会议室、分类收纳等),无需远程操控。
趋势三:在线后训练(Online Post-training)
智元的 SOP 架构预示了未来:机器人白天工作,遇到失败案例上传云端,晚上充电时针对性微调,早上通过 OTA 推送更新。数据飞轮一旦转起来,头部厂商的护城河会越来越深。
硬件:降本是最重要的事
算法再好,硬件不行也白搭。而硬件的核心战场是降本。
成本下降的速度超乎想象
- 2023 年:样机成本 100 万+
- 2025 年:智元主流机型 50 万出头
- 2026 年:宇树 R1 仅 2.99 万元
三年时间,成本下降了 30 倍。这不是线性降本,而是供应链国产化完成后的台阶式跳跃。
关键零部件的国产化进程
- 减速器:谐波减速器(绿的谐波)、RV 减速器(双环传动)国产化率大幅提升,成本是日本同类产品的 60%
- 空心杯电机:江苏雷利等厂商以海外竞品 30%-50% 的价格实现 90% 以上的性能,驱动灵巧手成本降至消费级
- 行星滚柱丝杠:目前国产化率最低的环节,也是 Tesla Optimus 成本居高不下的主因,2026 年是攻坚年
- 触觉传感器:从"选配"升级为"标配"。没有触觉,机器人就会捏碎鸡蛋、抓不住滑溜的杯子
人形机器人为什么是人形的
这是一个经常被问但很少被认真回答的问题。答案不是"酷",而是基础设施。
工厂、仓库、办公室、家庭——这些空间都是为人类身体设计的:门把手、楼梯、工具台、车辆内部,全都针对双臂双腿的人体优化。人形机器人可以直接进入这些空间,无需改造环境。对于已经按人体优化的生产线,改造成本往往比直接用人形机器人更高。
这是人形机器人的核心经济逻辑,不是噱头。
英伟达的布局:从"卖 GPU"到具身智能基础设施
英伟达在具身智能领域的布局,比大多数人意识到的要深得多。
Isaac GR00T:机器人版的"CUDA 生态"
英伟达的策略是"卖铲子"而不是"挖金子"。Isaac GR00T 是一个开放的机器人基础模型开发平台,包含:
- GR00T N 系列模型(最新 N1.6):跨形态的人形机器人基础模型,多模态输入(语言+图像),可在 20-40 次人类示范后完成后训练
- GR00T-Mimic:从少量人类示范生成大量合成运动轨迹(解决数据稀缺问题)
- GR00T-Dreams:利用 Cosmos 世界模型生成多样化仿真环境(解决 Sim-to-Real 迁移问题)
- GR00T-Dexterity:端到端像素到动作的灵巧抓取系统
- Isaac Lab + Isaac Sim:物理精确的仿真训练和验证环境
英伟达的生态合作伙伴包括 Agility Robotics、Boston Dynamics、1X、宇树科技、Neura Robotics、Sanctuary AI 等几乎所有头部玩家。
Cosmos 世界模型平台
这是英伟达在 2025 年发布的重要基础设施。它能生成物理精确的合成数据,解决机器人训练最大的瓶颈——高质量真实世界数据的稀缺。银河通用的 GraspVLA 就是基于合成大数据进行预训练的。
DGX Spark → RTX Spark:算力下沉到机器人
从更宏观的视角看,英伟达的 Agent-ready PC 战略和具身智能战略是同一个逻辑的两面:把强大的 AI 算力从数据中心推到边缘。
DGX Spark(4000 美元桌面超算)已经开始被用于驱动机器人大脑(TRINITY 智能出行车就是一个案例)。RTX Spark SoC 的出现,则预示着未来机器人的"大脑芯片"可能就是一颗集成了 GPU 算力的 SoC——正如 Jetson AGX Thor 现在已经被定位为"机器人里的计算机"。
Agent:连接数字世界与物理世界的关键
具身智能和 AI Agent 的融合,是 2026 年最值得关注的技术趋势。
过去的 Agent 只活在数字世界:调用 API、搜索网页、写代码、发邮件。这些 Agent 能力强大,但无法触碰物理世界。
具身 Agent 打破了这个边界。当 VLA 模型被接入 Agent 框架,机器人就不再只是执行预设动作的工具,而是能够:
- 接收自然语言目标("帮我把桌子收拾好")
- 自主分解任务(先整理文件,再收拾杯子,再擦桌子)
- 遇到意外情况自主决策(杯子里有水,先倒水再收拾)
- 跨工具协作(结合视觉识别、机械臂控制、移动底盘)
"传统 CPU 是为'活在秒级世界'的人类设计的,而智能体'活在纳秒级世界',对延迟极其敏感。"
这句话指向了一个深刻的技术问题:当 Agent 需要实时控制物理肢体时,云端推理的延迟是不可接受的。这正是本地算力(DGX Spark、Jetson AGX Thor)的意义所在——Agent 需要在本地运行,才能真正驱动身体。
真实的瓶颈:不要被热潮遮蔽
在热潮之中,需要保持清醒。
瓶颈一:泛化能力
台积电魏哲家看到中国机器人"跳来跳去",直言"没用,好看而已"。这句话刺耳,但点出了核心问题:表演型能力 ≠ 实用型能力。
会跑酷、会后空翻、能上春晚——这些是展示价值。工厂要的是:24 小时不出错、能在嘈杂环境识别零件、换个工厂不需要重新训练。当前 VLA 模型的跨场景泛化能力依然有限,"换个工厂要重新训练"是真实痛点。
瓶颈二:动作频率
把机器人想成一个人,动作频率 = 你每秒能"刷新"多少次动作。π0 的 50Hz 在摔倒要瞬间撑地的场景下,可能少算了关键 1 帧。目标是 100-200Hz,但高频控制和大模型推理的延迟之间存在根本矛盾。
瓶颈三:数据飞轮还没真正转起来
高质量的真实世界操作数据依然稀缺。合成数据(Cosmos、Isaac GR00T-Mimic)是重要补充,但 Sim-to-Real 的 gap 始终存在。数据飞轮需要足够多的机器人在真实环境中运行,才能真正加速——而这需要规模化部署,形成鸡和蛋的问题。
瓶颈四:商业化 ROI
工厂老板算的是 ROI:机器人成本 vs 替代的人工成本。目前除了汽车大厂做战略储备,中小工厂付费意愿极低。宇树 2026 年 Q1 扣非净利润同比下滑 52.55%,说明研发投入在加速,但商业化兑现需要时间。
万台出货是必要条件,不是充分条件。真正的商业化拐点是"客户愿意持续复购",而不只是"能造出来"。
未来发展的三条路径
路径一:工业场景的垂直深化(3-5 年内)
汽车制造、3C 组装、物流仓储是首发战场。这些场景结构化程度高,任务相对固定,ROI 可以算清楚。
预期演进:轮式机器人率先大规模普及(续航长、成本低、稳定性高)→ 双足机器人在特定工位(狭窄空间、台阶、多层货架)补充 → 全身灵巧操作能力成熟后,覆盖更复杂的装配任务。
路径二:商业服务场景的扩展(5-8 年)
导览、导购、巡检、简单的家庭服务(整理物品、端茶送水)。这些场景对精度要求相对低,容错率高,是具身智能从工业走向大众的过渡带。
宇树 R1(2.99 万元)、小鹏 IRON(目标 12 万元以内)等低成本人形机器人的出现,让这条路径的时间表大幅提前。
路径三:通用家庭助手(8-15 年)
这是最终愿景,也是最难的一步。家庭环境是人类为自己设计的最复杂、最非结构化的场景:每个家庭布局不同,物品种类无穷,意外情况层出不穷,还需要处理与老人、小孩的安全交互。
这一步需要 VLA 模型的泛化能力再上一个数量级,需要触觉、嗅觉等多模态感知的成熟,需要成本降到普通家庭可接受的范围(可能 3-5 万人民币)。
谁会赢
不是单一赢家的游戏。
英伟达会成为底层算力和 AI 框架的提供者——就像 PC 时代的 Intel + Windows,云时代的 AWS,英伟达要成为具身智能时代的"基础设施层"。GR00T 生态、Cosmos 世界模型、Jetson 边缘计算,这是一套完整的"卖铲子"策略。
中国供应链会主导硬件。宇树、智元的成功证明,中国制造业的体系能力在机器人领域同样有效。成本降到 3 万元的人形机器人,美国公司在短期内无法复制。
Tesla 的 AI 能力是最大变数。FSD 同源神经网络、Cortex 超算、端到端架构——如果 Optimus 的软件能力在 2027-2028 年实现质的突破,它可能用软件优势反超中国的硬件优势。马斯克自己说:"美国是第一,但第二到第十都是中国的。"
最终的分化可能是:工业场景由中国供应链主导(成本和规模),高端研究和消费级市场由 Tesla/Figure 等竞争,底层算力和框架由英伟达通吃。
结语:我们正站在哪里
"在过去的四十年里,大家开启应用、点击、输入命令来完成工作。有了 RTX Spark 和微软 Windows,用户只要提出需求,剩下的交给 PC 来完成。"
这句话不只是在说 PC,也是在说具身智能的终极形态:人提需求,机器人完成任务。
我们现在所处的位置,大概相当于 2007 年 iPhone 刚发布时的智能手机行业——技术框架已经清晰,商业化路径已经可见,但真正的爆发还需要几年时间。
不同的是,这一次中国不是追赶者,而是并跑者,在某些维度甚至是领跑者。
具身智能的"iPhone 时刻"还没到来,但它正在被加速制造。
基于 2025–2026 年公开产业信息整理,技术进展迅速,部分数据可能随时间更新。