具身智能 · 技术前沿

具身智能:当 AI 学会用身体思考

从感知-行动循环到人形机器人,从基础模型到产业落地——具身智能正在从实验室走向工厂和家庭。这不是科幻,而是正在发生的工程现实。

作者 栗子 2026 年 6 月 约 15 分钟
CHAPTER A

什么是具身智能

具身智能(Embodied Intelligence)的核心主张是:真正的智能不能脱离身体存在。它必须通过感知物理世界、在其中行动、并从行动结果中学习,才能发展出真正的理解能力。

这与我们熟悉的 LLM 有根本区别:

  • LLM:从文本中学习,理解语言模式,在语言空间中推理
  • 具身智能:从物理交互中学习,理解空间、力、因果,在物理世界中行动

一个经典的思想实验:你能通过读遍所有关于"骑自行车"的文字,学会骑自行车吗?答案显然是不能。具身智能的核心正是这个直觉——某些知识只能通过身体经验获得。

感知-行动循环

具身智能系统的基本工作模式是一个闭环:

  1. 感知:通过摄像头、激光雷达、触觉传感器等感知物理环境
  2. 理解:将感知信号转化为对世界状态的理解
  3. 规划:基于目标和当前状态,规划行动序列
  4. 执行:通过电机、液压等执行器在物理世界中行动
  5. 反馈:观察行动结果,更新对世界的理解

这个循环的每一步都充满挑战,而让 AI 在复杂、非结构化的真实环境中完成这个循环,是具身智能的核心难题。

CHAPTER B

核心技术路线

模仿学习(Imitation Learning)

最直接的方法:让机器人观察人类操作,学习模仿。代表技术是行为克隆(Behavior Cloning)逆强化学习(IRL)

核心挑战是「分布偏移」——机器人在训练时见过的场景和真实部署时的场景总有差异,一旦遇到训练分布之外的情况,性能就会急剧下降。

强化学习(Reinforcement Learning)

让机器人通过试错学习,奖励好的行为,惩罚坏的行为。在游戏(AlphaGo、Dota2)中大放异彩,但在物理机器人上面临两个难题:

  • 样本效率:物理世界的试错极慢,强化学习需要数百万次交互
  • 奖励设计:如何定义"好的行为"本身就是难题

基础模型 + 具身(Foundation Model + Embodiment)

这是当前最热门的路线,也是最有可能带来突破的方向。核心思路:用在海量数据上预训练的大模型(视觉-语言模型、视觉-语言-动作模型)作为"大脑",通过少量机器人数据微调,获得泛化能力。

代表工作:Google 的 RT-2、PaLM-E、π0;英伟达的 GR00T;OpenAI 的机器人项目。

世界模型(World Model)

让 AI 建立对物理世界的内部模型,在"想象"中规划,再在真实世界中执行。代表性工作是 Yann LeCun 力推的 JEPA(Joint Embedding Predictive Architecture)。理论上能大幅减少真实世界试错的需求,但目前仍处于早期阶段。

CHAPTER C

硬件进展:人形机器人赛道

2023-2026 年,人形机器人赛道迎来了一波密集的产品发布和商业化落地。

Figure AI

2024 年 3 月,Figure AI 发布与 OpenAI 合作的 Figure 01 演示视频,机器人能用自然语言理解指令、完成桌面物品整理任务。2024 年获宝马工厂订单,开始商业化部署。2025 年发布 Figure 02,灵巧手精度大幅提升,单手可提 20kg。

Tesla Optimus

特斯拉的人形机器人项目。2024 年 Optimus Gen 2 展示了流畅的行走和手部操作能力。马斯克预测 2025 年开始在特斯拉工厂内部使用,2026 年对外销售,目标售价 2 万美元。特斯拉的优势在于:汽车工厂的大量真实操作数据,以及 FSD(完全自动驾驶)积累的视觉感知技术。

Boston Dynamics Atlas

2024 年 4 月,Boston Dynamics 宣布退役液压版 Atlas,发布全电动版 Atlas。新 Atlas 运动流畅度惊人,能完成复杂的翻转、抓取动作。现代汽车(Boston Dynamics 母公司)宣布在工厂部署。

1X Technologies

挪威机器人公司,专注双足人形机器人 NEO。2024 年完成 1 亿美元 A2 轮融资(OpenAI 领投),NEO Beta 已在真实家庭环境中进行测试。

Agility Robotics(Digit)

亚马逊投资的机器人公司,Digit 是专为仓储物流设计的双足机器人。2023 年开始在亚马逊仓库试点,2024 年扩大规模,是目前商业化落地最成熟的人形机器人之一。

CHAPTER D

基础模型:具身智能的大脑

Google DeepMind:RT-2 和 π0

RT-2(Robotics Transformer 2):2023 年发布,将视觉-语言模型(PaLM-E)直接用于机器人控制。关键发现:在网络数据上训练的视觉-语言模型,能够直接泛化到机器人任务,无需大量机器人专属数据。

π0(Physical Intelligence):2024 年,前 Google 机器人团队成员创立 Physical Intelligence,发布 π0 模型。π0 是第一个真正意义上的「机器人基础模型」——在多种机器人、多种任务上训练,能够泛化到新任务。

英伟达 GR00T

2024 年 GTC,英伟达发布 Project GR00T(Generalist Robot 00T)——人形机器人通用基础模型。GR00T 的训练数据来自三个来源:真实机器人数据、模拟器生成的合成数据、人类视频数据。配套发布 Isaac Lab(机器人仿真平台)和 Newton(物理引擎),构建完整的机器人训练生态。

OpenAI 的机器人布局

OpenAI 在 2024 年重启机器人团队(此前曾解散),并投资 Figure AI、1X Technologies。其策略是:先通过投资积累机器人数据和经验,再用 GPT-4o 级别的多模态能力赋能机器人。

CHAPTER E

中国玩家:追赶与弯道超车

中国在具身智能领域的布局正在快速推进,既有科技巨头的战略投入,也有大量创业公司的涌现。

宇树科技(Unitree)

中国具身智能的代表性公司。四足机器狗 Go2 售价仅 1600 美元,成为全球开发者最常用的具身智能研究平台。2024 年发布人形机器人 H1,展示了流畅的奔跑和跳跃能力,引发国际关注。2025 年发布 G1,进一步提升灵巧操作能力,售价约 1.6 万美元。

智元机器人

稚晖君(彭志辉)创立,2023 年发布远征 A1,2024 年开始工厂商业化部署。智元的差异化在于:自研关节电机,掌握核心硬件,降低成本。

傅利叶智能

专注医疗康复和工业场景的人形机器人。GR-1 是国内最早量产的人形机器人之一,已在多家工厂部署。

科技巨头的布局

  • 华为:诺亚方舟实验室持续投入具身智能研究,重点在感知和规划算法
  • 腾讯:投资多家机器人公司,Robotics X 实验室研究多足机器人
  • 小米:发布 CyberOne 人形机器人,定位消费级,但商业化进展较慢
  • 比亚迪、宁德时代:从供应链角度布局,为机器人提供电池和电机

政策支持

2023 年工信部发布《人形机器人创新发展指导意见》,明确 2025 年实现量产、2027 年成为重要经济增长点的目标。多个省市设立专项基金,北京、上海、深圳形成机器人产业集群。

CHAPTER F

产业落地:从实验室到工厂

当前最成熟的场景:工业制造

工厂是具身智能最早规模化落地的场景,原因在于:

  • 环境相对结构化,变量可控
  • 任务重复性高,数据采集成本低
  • 人工成本高、招工难,替代价值明确
  • 容错率相对较高(相比医疗、家庭服务)

典型案例:亚马逊仓库(Agility Digit)、宝马工厂(Figure 01)、特斯拉工厂(Optimus)、比亚迪工厂(多家国产机器人)。

下一个场景:物流与仓储

分拣、搬运、盘点——这些任务对灵巧度要求不高,但需要长时间稳定运行。已有多家公司在这个方向取得商业进展。

长期目标:家庭服务

这是最难的场景,也是最大的市场。家庭环境极度非结构化,任务多样,安全要求极高。目前仍处于早期研究阶段,预计 2028-2030 年才可能出现真正实用的家用机器人。

数据飞轮:规模化的关键

具身智能的核心竞争壁垒是数据飞轮:部署越多机器人 → 采集越多真实操作数据 → 训练出更好的模型 → 机器人能力更强 → 能部署到更多场景。这解释了为什么特斯拉在机器人领域有独特优势——Optimus 可以直接从特斯拉工厂获取海量真实操作数据。

CHAPTER G

未来走向:三个关键问题

问题一:通用性 vs 专用性

当前的人形机器人大多是「专用」的——为特定任务(如仓储分拣)优化。真正的通用人形机器人(能像人一样做任何事)还有多远?

乐观派认为:基础模型的泛化能力正在快速提升,π0 已经展示了跨任务泛化的可能性,5-8 年内可能出现真正通用的机器人。

悲观派认为:物理世界的复杂性远超语言空间,长尾问题(罕见场景、边缘情况)可能需要数十年才能解决。

问题二:数据问题

LLM 的成功依赖互联网上海量的文本数据。但机器人操作数据极度稀缺——采集成本高、场景多样、难以标注。

三个可能的解法:

  1. 合成数据:用仿真器生成大量训练数据(英伟达 Isaac Lab 的路线)
  2. 人类视频:从 YouTube 等平台的人类操作视频中学习(RT-2、π0 的路线)
  3. 规模化采集:大量部署机器人,用真实操作数据训练(特斯拉的路线)

问题三:安全与对齐

具身智能的对齐问题比 LLM 更紧迫——一个说错话的 AI 是麻烦,一个做错事的机器人可能造成物理伤害。

关键挑战:如何确保机器人在「没见过的情况」下做出安全的决策?如何在追求能力的同时保持可控性?这些问题目前没有完整答案,但已经是学术界和工业界的核心研究方向。

时间线预测

  • 2026-2027:工业场景规模化部署,头部公司年出货量突破万台
  • 2027-2029:物流、零售场景商业化,通用操作能力显著提升
  • 2029-2032:家庭服务机器人开始进入早期采用者家庭
  • 2032+:真正通用人形机器人,可能成为继智能手机之后最大的消费电子品类

具身智能是 AI 发展的下一个主战场。当 LLM 让 AI 学会了「用语言思考」,具身智能要让 AI 学会「用身体思考」——这两种能力的融合,可能才是真正通用人工智能的雏形。