引言:人形机器人走出实验室
2025年,人形机器人产业迎来拐点。特斯拉Optimus开始工厂内部试用,Figure 02在宝马产线部署,宇树G1以9.9万元价格进入消费市场。人形机器人不再是Tech Crunch舞台上的演示品,而是正在走进工厂、仓库甚至家庭。

一、为什么是人形
人类的环境是为人体设计的——门的高度、楼梯的宽度、工具的握持方式。人形机器人可以直接使用现有的人类基础设施和工具,无需改造环境。这是相比轮式或履带式机器人的核心优势。
但人形也是最难的形态——双足平衡、全身协调、灵巧操作,每一项都是工程挑战。
二、核心技术栈
2.1 运动控制
双足行走是人形机器人的基础能力。当前主流方案:
- 模型预测控制(MPC):基于物理模型实时规划步态,稳定性好但计算量大
- 强化学习:通过仿真训练步态策略,迁移到真实机器人。宇树、波士顿动力均在采用
- 全身控制(WBC):协调四肢和躯干实现复杂动作

2.2 灵巧手
人形机器人的价值最终体现在“手”上——能否完成人类级别的操作任务。当前灵巧手方案:
| 方案 | 自由度 | 特点 |
|---|---|---|
| 欠驱动手 | 6-12 DoF | 结构简单,自适应抓取 |
| 全驱动手 | 16-24 DoF | 精细操作,成本高 |
| 气动软手 | 柔性 | 安全友好,精度低 |
Figure 02的第四代手有16个自由度,能完成鸡蛋抓取、螺丝装配等精细任务。
2.3 感知与规划
人形机器人需要在动态环境中实时感知和决策。技术栈包括:
- 视觉感知:深度相机+LiDAR构建环境模型
- 语义理解:识别物体类别、位置和功能
- 任务规划:将“把桌上的杯子放到柜子里”分解为移动→抓取→移动→放置
- 端到端学习:从人类示教数据中学习操作策略(VLA模型)

2.4 VLA大模型
视觉-语言-动作(Vision-Language-Action)模型是人形机器人的“大脑”。Google的RT-2、Figure与OpenAI合作的模型、特斯拉的端到端控制,都试图用大模型统一感知、理解和动作生成。这是人形机器人从“遥控”走向“自主”的关键。
三、主要玩家
| 企业 | 产品 | 特点 | 阶段 |
|---|---|---|---|
| 特斯拉 | Optimus Gen 3 | 自研执行器,大规模制造 | 工厂试用 |
| Figure AI | Figure 02 | OpenAI合作VLA模型 | 宝马产线部署 |
| 宇树科技 | G1/H1 | 性价比高,运动能力强 | 消费/研究 |
| 智元机器人 | 远征A1 | 国产化率高,场景丰富 | 多场景试点 |
| Agility Robotics | Digit | 仓储物流专用 | 亚马逊仓库 |
| 波士顿动力 | Atlas(电控) | 运动能力标杆 | 研发阶段 |
四、商业化路径

4.1 工业场景先行
工厂和仓库是人形机器人最先落地的场景——环境结构化、任务重复性高、ROI可量化。Figure在宝马装配线、Agility在亚马逊仓库都是典型案例。
4.2 商业服务
酒店接待、商场导购、展厅讲解等服务场景对运动能力要求较低,但对交互和语义理解要求高,适合VLA模型发挥。
4.3 家庭场景
家庭是人形机器人的终极市场,但也是最难的——非结构化环境、安全要求高、任务多样。预计需要5-8年成熟。
五、核心挑战
- 成本:当前单价10-30万美元,需要降到2-5万美元才能大规模普及
- 可靠性:工厂7×24运行需要MTBF远超当前水平
- 通用性:当前擅长特定任务,通用操作能力仍不足
- 数据:VLA模型需要海量操作示教数据,仿真到真实的迁移仍是难题
- 安全:与人共处环境下的碰撞安全和隐私保护
六、未来展望
人形机器人产业的时间线:
- 2025-2027:工业场景规模化部署,单台成本降至10万以内
- 2028-2030:商业服务场景渗透,VLA模型成熟
- 2030+:家庭场景启动,人形机器人成为继汽车之后最大的制造业
马斯克预测最终年产量可达数千万台,市场规模超过汽车工业。虽然这一预测偏乐观,但人形机器人作为“下一个iPhone”的潜力是真实的。
结语
人形机器人是AI从数字世界进入物理世界的桥梁。大模型提供了“大脑”,机器人本体提供了“身体”,两者的结合正在创造一个全新的产业。中国在这一赛道拥有供应链、成本和应用场景的三重优势,有望在全球竞争中占据重要位置。

