EN

具身智能技术栈全景:从 VLA 到世界动作模型,机器人如何学会干活

五层技术堆栈深度拆解,VLA、世界模型、触觉感知与跨本体泛化全解析

返回教程列表
进阶25 分钟

具身智能技术栈全景:从 VLA 到世界动作模型,机器人如何学会干活

五层技术堆栈深度拆解,VLA、世界模型、触觉感知与跨本体泛化全解析

本文系统梳理具身智能的五层技术堆栈:大脑(VLA 与世界动作模型)、躯体(人形机器人整机)、零部件(驱动器与传感器)、燃料(训练数据与仿真)和试验场(商业化落地)。深入讲解 VLA 模型的工作原理、世界动作模型的三大设计思路(渲染后解码、仅隐空间、无视频生成)、以及跨本体泛化等前沿技术。同时分析当前行业瓶颈与未来趋势,适合希望建立系统认知的开发者与研究者。

引言:具身智能的浪潮与挑战

2026 年第一季度,机器人与实体 AI 领域初创企业完成 492 笔融资,总金额达 163 亿美元,创下历史新高。人形机器人整机厂商频繁发布演示视频,翻跟头、跳舞、跑马拉松轮番刷屏。然而,喧嚣背后,行业共识逐渐形成:决定机器人能力上限的,已不只是关节与电机,而是能否理解环境、预测变化并协调全身完成任务。

具身智能(Embodied AI)的范畴远不止人形机器人,它涵盖工业机械臂、仓储机器人、自动驾驶车辆、农业设备、无人机、手术机器人等所有能够感知物理世界并完成实体动作的智能系统。人形机器人只是其中技术难度最高的分支,它集成了感知、推理、平衡、移动、操作、触觉交互、动力供给、安全防护等所有核心难题,堪称检验全栈技术的终极压力测试载体。

本文将从五层技术堆栈出发,系统拆解具身智能的完整技术图谱,重点讲解 VLA 模型、世界动作模型(WAM)、触觉感知、跨本体泛化等关键模块,帮助读者建立从底层硬件到顶层算法的系统性认知。

第一层:大脑——模型与决策

VLA 视觉语言动作模型

VLA(Vision-Language-Action)模型是当前具身智能大脑的核心范式。它接收机器人视觉画面和人类文字指令,输出机器人应当执行的动作。与大语言模型预测下一个文字类似,VLA 模型预测机器人的运动轨迹。

VLA 模型并非直接控制每一个电机,而是采用分层架构:高层模型理解任务目标、规划整体动作;底层控制器负责维持机身平衡、规避碰撞、力度控制和关节高精度运动。

当前行业攻坚的核心前沿问题是:能否打造通用“大脑”,适配不同任务、不同机型,而非为单一机器人定制专属模型。

世界动作模型(WAM)

世界动作模型是 VLA 的进化版本,它具备显式的未来预测能力。WAM 的核心思想是:在行动前预判环境变化,将未来观测纳入动作生成链路。

根据新加坡国立大学的最新综述,WAM 存在三种数学表达形式:

  • 先预测,再解码动作(级联式):先预测未来画面或特征,再用独立动作模块输出动作,如 UniPi、VLP。
  • 先给出候选动作,再推演后果(动作采样打分):先生成动作候选,再通过预测未来评估动作优劣,用于规划与模型预测控制。
  • 动作与未来联合生成:单一主干同时预测未来表征与动作,如 GR 系列、WorldVLA。
  • #### WAM 的三大设计思路

    设计思路代表工作优势劣势

    渲染后解码(Render-and-Decode)UniPi、GR-2、WorldVLA完整复用视频先验,可视化强推理时延极高,不适合实时控制 仅隐空间(Latent-Only)VPP、Fast-WAM保留视频动力学先验,大幅降低显存与耗时无直观像素可视化 无视频生成(Video-Generation-Free)FLARE、DUST、PointWorld算力开销最低,天然适配语言任务缺少通用视频视觉先验,复杂场景泛化弱

    行业整体趋势是“少想象、多执行”——减少无用画面生成,保留控制必需的预测特征。

    跨本体 VLA 与 MoE 架构

    蚂蚁灵波发布的 LingBot-VLA 2.0 展示了跨本体泛化的最新进展。该模型支持 17 家厂商的 20 种机器人构型,覆盖单臂、双臂、轮式、双足等多种形态。其核心技术包括:

  • 统一动作表示:为跨本体学习提供基础
  • MoE 架构:采用 token-level loss-free MoE,用 MoE FFN 替代原有前馈网络,让模型在扩大容量的同时更好吸收不同本体之间的共性和差异。关键设计包括 loss-free 机制(避免 MoE 辅助损失干扰动作预测)和 token-level 路由(每个 token 可激活多个专家)。
  • 双查询蒸馏:从 LingBot-Depth(深度感知)和 DINO-Video(因果时序视频表征)两个教师模型中学习,补强空间理解和时序预判。
  • LingBot-VLA 2.0 在 GM-100 评测中,在多个双臂机器人平台上的平均任务进度分和成功率均领先 GR00T N1.7 和 π0.5。

    人类学习范式:Human-as-Humanoid

    深度机智提出的 Human-as-Humanoid 路线,试图用人类视频直接训练机器人。其核心逻辑是:机器人本体越接近人类,人类数据中的动作经验就越容易被完整承接。

    深度机智的 PrimeU 机器人对照 ANSUR II 人体测量数据库设计,肩宽比例 0.97,臂展比例 1.02,手掌长度比例精确到 1.00。通过纯相机方案采集人类视频,再经分阶段逆运动学(Staged IK)求解器将人体骨架映射到机器人关节空间,实现 4.8 到 7.2 倍的演示吞吐量提升。

    PhysDex 策略引入双空间分层运动学约束(DS-HKC),通过可微正向运动学层将预测动作映射到任务空间,在腕部位姿和十个指尖位置施加几何监督,无需额外标注。在七项双手操作任务上全面胜出 GR00T N1.7。

    第二层:躯体——机器人整机

    人形机器人整机厂商负责本体设计、组装生产。2025 年全球人形机器人出货量约 1.3 万台,增速迅猛但基数极低,绝大多数设备用于科研、教学和试点项目。

    主要玩家

    地区企业特点

    美国Figure自研 Helix 大模型,与宝马合作 美国特斯拉Optimus,优先落地自有工厂 美国Agility RoboticsDigit 在 GXO 物流搬运超 10 万个货箱 中国宇树(Unitree)G1 起售价约 1.35 万美元,成本优势显著 中国智元(AgiBot)2025 年全球出货量第一,5168 台 中国优必选(UBTech)Walker 系列在工业场景测试 德国NEURA Robotics4NE1 人形机器人

    第三层:零部件——驱动器、传感器与灵巧手

    一台人形机器人拥有 40 个以上可驱动关节,每一处关节都是独立的工程难题。

    核心组件

  • 驱动器(Actuator):集成电机、减速器、传感器、轴承、控制电路板的一体化关节模组。
  • 谐波减速器:高精度紧凑型减速器,制造成本高、工艺门槛极高,是人形机器人供应链最核心瓶颈之一。
  • 灵巧手:Sharpa 的 22 自由度 Wave 机械手搭载于英伟达 GR00T 参考人形机器人。
  • 力觉/触觉传感器:诺万达旗下 ATI 工业自动化、威士精密等。
  • 机载边缘计算:英伟达 Jetson Thor 系列。
  • 第四层:燃料——训练数据与仿真

    机器人训练数据是当前融资热度最高的细分领域之一。机器人不能像大语言模型一样直接读取互联网文本,不存在公开海量高质量数据集记录机器人视觉画面与对应电机动作。

    四大数据采集方案

  • 远程示教:人类通过动作捕捉设备远程操控机器人,记录视觉画面与关节运动轨迹。优势是数据质量高,劣势是成本高昂、难以规模化。
  • 仿真模拟:机器人在物理仿真引擎中完成虚拟训练。优势是速度快、成本低,劣势是“仿真到现实”的鸿沟。
  • 人类视频+穿戴传感:依托第一视角视频、人体动作捕捉采集数据。优势是数据来源充足,劣势是人类与机器人形态不匹配。
  • 机群回流数据:已落地运行的机器人持续记录作业数据,长期看价值最高。
  • 数据工程前沿

    蚂蚁灵波从 9 万小时数据中清洗出 5 万小时高质量真机数据,并从 2 万小时第一视角人类操作数据中提炼 1 万小时有效数据,使预训练数据总量达到 6 万小时。清洗流程包括:计算动作信号的 jerk(三阶有限差分),过滤动作突变和信号异常的 episode;剔除长时间几乎没有动作变化的片段。

    第五层:试验场——商业化落地

    当前真正实现规模化、稳定盈利的机器人,大多并非人形机器人,而是针对特定场景定制的专用自动化设备。

    大规模商用案例

  • 亚马逊:全球运营超 100 万台仓储机器人。
  • Symbotic:2025 年末在手订单规模 2230 亿美元,核心客户为沃尔玛。
  • 人形机器人落地进展

  • Figure × 宝马:累计运行时长超 1250 小时,参与 3 万台整车生产流程。
  • Agility Digit × GXO:累计搬运超 10 万个货箱。
  • 人形机器人整体仍处于试点阶段,大规模量产商用仍需时间。

    前沿技术专题

    隐式世界动作模型

    智在无界发布的 Being-M0.7 是全球首个面向人形机器人全身移动操作的隐式世界动作模型。它在隐空间中预测未来环境状态,而非像素级视频生成,大幅降低计算开销。

    核心设计包括:

  • Vision-Motion MoT(Mixture-of-Transformers):为视觉和运动保留各自的模态专属处理模块,同时通过共享多模态注意力进行跨模态交互。
  • 统一运动表征:将人体运动数据转换为以头部为根节点的统一表示,仅保留头部、双手和双脚的紧凑运动表示,弥合人类与机器人之间的形态差异。
  • 10000 小时混合模态预训练数据:涵盖人类第一人称视频、视频-运动配对数据、纯人体运动序列。
  • 在真机测试中,Being-M0.7 在鱼缸捞鱼、镜像取物、移动置物取物、搬箱避障等任务上均表现出色。

    ABot-M0.5:面向移动操作的世界动作模型

    阿里高德 CV 实验室提出的 ABot-M0.5 针对移动操作任务,解决了现有 WAM 的三大结构错配:

  • 时序粒度错配:引入帧级中间隐动作,搭建“视频隐变量→隐动作→底层控制”三级链路,捕捉精细接触动力学。
  • 动作结构错配:设计双层混合 Transformer(D-MoT),分离底盘移动和机械臂操作双动作子空间,消除梯度干扰。
  • 训练推理分布错配:提出“梦境强制”(Dream Forcing)两阶段训练,用模型自生成画面训练逆动力学,缩小暴露偏差。
  • 在 RoboCasa365、LIBERO、RoboTwin 等基准测试中,ABot-M0.5 在长时序任务和精细操作上达到 SOTA。

    行业瓶颈与未来展望

    核心瓶颈

  • 通用智能算法不完善:仿真与现实存在鸿沟,模型在真实环境中的泛化能力不足。
  • 高端零部件成本高昂:谐波减速器、力矩传感器等核心部件依赖进口,国产替代仍在推进。
  • 训练数据稀缺:高质量真机数据采集成本高,跨本体数据标准化困难。
  • 投入产出比不足:人形机器人尚未形成规模经济,商业化路径仍需探索。
  • 未来趋势

  • 从 VLA 到 WAM:显式世界建模将成为标配,未来预测能力从“可选”变为“必需”。
  • 跨本体泛化:一脑多机是降低部署成本的关键,MoE 架构和统一动作表示是主流技术路线。
  • 人类数据驱动:Human-as-Humanoid 路线有望突破数据瓶颈,本体设计与人类对齐成为新趋势。
  • 仿真到现实的鸿沟缩小:梦境强制等训练策略正在弥合训练与推理的分布差异。
  • 总结

    具身智能的五层技术堆栈——大脑、躯体、零部件、燃料、试验场——构成了一个相互依赖的生态系统。VLA 模型和世界动作模型正在重塑大脑的能力边界,而跨本体泛化和人类数据驱动则有望解决数据与成本瓶颈。对于开发者而言,理解这一全景图谱,有助于在快速演进的赛道中找到自己的技术定位。

    FAQ

    Q1:VLA 模型和世界动作模型(WAM)有什么区别?

    VLA 模型是反应式策略,直接根据当前观测和指令映射为动作,不显式建模动作引发的环境变化。WAM 则在动作生成链路中引入未来预测,能够预判行为后果,在长时序任务和复杂物理交互中表现更优。WAM 可以理解为 VLA 的进化版本,增加了显式的世界建模能力。

    Q2:为什么说人形机器人是具身智能的“终极压力测试”?

    人形机器人集成了感知、逻辑推理、平衡控制、移动行走、物体操作、触觉交互、动力供给、安全防护、量产制造、现实场景自主学习等所有核心技术难题。任何一项短板都会导致整体失败。相比之下,工业机械臂只需完成单一操作,仓储机器人只需移动和搬运,技术复杂度低得多。因此,搞懂人形机器人的完整技术堆栈,其他机器人的底层逻辑都能套用同一框架。

    Q3:跨本体泛化(一脑多机)面临哪些挑战?

    主要挑战包括:不同机器人本体的关节结构、自由度、动作空间、控制接口五花八门;同一模型需要同时处理底盘移动(低频平滑)和机械臂操作(高频精细)等异构动作;训练数据来自不同本体,存在分布差异。当前解决方案包括统一动作表示、MoE 架构(让通用能力与本体差异在同一个架构中建模)、以及大规模多本体预训练数据。

    Q4:当前人形机器人商业化处于什么阶段?

    整体处于试点和小规模试用阶段。2025 年全球出货量约 1.3 万台,绝大多数用于科研、教学和产品演示。少数企业(如 Figure 与宝马、Agility 与 GXO)已实现有限量产落地,但尚未搭建多厂区大规模部署。专用工业自动化设备(如亚马逊仓储机器人)仍是当前商业化主力。预计还需 3-5 年才能实现规模化商用。

    Q5:人类视频数据如何用于训练机器人?

    核心思路是“Human-as-Humanoid”:先让机器人本体向人类对齐(尺寸、自由度接近人类),再通过纯相机方案采集人类第一视角视频,经逆运动学求解器将人体骨架映射到机器人关节空间,生成动作标签。关键难点在于弥合人类与机器人的形态差异,以及处理遮挡、运动模糊等困难条件下的骨架恢复。深度机智的 PhysDex 策略通过双空间分层运动学约束,将人类数据与机器人控制接口之间的分布差异压缩到毫米级。