具身智能技术栈全景:从 VLA 到世界动作模型,机器人如何学会干活
五层技术堆栈深度拆解,VLA、世界模型、触觉感知与跨本体泛化全解析
具身智能技术栈全景:从 VLA 到世界动作模型,机器人如何学会干活
五层技术堆栈深度拆解,VLA、世界模型、触觉感知与跨本体泛化全解析
本文系统梳理具身智能的五层技术堆栈:大脑(VLA 与世界动作模型)、躯体(人形机器人整机)、零部件(驱动器与传感器)、燃料(训练数据与仿真)和试验场(商业化落地)。深入讲解 VLA 模型的工作原理、世界动作模型的三大设计思路(渲染后解码、仅隐空间、无视频生成)、以及跨本体泛化等前沿技术。同时分析当前行业瓶颈与未来趋势,适合希望建立系统认知的开发者与研究者。
引言:具身智能的浪潮与挑战
2026 年第一季度,机器人与实体 AI 领域初创企业完成 492 笔融资,总金额达 163 亿美元,创下历史新高。人形机器人整机厂商频繁发布演示视频,翻跟头、跳舞、跑马拉松轮番刷屏。然而,喧嚣背后,行业共识逐渐形成:决定机器人能力上限的,已不只是关节与电机,而是能否理解环境、预测变化并协调全身完成任务。
具身智能(Embodied AI)的范畴远不止人形机器人,它涵盖工业机械臂、仓储机器人、自动驾驶车辆、农业设备、无人机、手术机器人等所有能够感知物理世界并完成实体动作的智能系统。人形机器人只是其中技术难度最高的分支,它集成了感知、推理、平衡、移动、操作、触觉交互、动力供给、安全防护等所有核心难题,堪称检验全栈技术的终极压力测试载体。
本文将从五层技术堆栈出发,系统拆解具身智能的完整技术图谱,重点讲解 VLA 模型、世界动作模型(WAM)、触觉感知、跨本体泛化等关键模块,帮助读者建立从底层硬件到顶层算法的系统性认知。
第一层:大脑——模型与决策
VLA 视觉语言动作模型
VLA(Vision-Language-Action)模型是当前具身智能大脑的核心范式。它接收机器人视觉画面和人类文字指令,输出机器人应当执行的动作。与大语言模型预测下一个文字类似,VLA 模型预测机器人的运动轨迹。
VLA 模型并非直接控制每一个电机,而是采用分层架构:高层模型理解任务目标、规划整体动作;底层控制器负责维持机身平衡、规避碰撞、力度控制和关节高精度运动。
当前行业攻坚的核心前沿问题是:能否打造通用“大脑”,适配不同任务、不同机型,而非为单一机器人定制专属模型。
世界动作模型(WAM)
世界动作模型是 VLA 的进化版本,它具备显式的未来预测能力。WAM 的核心思想是:在行动前预判环境变化,将未来观测纳入动作生成链路。
根据新加坡国立大学的最新综述,WAM 存在三种数学表达形式:
#### WAM 的三大设计思路
行业整体趋势是“少想象、多执行”——减少无用画面生成,保留控制必需的预测特征。
跨本体 VLA 与 MoE 架构
蚂蚁灵波发布的 LingBot-VLA 2.0 展示了跨本体泛化的最新进展。该模型支持 17 家厂商的 20 种机器人构型,覆盖单臂、双臂、轮式、双足等多种形态。其核心技术包括:
LingBot-VLA 2.0 在 GM-100 评测中,在多个双臂机器人平台上的平均任务进度分和成功率均领先 GR00T N1.7 和 π0.5。
人类学习范式:Human-as-Humanoid
深度机智提出的 Human-as-Humanoid 路线,试图用人类视频直接训练机器人。其核心逻辑是:机器人本体越接近人类,人类数据中的动作经验就越容易被完整承接。
深度机智的 PrimeU 机器人对照 ANSUR II 人体测量数据库设计,肩宽比例 0.97,臂展比例 1.02,手掌长度比例精确到 1.00。通过纯相机方案采集人类视频,再经分阶段逆运动学(Staged IK)求解器将人体骨架映射到机器人关节空间,实现 4.8 到 7.2 倍的演示吞吐量提升。
PhysDex 策略引入双空间分层运动学约束(DS-HKC),通过可微正向运动学层将预测动作映射到任务空间,在腕部位姿和十个指尖位置施加几何监督,无需额外标注。在七项双手操作任务上全面胜出 GR00T N1.7。
第二层:躯体——机器人整机
人形机器人整机厂商负责本体设计、组装生产。2025 年全球人形机器人出货量约 1.3 万台,增速迅猛但基数极低,绝大多数设备用于科研、教学和试点项目。
主要玩家
第三层:零部件——驱动器、传感器与灵巧手
一台人形机器人拥有 40 个以上可驱动关节,每一处关节都是独立的工程难题。
核心组件
第四层:燃料——训练数据与仿真
机器人训练数据是当前融资热度最高的细分领域之一。机器人不能像大语言模型一样直接读取互联网文本,不存在公开海量高质量数据集记录机器人视觉画面与对应电机动作。
四大数据采集方案
数据工程前沿
蚂蚁灵波从 9 万小时数据中清洗出 5 万小时高质量真机数据,并从 2 万小时第一视角人类操作数据中提炼 1 万小时有效数据,使预训练数据总量达到 6 万小时。清洗流程包括:计算动作信号的 jerk(三阶有限差分),过滤动作突变和信号异常的 episode;剔除长时间几乎没有动作变化的片段。
第五层:试验场——商业化落地
当前真正实现规模化、稳定盈利的机器人,大多并非人形机器人,而是针对特定场景定制的专用自动化设备。
大规模商用案例
人形机器人落地进展
人形机器人整体仍处于试点阶段,大规模量产商用仍需时间。
前沿技术专题
隐式世界动作模型
智在无界发布的 Being-M0.7 是全球首个面向人形机器人全身移动操作的隐式世界动作模型。它在隐空间中预测未来环境状态,而非像素级视频生成,大幅降低计算开销。
核心设计包括:
在真机测试中,Being-M0.7 在鱼缸捞鱼、镜像取物、移动置物取物、搬箱避障等任务上均表现出色。
ABot-M0.5:面向移动操作的世界动作模型
阿里高德 CV 实验室提出的 ABot-M0.5 针对移动操作任务,解决了现有 WAM 的三大结构错配:
在 RoboCasa365、LIBERO、RoboTwin 等基准测试中,ABot-M0.5 在长时序任务和精细操作上达到 SOTA。
行业瓶颈与未来展望
核心瓶颈
未来趋势
总结
具身智能的五层技术堆栈——大脑、躯体、零部件、燃料、试验场——构成了一个相互依赖的生态系统。VLA 模型和世界动作模型正在重塑大脑的能力边界,而跨本体泛化和人类数据驱动则有望解决数据与成本瓶颈。对于开发者而言,理解这一全景图谱,有助于在快速演进的赛道中找到自己的技术定位。
FAQ
Q1:VLA 模型和世界动作模型(WAM)有什么区别?
VLA 模型是反应式策略,直接根据当前观测和指令映射为动作,不显式建模动作引发的环境变化。WAM 则在动作生成链路中引入未来预测,能够预判行为后果,在长时序任务和复杂物理交互中表现更优。WAM 可以理解为 VLA 的进化版本,增加了显式的世界建模能力。
Q2:为什么说人形机器人是具身智能的“终极压力测试”?
人形机器人集成了感知、逻辑推理、平衡控制、移动行走、物体操作、触觉交互、动力供给、安全防护、量产制造、现实场景自主学习等所有核心技术难题。任何一项短板都会导致整体失败。相比之下,工业机械臂只需完成单一操作,仓储机器人只需移动和搬运,技术复杂度低得多。因此,搞懂人形机器人的完整技术堆栈,其他机器人的底层逻辑都能套用同一框架。
Q3:跨本体泛化(一脑多机)面临哪些挑战?
主要挑战包括:不同机器人本体的关节结构、自由度、动作空间、控制接口五花八门;同一模型需要同时处理底盘移动(低频平滑)和机械臂操作(高频精细)等异构动作;训练数据来自不同本体,存在分布差异。当前解决方案包括统一动作表示、MoE 架构(让通用能力与本体差异在同一个架构中建模)、以及大规模多本体预训练数据。
Q4:当前人形机器人商业化处于什么阶段?
整体处于试点和小规模试用阶段。2025 年全球出货量约 1.3 万台,绝大多数用于科研、教学和产品演示。少数企业(如 Figure 与宝马、Agility 与 GXO)已实现有限量产落地,但尚未搭建多厂区大规模部署。专用工业自动化设备(如亚马逊仓储机器人)仍是当前商业化主力。预计还需 3-5 年才能实现规模化商用。
Q5:人类视频数据如何用于训练机器人?
核心思路是“Human-as-Humanoid”:先让机器人本体向人类对齐(尺寸、自由度接近人类),再通过纯相机方案采集人类第一视角视频,经逆运动学求解器将人体骨架映射到机器人关节空间,生成动作标签。关键难点在于弥合人类与机器人的形态差异,以及处理遮挡、运动模糊等困难条件下的骨架恢复。深度机智的 PhysDex 策略通过双空间分层运动学约束,将人类数据与机器人控制接口之间的分布差异压缩到毫米级。
相关教程
梳理世界模型(WAM、WVM、LoopWM)与具身智能(VLA、Skill)的最新进展,以及如何评估和落地
从 GeneBench-Pro 到 CJS 框架,系统梳理模型评测基准、安全攻击与对齐技术的全景与深度实践
厘清概念、分类与评估方法,揭示世界模型在具身智能与视频生成中的核心挑战
从底层原理到前沿方案,系统降低大模型部署成本
系统讲解后训练中的关键方法(SFT、RLHF、OPD、PEFT),并给出评估通用能力损失的量化方法
系统梳理 AI 安全风险与防护手段,助力开发者构建可靠智能体