
1. 人形机器人行业的分水岭时刻过去这几年我和不少做机器人、做AI的朋友聊过同一个问题为什么人形机器人demo总给人一种“预告片很震撼、正片很尴尬”的感觉厂商发布会上的机器人能跑能跳能抓取可一旦扔进真实环境——桌面换个角度、物体换个颜色、光线暗一点——立刻变成智商掉线的铁疙瘩。问题从来不在“身体”而在“大脑”。传统机器人控制走的是模块化流水线感知、建图、规划、控制各管一段每段都有人专门调参。这套方案在结构化工厂里能跑得通但放到开放环境里误差一级一级往下传最后出来的动作往往惨不忍睹。所以当Figure AI官宣Figure 03人形机器人、并同步放出Helix端到端控制系统的时候行业里的反应比大多数围观群众想象中要激烈得多。原因很简单这是第一次有人把“视觉-语言-动作”大模型真正跑进人形机器人的实时控制回路而且把代码和模型权重全开源了。对做具身智能的人来说这相当于有人把你画在PPT上的蓝图直接砌成了样板房。这可能是人形机器人从“实验室玩物”走向“通用生产力工具”的第一个实质性信号。1.1 为什么“看起来很强”的机器人总在翻车先聊个最基本的常识人形机器人本质上是一台装着几十个电机的实时控制系统。电机越多控制维度越高出错空间越大。Figure 03这种级别的本体自由度已经是几十个起步光是手臂加手掌就有十几二十个关节每个关节都要在毫秒级内完成力矩、位置、速度的协调。传统做法是给每个关节写PID控制器再在上层做运动规划——听起来似乎没问题但现实环境不会按你的预设剧本走。我见过一个很典型的例子某团队给机械臂写好“抓取红色杯子”的完整状态机杯子放在固定位置抓一百次成功一百次。然后他们把杯子挪了5厘米抓取成功率直接掉到三成。为什么因为感知模块给规划模块传的坐标有一点抖动规划模块算出的轨迹就不对底层控制器硬追轨迹最后要么够不到、要么把杯子碰倒。这就是模块化系统的顽疾——每一层都觉得自己没错但组合起来就是没法用。端到端系统要做的就是把这个“层层转包”的流程砍掉让机器人直接从像素和语言指令映射到关节动作。Helix最激进的地方正是把这件事做到了可以实时运行、可以看效果的程度。1.2 Helix带来的真正变化是“控制系统”而不是“外形”很多人关注Figure 03盯着的是外形、自由度、续航这些硬件参数。但如果你去翻Figure的公开资料和Helix技术报告会发现他们真正想讲的故事是把大语言模型那套“预训练微调泛化”的成功路径完整复制到机器人控制领域。Helix不是传统的“感知模块运动规划模块”拼装而是一个完整的视觉-语言-动作VLA模型输入的是相机画面和自然语言指令输出的是机器人关节的运动轨迹。这种模型此前不是没有学术界发过不少VLA论文但基本都是单臂操作、桌面级任务、速度慢得让人着急。Helix首次做到的是双系统协同、80Hz实时控制、同时驱动上半身所有自由度、而且能在没见过的物体上做到零样本泛化。说白了Figure 03是一次硬件平台的迭代而Helix才是这轮技术突破的灵魂。硬件再猛没有Helix这样的“大脑”它也只是个很贵的健身器材。2. Figure 03硬件底座承载端到端智能的物理平台2.1 仿人比例、自由度分布与执行器选型人形机器人最尴尬的设计陷阱是“为了像人而像人”。很多团队把自由度堆得很高结果线束复杂度爆炸、控制难度飙升、本体可靠性下降。Figure 03的设计思路明显更务实仿人比例的意义不是为了好看而是为了让机器人在人类生活空间里能直接使用人类工具、走人类通道、操作人类设备。从公开信息来看Figure系列一直强调几个核心指标手部操作灵活性、负重能力与自重的比例、以及整机能耗控制。到了Figure 03这一代业内关注点集中在两件事一是执行器是否采用了更高扭矩密度的一体化关节方案二是指关节是否具备独立驱动能力。后者对Helix尤其关键因为Helix的设计目标之一就是“让每一根手指都能独立动作”这在叠衣服、组装零件、精细抓取这类任务里是刚需。据目前已经展示的演示片段和Helix论文里的描述机器人在整理杂物、拾取小型物件时的手部动作已经相当顺滑手指不再是“整个拳头抓个大概”而是能根据物体形状自动调整每根手指的弯曲角度。这种级别的手部控制对执行器的力控精度和响应带宽要求是直逼工业级的。2.2 传感器融合与机载算力配置端到端模型是吃算力的大户。一个8B参数的视觉语言模型VLM跑在机器人本体的嵌入式GPU上还要保证80Hz的动作输出频率这在算法层面是极其苛刻的。以Helix公布的架构来看模型主干是8B参数量级而实际运行时的推理优化肯定做了大量剪枝、量化和算子融合工作否则以人形机器人自带的电池和散热条件很难撑起这种量级的持续计算。传感器层面Figure 03这类产品一般会配备多目视觉、深度传感器、IMU和关节编码器。Helix的真正厉害之处在于它不依赖精确的物体位姿估计也不需要预先建模——注意力机制直接从图像里提取特征语言指令作为条件输入整个系统以“感知-决策-控制”一体化的方式运作。这跟传统机器人“标定完内参外参、建好物体模型再开始抓取”的思路是完全不同的逻辑。2.3 硬件与Helix的协同关系这里必须多说一句Helix不是凭空跑起来的它对硬件的要求是隐性的但极为苛刻。80Hz的动作输出意味着每个控制周期只有12.5毫秒在这个窗口内模型要完成视觉特征提取、语言指令融合、动作生成、力矩下发一整条链路。所以Figure 03的硬件在设计之初就要考虑机载算力能不能扛得住大模型推理、散热会不会影响长时间稳定工作、电机响应延迟会不会拖慢闭环反馈。我自己的观察是Helix在Figure本体上能出效果很大程度要归功于硬件与算法的联合设计。比如视觉传感器的安装位置、视野覆盖范围必须和模型输入的图像尺寸、视角匹配关节编码器的分辨率必须足够高才能让模型学到精细动作对应的精确状态变化。这些细节在论文里往往一句话带过但在实际工程里全都是坑。3. Helix双系统架构从直觉反应到语义推理3.1 System 1和System 2分工快思考与慢思考的机器人版Helix最出圈的设计是把诺贝尔经济学奖得主卡尼曼的“双系统理论”搬进了机器人控制系统。System 1是“快系统”以80Hz高频运转直接负责生成动作System 2是“慢系统”以7-9Hz节奏运转负责解析语义、理解场景、做视觉语言联合推理然后把高级指令传给System 1。我在读Helix技术报告时最大的感触是这个架构设计非常聪明。机器人控制最怕的就是“大脑想得慢、手脚等不及”。如果所有语义理解都放在80Hz的回路里做算力根本扛不住如果全用低频语义控制动作又会一顿一顿像PPT。双系统等于把“想”和“做”分开System 2慢慢想清楚“要干什么”System 1快速执行“该怎么动”两者通过某种中间表征衔接。类比一下你开车遇到路口System 2负责看路牌判断“该左转还是右转”System 1负责踩刹车、打方向盘这些肌肉记忆动作。要是等你想清楚再打方向盘车早冲出去了。3.2 预训练视觉语言模型与动作解码器的组合具体实现上Helix先用海量互联网图文数据预训练一个8B参数的VLM让模型具备通用的视觉理解和语言理解能力。然后在VLM之上接一个轻量级动作解码器——这部分是随机初始化的专门负责输出机器人关节的运动指令。这种设计的精妙之处在于“站在巨人肩膀上”。如果从零训一个端到端的机器人控制模型需要的数据量是天文数字但VLM已经通过互联网数据学会了“杯子是什么”“桌子是什么”“把杯子放在桌子上”是什么意思。Helix要做的只是教会模型“看懂了之后胳膊怎么伸、手怎么张”。这相当于把“认知”和“动作生成”解耦让预训练的知识可以迁移到控制任务上。另外值得一提的是Helix是首个能同时控制人形机器人上半身所有自由度的VLA模型——包括躯干、手臂、手腕和每一根手指。此前业界做VLA控制基本都局限在二指夹爪或者简化版机械手上因为动作空间的维度一旦上去训练难度是几何级增长。Helix解决了这个问题靠的正是上面说的“VLM预训练动作解码器”这套组合拳。3.3 双系统之间如何无缝衔接Helix的两个系统并不是独立的。System 2输出的不是一句模糊的“去抓那个瓶子”而是一个语义级别的“意图表征”这个表征会作为条件输入给System 1结合当前最新的视觉信息生成具体的动作序列。同时System 1自身的输出会反馈给System 2让“慢系统”知道当前执行到哪一步、效果如何从而动态调整下一步意图。这种双向交互让系统具备了一定的闭环纠错能力。举个实际场景指令是“把红色马克杯放到蓝色托盘里”System 2负责定位杯子和托盘、理解“放”这个动作的含义System 1负责实时调整手部姿态去接近杯子、施加合适的抓取力。如果杯子被碰到了、位置偏移了System 1的视觉输入会立刻感知到System 2会根据当前状态重新规划目标再传给System 1。整个过程连贯流畅不再有传统系统里“感知模块换坐标、规划模块出轨迹、控制模块傻跟踪”的割裂感。4. VLA模型训练的幕后500小时遥操作数据的质量密码4.1 遥操作数据采集为什么是硬骨头End-to-end模型的能力天花板很大程度取决于训练数据的质量和规模。Helix官方公布的数据是用Figure 02机器人采集了500小时的高分辨率遥操作数据。这个数字放在自动驾驶领域不算多放在机器人领域却非常惊人——因为机器人遥操作数据的采集成本远比想象中高得多。什么叫高分辨率遥操作简单说就是一个人穿戴动作捕捉设备像操纵木偶一样操纵机器人完成各种任务全程记录视觉输入、关节角度、力矩等全部数据。这个过程中任务的设计必须覆盖足够多的情况不同的物体形状、不同的摆放位置、不同的桌面场景、不同的光照条件。如果任务太单一模型学到的只是“背答案”换个场景立刻露馅。我自己接触过的机器人数据团队在任务设计上经常争议不断。有的倾向堆数量什么任务都采有的倾向保质量只采精心设计过的长尾场景。从Helix的泛化效果来看他们的策略更偏向后者——用较少的但高度多样化的数据配合强大的VLM预训练底座实现“举一反三”的能力。4.2 Siamese微调策略与跨本体泛化Helix训练里还有一个值得深挖的细节采用了Siamese风格的微调策略。所谓Siamese网络通俗来说就是两套共享权重的网络同时处理两个不同的输入通过对比学习让模型学会“不同场景下提取到一致的特征”。在Helix的具体实现里同一段遥操作数据会以不同的视角、不同的上下文呈现给模型通过拉近“同一意图在不同视觉输入下的表征距离”让模型学会把对物体、对场景的理解抽象成与视角无关的语义概念。这样做的好处很明显机器人换了个位置看同一个物体也能认出“这是同一个杯子”换个颜色的同类杯子也能把它归类为“可以抓握的杯子”。这种训练策略是人形机器人摆脱“数据收集时什么样、部署时就只能这样干”困局的关键。也是Helix能实现零样本泛化到新物体的核心原因。4.3 泛化能力如何测试说句实话光看演示视频容易兴奋但搞技术的人都明白真正的检验标准是“没见过的场景表现”。从已公开的测试来看Helix在训练时没有见过的物体上能直接完成抓取和摆放任务不需要任何微调。归一化来看这意味着模型学到的不再是“某个物体的特定抓法”而是“基于语义理解和视觉特征推断抓取策略”的通用能力。配合Figure 03更强的硬件支撑这种泛化能力还能在更多复杂任务上体现比如整理厨具、收拾餐桌、甚至两台机器人协作搬运。Helix也是目前少有的能支持多机器人协同的VLA系统——多台机器人各自跑着相同的模型但通过System 2的语义推理共享对任务的理解协作完成“你放盘子我放杯子”这类分工动作。5. 端到端控制系统与模块化系统的本质区别5.1 传统模块化系统的组合误差困境前面提过传统机器人控制是感知→建图→规划→控制的流水线。这套方案最致命的问题是“组合误差”每一层都只对上层负责一旦某层输出有误差后面几层不会自动纠偏。比如视觉识别把杯子的中心点定位偏了3毫米机械臂的抓取姿态就可能偏出好几厘米最终表现为“眼看着要抓到了却总是差一点”。更麻烦的是调试成本。你永远不知道问题出在识别、规划还是执行层团队往往要在三个领域来回排查耗费大量时间。做项目的朋友应该都有过这种体验机器人百分之八十的时间在调试百分之二十的时间在干活。端到端系统的优势在于它不显式建模“杯子在哪、怎么规划轨迹、关节怎么动”而是把所有环节融进一个神经网络里通过大量数据直接学习“像素到动作”的映射。网络内部自发地发展出隐式的感知和规划表征不再需要人工显式定义接口和中间表示。这省掉了大量工程胶水代码也从根本上避开了层层转包导致的误差累积。5.2 端到端学习为何能做出模块化做不到的事模块化系统还有一个天花板复杂操作中的时序决策。比如“把烤好的面包从烤面包机里夹出来放到盘子里”这中间涉及面包姿态未知、夹取力度需要随面包硬度调整、放下的位置还得分毫不差。模块化系统处理这种任务时要么写大量if-else规则要么靠工程师手动设计状态机遇到没预判到的情况就宕机。端到端系统不写规则它是在训练数据里见过足够多的面包、夹子、盘子和不同的失败与成功案例然后学到一套隐式的决策策略。语言指令在这里甚至能充当“实时编程接口”——你不需要改代码只要说一句“把面包放到盘子里”或者“把面包放回包装袋”模型就能调整行为策略。这种人机交互方式对非技术用户极其友好也是具身智能走向千家万户的必由之路。5.3 端到端系统的短板还有哪些当然端到端不是银弹。最大的问题是“可解释性差”——模型做出一个动作你很难说清楚它为什么这么做。在工业场景里这会让安全认证变得很难做。另外数据分布外out-of-distribution的表现依然不可控训练数据里没出现过的情况模型会怎么反应谁也不敢打包票。Helix对此给出的部分答案是“预训练VLM提供的强先验”因为VLM已经在海量图文数据上学会了世界常识所以机器人对“没见过”的物体至少能基于语义做合理推测而不是完全瞎猜。但客观说真正的极端长尾场景还远没到能放心商用的程度。比如突然有人从侧面推机器人一把、或者物体处于完全非标准的姿态这类“罕见但致命”的情况依然是所有端到端控制系统的阿喀琉斯之踵。6. 具身智能学习的实用路线与踩坑记录6.1 零基础入门具身智能的推荐路径因为Helix开源最近问“怎么入门具身智能”的人明显多了。结合自己的经验我给三条实用路径分别对应不同背景。有深度学习背景、熟悉PyTorch的朋友建议直接从Helix开源仓库入手。把模型权重下载下来先跑通推理Demo再从DataLoader看到训练管线一步步搞清楚数据格式和动作空间的定义方式。这部分代码是目前VLA领域里工程完成度最高的开源资源之一值得精读。有机器人背景但不熟大模型的朋友先补Transformer和VLM基础重点理解“图像tokenn化、序列建模、交叉注意力”这些概念。不需要从零手写但要搞懂输入输出的张量形状变化否则看Helix数据管线时很容易一头雾水。纯零基础的朋友建议从具身智能入门课程或者经典论文精读开始。可以先看RT-1、RT-2、OpenVLA这几篇VLA领域最重要的论文再回过头看Helix。同时可以找一台带机械臂的开发平台比如一些桌面级协作臂跑一跑遥操作建立对“数据从哪来”的直观认知。我的个人看法是具身智能最稀缺的能力不是调模型而是“数据嗅觉”——知道什么数据能解决什么问题。Helix这类项目最值得学的其实是他们对数据采集、任务设计、模型架构三者之间关系的处理方式。6.2 Helix开源代码的实操心得Helix开源内容包括推理代码、训练代码和模型权重。我自己在本地跑过一轮推理分享几个实操中容易踩的坑硬件门槛8B参数的VLM推理对显存有要求虽然官方做了优化但想要流畅跑起来还是建议准备一块足够显存的现代GPU。想实机部署到机器人本体上还需要考虑量化方案否则延迟会非常感人。视觉输入规范Helix对输入图像的分辨率、视角数、帧率都有明确定义换摄像头之前一定要先把代码里的图像预处理部分看清否则模型对画面尺寸变化很敏感实测表现会大打折扣。语言指令的表述敏感度同一个任务用不同说法去指令效果可能不一样。比如“把杯子拿过来”和“把杯子放到托盘上”涉及的语义推理路径不同模型表现也不同。做实验时建议固定指令模板这样对照组才公平。还有一点老生常谈跑别人的开源模型先用官方数据和官方Demo跑通再动你自己的场景。上来就用自己的硬件、自己的任务出了问题你分不清是模型问题、数据问题还是适配问题排查成本极高。6.3 给不同角色的入局建议如果你是创业者关注Helix这类VLA模型的机会点不在于“再做一个通用VLA”而在于“用VLA解决某个垂直场景的完整方案”。比如仓储分拣、餐饮服务、家庭养老这些场景对“通用性”要求没那么极端但对某个具体环节的可靠性要求很高。基于Helix这类底座做场景化微调是成本相对可控的路径。如果你是算法工程师建议重点关注“动作表征”这个方向。Helix证明了大规模预训练VLA的可能性但目前的动作表征方式还很原始不同机器人的运动学结构差异也让模型难以跨本体迁移。谁能把动作表征和跨本体泛化问题解决好谁就能在下一波具身智能浪潮里占据身位。如果你是学生趁着Helix这种完整开源的项目出现踏踏实实把它啃透比追十个新概念都有用。能把“模型如何读图、如何听指令、如何出动作”这条链路讲清楚的人在任何做机器人的公司都是抢手货。面试聊具身智能能现场画出Helix双系统信息流图、说出Siamese微调的设计动机已经能超过绝大多数候选人了。最后分享一个我自己的体会做具身智能一定要多动手跑真机哪怕一开始跑出来的效果很蠢也没关系。模型在仿真里跑一百遍不如在真机上跑一遍学到的东西多——真机上有噪声、有延迟、有各种想象不到的环境变量这些东西才是推动技术往前走的最大动力。Helix把人形机器人带到这个位置真正的万里长征才刚刚开始后面每一个参与者都有机会。