ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

具身智能200亿估值背后:VLA模型与机器人“大脑”技术解析

具身智能200亿估值背后:VLA模型与机器人“大脑”技术解析 1. 从“讲故事”到“等上市称重”的估值逻辑如果你最近关注AI领域一定注意到了具身智能赛道的火热。一家名为“智平方”的公司在成立不久后就把估值推到了200亿人民币量级引发大量讨论。有人看到的是“又一个造富神话”有人看到的是“泡沫警报”但更多人其实只有一个朴素的疑问一家还没有大规模收入的公司凭什么值200亿这个问题的背后是整个一级市场投资逻辑的变化。过去几年互联网平台的估值逻辑是“流量变现”投的是用户增长。但到了具身智能赛道估值锚点变了变成了“技术壁垒团队背景赛道卡位”的组合。智平方的200亿不是拍脑袋定出来的而是这个赛道里“技术稀缺性”和“人才稀缺性”被资本重新定价的结果。更关键的是这200亿不是“终局”它只是“故事的阶段估值”真正的考验在泡沫散去之后——等它上市市场会用二级市场的审视标准重新“称重”。这篇文章不讨论荐股也不做投资建议而是从技术视角拆解三件事智平方这200亿的估值到底在为一个什么样的技术方向买单具身智能的“大脑”和传统机器人控制有什么本质区别如果我们是一名开发者想切入这个赛道应该从哪里开始又该警惕什么风险理解了这三件事你再回头看“等上市称重”这句话就会明白估值只是故事的入场券技术能不能落地、能不能形成商业闭环才是上市时真正要被检验的东西。2. 具身智能的“大脑”到底指什么——从“感知智能”到“行动智能”在展开智平方的技术分析之前必须先理清一个概念具身智能Embodied AI到底是什么以及它和人们熟悉的“大模型聊天机器人”有什么不同。2.1 一次本质的跨越从“上网”到“上手”很多人会把具身智能简单理解成“给机器人装一个大模型”。这种理解方向是对的但不完整。过去的AI比如图像识别、语音识别、大语言模型本质上解决的是“感知”和“语言理解”问题。它们学习的是语料、图像、音频这些“信息世界的符号”。但具身智能要解决的是“感知之后如何动作”的问题——机器人看到一杯水后应该以什么角度、什么力度、什么轨迹去抓取它。这种从“感知”到“行动”的跨越是范式级的。你可以这样理解传统大模型像是一个读过万卷书的“军师”它能告诉你“应该做什么”但它没有手无法亲自执行。而具身智能要训练的是一个“既能想、又能做”的“执行者”它必须在物理世界里理解因果、理解空间、理解物体的物理属性。2.2 VLA把“眼睛、大脑、手脚”联通起来的模型架构具身智能领域当前最核心的技术方向是VLAVision-Language-Action视觉-语言-动作模型。VLA模型把三种能力放进一个统一的神经网络里视觉能力理解摄像头看到的画面——物体在哪里、是什么形态、处于什么状态。语言能力理解人类指令——比如“把红色杯子放到左边的托盘里”。动作能力输出机器人的关节角度、末端执行器的轨迹和力控信号。在传统方案中这三个模块是割裂的。视觉模块负责识别规划模块负责路径规划控制模块负责执行每个模块由不同的团队、不同的算法栈完成模块之间通过接口通讯。一个环节出错整个链路就僵住了。而VLA的思路是用一个大模型把视觉特征直接映射到动作指令。它不显式地区分“识别”“规划”“控制”而是让模型学习一个从“看到什么”到“该怎么动”的直接映射。这就像你开车新手司机的操作是“看到前方有障碍物→大脑决定刹车→脚才去踩刹车”而老司机是“看到障碍物的瞬间脚已经在刹车上了”这是直觉级反映VLA追求的就是这种直觉级的动作生成能力。2.3 智平方的“大脑故事”只做大脑不做身体智平方最值得关注的一点是它的定位——它不是做机器人本体的公司而是做“物理世界AI的通用大脑”。这个定位非常像手机行业里的“安卓系统”和“高通芯片”的生态位我不管你是哪家手机品牌优必选、宇树、或者其他机器人公司你只要用我的“大脑”你的机器人就能具备感知、规划、决策和执行能力。这种“卖大脑”而非“卖身体”的商业模式决定了它不必去卷硬件成本和供应链整合而是把资源集中在算法、数据、训练和模型迭代上。从公开信息看智平方的核心团队兼具计算机视觉、自动驾驶和大模型背景其创始人郭彦东此前曾任职小鹏汽车自动驾驶副总裁、OPPO首席科学家这种“感知自动驾驶大模型”的复合背景本身就是资本为其200亿估值背书的重要依据。所以“200亿”买的不是一个机器人公司而是一个“通用机器人操作系统”的想象空间。如果这个“大脑”真的能跑通未来每一台机器人都有可能成为它的“终端”。3. 为什么200亿估值会落在具身智能赛道——技术拐点与资本逻辑理解了“大脑”的概念接下来要回答的第二个问题是为什么是现在为什么是具身智能这个赛道能拿到这么高的估值3.1 技术拐点大模型把“泛化”这个老难题往前推了一大步传统机器人技术发展了50年在工业场景中已经被验证得非常好比如汽车产线上的机械臂但它有一个致命痛点无法泛化。传统的机械臂只能执行“编程过”的动作。如果它在产线上只学会了“抓取A类零件”那么当零件换成B类或者光照条件变化或者零件摆放角度偏移整个系统就可能失灵。你需要重新编程、重新调参、重新部署。这就是为什么传统工业机器人的部署成本一直降不下来。大模型的出现在于它提供了一种“从数据中自主学习动作策略”的路径。通过海量的视觉-语言-动作配对数据模型可以学会一个泛化的动作策略——也就是说它见到“没见过的搭配”也能推理出该怎么做。这一点是资本愿意拿出200亿来下注的根源。它赌的不是今天的能力而是“泛化能力一旦突破机器人将从专用工具变成通用劳动力”这个终局。3.2 人才溢价团队背景决定资本的信心上限在硬科技投资领域早期项目看赛道中早期项目看团队已成共识。为什么资本愿意为一个几乎没有营收的公司给出200亿估值因为对于前沿科技创业公司来说团队本身就是最重要的“资产”。计算机视觉、自动驾驶、大模型这三个方向分别代表了“AI系统如何看懂世界”“AI系统如何在开放环境中做决策”“AI系统如何从海量数据中学习”。这三个能力的交集正是具身智能“大脑”所需要的能力组合。资本市场对具备这种复合背景团队的定价自然会远高于普通创业团队。但这里就要泼一盆冷水了团队背景解决的是“能做到”的概率问题而不是“一定做到”的确定性问题。从技术到产品、从产品到商业闭环中间隔着大量的工程化、市场化和供应链的沟壑。这也是“等上市称重”这句话里的另一层含义——一级市场可以为“人才故事”买单但二级市场的投资人更看重“营收和利润曲线”。3.3 赛道卡位先跑通“大脑”的公司能吃下最大红利无论最终哪家机器人本体厂商胜出都需要“大脑”来完成智能化的关键一步。如果一家公司能在“机器人大脑”这个通用层卡住位置它的商业想象力就不仅限于某一种机器人形态而是可以横跨人形机器人、机械臂、无人车、工业自动化设备等多个物理终端。这种“卖铲子”逻辑是智平方“200亿估值”在商业模型上被支撑起来的重要原因。它不赌某一家机器人厂商的胜负而是赌“所有机器人厂商都需要大脑”这个确定性趋势。4. 传统机器人控制方案 vs 大模型驱动方案——范式对比接下来我们从技术实操层面拆解一下传统方案和VLA大模型方案在落地实现上的差异。4.1 传统方案功能模块化靠程序员“手写逻辑”传统机器人控制方案的技术栈是这样的感知层摄像头/激光雷达 → 识别模块OpenCV/深度学习模型 → 规划层路径规划算法如RRT、A*→ 控制层PID、MPC→ 执行器机械臂/底盘→ 传感器反馈每个模块都是一套独立的算法工程模块之间的数据接口需要开发者手工设计。比如识别模块输出的是“物体类别坐标框”规划模块就要基于这个坐标框规划路径如果识别模块漏检了规划模块就不知道怎么做了。这种架构的优点是可控性强、可解释性强适合工业界稳定的生产环境。缺点是面对开放环境时非常脆弱所有规则都要人来预设泛化能力几乎为零。4.2 大模型方案端到端学习模型自己“悟”动作VLA方案的思路是多模态输入图像语言指令 → Transformer大模型 → 动作Token序列输出 | 动作Token解码 → 关节角度/末端轨迹这种端到端方案的优点是不需要人工设计模块间的接口。模型的表达能力更强能处理未见过的场景。训练数据足够多时能涌现出类似“常识”的物理理解能力。缺点是数据获取成本极高需要海量的“图像语言动作”三元组。模型训练耗电、耗卡成本高。端到端模型的可解释性差出问题时不容易定位是感知错了还是策略错了。安全性验证困难——在物理世界里一个错误决策的代价可能不是“回答错误”而是“设备损坏或人员伤害”。4.3 一个形象的类比传统方案“写剧本”大模型方案“即兴演员”传统机器人方案类似于“严格按剧本演出的演员”每一步都提前设计好除非出现剧本里写过的情节否则容易卡壳。大模型方案则像是“即兴演员”——它没有固定的台词但通过大量的“排练”训练数据它学会了“在什么情境下接什么话、做什么动作”的本能反应。面对没见过的场景它能根据既往经验“即兴发挥”。具身智能追求的就是这种“即兴发挥”的能力。对于“智平方们”来说挑战在于即兴演员偶尔也会胡言乱语而在物理世界里一次“胡言乱语”可能导致灾难性后果。5. 作为开发者可以从哪里切入这个赛道——三个实操视角如果你对具身智能这个方向感兴趣但觉得训练一个大模型离自己太远那可以从以下三个更落地的角度切入。下面我会给出三个可以直接运行的实操示例帮助你理解这套技术栈的运行逻辑。5.1 视角一模拟环境中的数据生成与策略验证训练VLA模型之前首先要解决数据问题。仿真环境如Isaac Gym、MuJoCo是低成本获取大规模训练数据的关键路径。下面是一个基于MuJoCo仿真环境的Python最小示例用来做机械臂的随机采样子任务。# 文件路径scripts/demo_mujoco_collect.py # 说明使用 MuJoCo 仿真环境随机采样机械臂关节角度收集状态-动作数据 # 注意需要提前安装 mujoco 和 mujoco-py 相关依赖版本请以官方文档为准 import numpy as np import mujoco # 加载机械臂模型这里以 MuJoCo 官方 humanoid 为例实际项目中替换为真实机械臂 XML 模型 MODEL_PATH humanoid.xml def load_model(model_path): 加载模型并返回 simulation 实例 model mujoco.MjModel.from_xml_path(model_path) sim mujoco.MjSim(model) return sim def random_policy_action(sim): 随机策略产生一组随机关节力矩作为动作数据 # 获取关节数量 nu sim.model.nu action np.random.uniform(low-1.0, high1.0, sizenu) return action def collect_steps(sim, steps100): 在仿真环境中执行随机策略收集状态与动作数据 states [] actions [] for _ in range(steps): # 记录当前状态关节角度 关节速度 state np.concatenate([sim.data.qpos, sim.data.qvel]) # 生成动作 action random_policy_action(sim) # 将动作施加到仿真环境中 sim.data.ctrl[:] action # 仿真前进一步 sim.step() # 保存结果 states.append(state) actions.append(action) return np.array(states), np.array(actions) if __name__ __main__: sim load_model(MODEL_PATH) states, actions collect_steps(sim, steps200) print(收集到的状态尺寸, states.shape) print(收集到的动作尺寸, actions.shape) # 在实际项目中这些数据会被保存为 .npz 或 TFRecord用于后续 VLA 模型的预训练这个示例的意义在于它演示了“数据从哪里来”。在真实项目中仿真引擎会配置多机并行配合不同场景、不同光照、不同物体位姿批量生成几十万条“状态-动作”轨迹数据作为VLA模型的预训练语料。5.2 视角二用大模型接口实现“语言→动作”的快速原型如果你想快速验证“语言指令如何变成动作”可以先用一个大语言模型的API将自然语言指令转换成结构化动作参数。下面是一个简化的原型示例。# 文件路径scripts/demo_lang_to_action.py # 说明演示用大模型 API 把自然语言指令转换成结构化动作参数 # 注意这是一个原型思路生产环境中需要使用专门训练的 VLA 模型或具身智能 API import json from openai import OpenAI # 初始化客户端密钥通过环境变量传入不要硬编码在代码中 client OpenAI() def parse_action_from_instruction(instruction: str) - dict: 将自然语言指令转换成结构化动作参数。 这里使用大模型 API 做信息抽取实际项目中可替换为部署好的具身智能模型服务。 system_prompt 你是一个机器人动作解析器。请把用户的自然语言指令转换为 JSON 结构JSON 包含 - target_object: 要操作的目标物体 - action: 动作类型pick/place/push/pour - destination: 目标放置点如果动作是 place 只输出 JSON不要输出其他内容。 response client.chat.completions.create( modelgpt-4o-mini, messages[ {role: system, content: system_prompt}, {role: user, content: instruction} ], temperature0.0 ) content response.choices[0].message.content return json.loads(content) if __name__ __main__: instruction 把桌子上的红色杯子放到左侧的托盘里 action_params parse_action_from_instruction(instruction) print(解析结果) print(json.dumps(action_params, ensure_asciiFalse, indent2))输出效果{ target_object: 红色杯子, action: place, destination: 左侧的托盘 }在VLA模型的完整架构里这一步相当于把“语言指令”编码成了一个结构化的任务描述后续的模型再负责把任务描述映射成具体的关节轨迹和夹爪动作。这个原型虽然简单但能帮助你理解“语言-动作映射”的第一步。5.3 视角三动作轨迹评估计算模型输出了动作轨迹怎么判断它好不好这里给出一个很基础的“到达率评估”计算脚本用于衡量模型预测的目标位置与实际物体位置之间的偏差。# 文件路径scripts/demo_goal_reach_metric.py # 说明计算模型输出的动作轨迹是否成功到达目标位置 # 用于评估 VLA 模型在“抓取/放置”任务上的成功率 import numpy as np def compute_goal_reach_rate(predicted_positions, target_positions, threshold0.03): 计算目标到达率。 参数 predicted_positions: 模型预测的末端执行器位置序列形状 (N, 3) target_positions: 每个轨迹对应的目标物体位置形状 (N, 3) threshold: 判定“到达”的距离阈值单位米 返回 到达率0~1 assert len(predicted_positions) len(target_positions), 轨迹数量必须相等 distances np.linalg.norm(predicted_positions - target_positions, axis1) success_count np.sum(distances threshold) return success_count / len(distances) if __name__ __main__: # 模拟 100 条预测轨迹的末端位置 rng np.random.default_rng(42) predicted rng.normal(size(100, 3)) * 0.02 # 预测位置误差在 2cm 左右 target np.zeros((100, 3)) rate compute_goal_reach_rate(predicted, target, threshold0.03) print(f目标到达率{rate * 100:.2f}%)在实际评估中还会加入更复杂的指标比如“抓取成功率”“任务完成率”“平均动作长度”“碰撞率”等。这些指标的核心目标只有一个量化模型的“大脑”到底有没有真正理解物理世界。6. 商业化的三个门槛——数据、成本与安全讲完技术栈我们再回到智平方这类公司的商业化路径上。即使“大脑”的技术方向是对的商业化道路上依然有三个硬门槛。6.1 数据飞轮门槛大模型训练的前提是海量数据。对于具身智能来说“抓取动作数据”远比“文本数据”难获取得多。文本数据可以爬虫获取但“一个机械臂怎么抓一个杯子”的数据目前只能靠仿真生成或真机采集。仿真数据存在“仿真到现实”的差距真机采集则慢且贵。所以每一家具身智能公司都在拼命搭建“数据飞轮”仿真生成一批预训练数据 → 真机部署后采集实际使用数据 → 用实际数据微调模型 → 模型能力增强后部署更多场景 → 收集更多数据。这个飞轮能不能转起来、转得多快直接决定公司的技术迭代速度。这也是资本愿意为早期技术公司给出高估值的原因因为它押注的是飞轮转起来后的指数级增长。6.2 单台成本门槛具身智能的“大脑”要落地到终端必须考虑算力成本。目前VLA模型的推理对算力要求很高如果每台机器人需要携带一台高功耗的GPU服务器那成本将高到完全不具备商业价值。行业目前的方向是端侧推理优化量化、蒸馏以及边缘计算配合云端推理。如果“大脑”的推理成本降不下来机器人厂商就算想用也用不起。6.3 安全门槛这是最容易被忽视的。在物理世界里AI的一个错误决策可能造成人身伤害或财产损失因此安全验证是任何具身智能产品进入市场前必须过的关卡。传统工业机器人可以依靠“围栏急停”来做安全保障但面向开放环境的服务机器人、“大脑”控制的机械臂如果没有可靠的安全机制是无法合法部署的。所以在实际的工程落地中具身智能公司不会把“端到端VLA模型”直接裸露在物理世界中运行而是会叠一层安全护栏先用VLA模型生成“意图轨迹”再由传统的控制模块做轨道校验和约束修正。这种“大模型做决策、传统算法做安全校验”的混合架构在短期内是更稳妥的工程方案。7. “称重”标准二级市场会怎么看这家公司回到标题的核心词“等上市称重”。一级市场的投资逻辑和二级市场的定价逻辑有着本质的不同。一级市场看重“故事赛道团队”可以承受“今天不盈利五年后爆发”的时间成本。但二级市场的投资人更看重“可验证的业绩曲线”营收增速、毛利率、客户构成、复购率、技术壁垒的变现能力。一个值得注意的问题是200亿估值并不意味着未来市值一定等于200亿。估值是“一级市场投资者觉得它值多少”的报价但上市时二级市场的定价会重新计算甚至可能低于一级市场估值。这种现象在科技行业并不罕见因为一级市场的估值依赖于“私募市场的流动性溢价”而二级市场要面对的是“任何一个机构投资者都可以随时卖出”的流动性折价。所以“等上市称重”这句话背后潜藏着三重压力技术压力通用“大脑”能否在几年内达到可靠的商业化水平。商业化压力收入从哪里来是卖模型授权、卖整体解决方案还是按调用量收费利润压力能否在覆盖算力、数据采集、研发团队等巨大开销后实现正的毛利。这三重压力才是“称重”真正要检验的东西。从技术观察的角度来看当前更理性的判断是具身智能这个赛道正处于“技术潜力和商业落地之间的鸿沟”上谁先跨过鸿沟谁就能在上市后获得市场的乐观定价谁迟迟跨不过去谁就可能面临估值重塑。8. 对开发者的机会现在进场能做什么也许你会觉得“智平方们”的起落和自己关系不大。但实际上具身智能的行业红利正在向开发者层面渗透。如果你是一名AI工程师以下方向值得关注具身智能数据工程仿真环境搭建、数据采集管线、数据清洗与标注。这个方向的需求很刚性因为所有具身智能公司都缺高质量数据。VLA模型微调与适配基于开源VLA模型做下游场景适配。目前已有一些开源项目比如斯坦福的ACT、Google的RT系列开源模型社区也在快速迭代。仿真到现实的迁移工程解决仿真训练策略迁移到真实机器人上的失真问题。这是从论文到产品之间最难的工程环节之一。具身智能评测体系开发更科学、更全面的评测基准任务和指标。当前行业对“标准评测基准”的需求非常迫切因为各家模型的能力差异缺乏客观参照。如果你是一名刚刚入门的大学生或初级开发者建议从传统的机器人控制ROS、MoveIt、PID控制学起再逐步过渡到小模型的动作策略训练。具身智能是“AI自动化”的交叉学科不懂底层控制原理很难把“大脑”的能力真正落到物理世界的执行上。如果条件允许可以买一台性价比较高的桌面级机械臂如UFACTORY、SO-ARM100等开源硬件配合仿真环境做数据采集和策略训练实验。花小几千元就能获得一套“感知-决策-执行”的完整闭环体验这笔投入对于理解具身智能的复杂度是很值得的。下表总结了三个技术方向对开发者经验的要求方向核心技能入门难度就业前景数据工程Python、仿真引擎、数据管线低需求巨大VLA模型研发PyTorch、Transformer、多模态高竞争激烈但回报高机器人系统集成ROS、嵌入式、控制算法中稳定增长9. 总结与后续关注方向围绕智平方的200亿估值我们真正讨论的是具身智能这个技术方向所处的发展阶段以及它从“技术叙事”走向“商业落地”需要跨越的障碍。这次分析之后有三点对开发者很有价值第一具身智能是一个真实的长期趋势不是短期概念炒作。大模型的泛化能力为机器人行业带来的变化是结构性的即使某一家的估值回落技术方向本身也不会逆转。第二这个行业当前的核心矛盾已经从“模型能力不够”转向“数据不够干净”“成本不够低”“安全不够可靠”。对于开发者而言这三个问题背后都是巨大的工程机会。第三对于充满叙事感的行业新闻保持“看技术多于看估值”的习惯会有帮助。200亿是一个数字但它的底层是技术、工程、产品和商业的复合博弈。后续如果你对这个方向感兴趣可以从以下三个资源开始动手阅读开源的VLA模型论文和代码例如RT-1、RT-2、OpenVLA理解其网络结构。在MuJoCo或Isaac Gym中搭建一个简单的“抓取-放置”仿真环境跑通“数据采集→模型训练→评估”的最小闭环。关注具身智能领域的人才需求方向选择其中匹配自己现有技能的切入点先动手做一个小的项目。技术的终局从来不是靠估值讲故事讲出来的而是靠一行行代码、一次次真机实验、一个个落地订单堆出来的。智平方的故事还在继续真正的称重时刻在它上市那天才会到来。而作为开发者我们能做的就是保持技术敏感度在看热闹的同时看清楚门道。建议收藏这篇文章后续你看具身智能相关新闻时可以回来对照这篇的分析框架看看市场走到了哪一步。
返回列表