
8 月下旬北京亦庄的展馆里最忙的不是观众而是工程师。一台人形机器人在展台前搬箱子动作不快。它先停顿了一下像是在确认箱子的位置然后伸手、夹住、抬起走了几步又放下。围观的人举着手机拍。旁边的工作人员盯着它的脚随时准备上前扶一把。过去几年人形机器人展会最常见的画面是挥手、跳舞、比心或者在一段提前规划好的路线里走完几十米。那更像消费电子发布会灯光、音乐、口号和剪辑过的视频。今年 8 月北京的机器人展会和人形机器人运动会仍然有这些东西但台下的人已经没有那么容易被打动了。他们更关心机器人摔没摔、卡没卡、能不能重复做第二遍。一个投资人说他现在看机器人公司已经不太问“你们的大模型有多强”而是问“你们一天能跑几个小时”。这可能是 2026 年具身智能行业最大的变化它还没有真正成熟但它开始被用产品的标准而不是科幻的标准来审视。2026 世界机器人大会在 8 月于北京举行。大会官网介绍今年博览会关注应用场景、前沿技术、关键零部件、新品首发和国际合作参展范围覆盖人形机器人、工业机器人、服务机器人、特种机器人和核心零部件。几乎同一时间第二届世界人形机器人运动会也在北京举办。官网显示赛事于 8 月 22 日至 26 日举行参赛机器人要完成跑步、足球、格斗、接力等项目。外界容易把机器人运动会理解成一次大型表演。但对行业里的人来说它更像一次公开压力测试。跑步考验下肢控制足球考验感知和决策接力考验稳定性格斗考验抗冲击和恢复能力。比赛场地不一定复杂但只要不是完全可控环境机器人就会暴露问题。人形机器人行业过去几年有一种特殊的传播方式公司发布一段视频机器人在视频里完成跑步、跳跃、搬运或做家务几天内这段视频在社交媒体上传播投资人、媒体和潜在客户开始询问公司进展。视频让行业变热也让行业变得可疑。因为看不见失败次数。到了 2026 年这件事开始变得不够用了。机器人公司需要回答更难的问题机器人能不能从展台走向工厂能不能长时间运行能不能在不同光线、地面、货架和人员干扰下完成任务如果坏了是工程师远程调参还是普通运维人员就能处理一位华东地区机器人创业公司负责人说过去他们最怕投资人问技术路线现在最怕客户问售后。这不是坏事。它说明机器人终于离开了发布会。人形机器人从“上场”到“进厂”是今年 8 月最明显的行业叙事。《经济参考报》8 月 21 日报道人形机器人正在从“上场”走向“进厂”资本继续押注产业化。报道引用天眼查公开披露融资事件统计称今年以来国内机器人相关企业发生超过 230 起融资事件同比增长 28.8%。“进厂”听起来比“上场”朴素但门槛更高。舞台允许机器人失败。工厂不允许。在展会上一台机器人慢半拍观众会觉得可爱在产线上慢半拍意味着节拍错位。展会上机器人摔倒现场可以鼓掌工厂里机器人摔倒可能会造成停线、损坏设备甚至带来安全事故。这也是为什么很多机器人公司开始主动降低叙事的高度。过去它们说自己要做“通用人形机器人”现在更常说的是巡检、搬运、分拣、上下料、仓储、汽车工厂、3C 产线。目标变小了事情反而更真实。一个制造业客户不会为“像人一样”付钱。他只会为稳定性、效率和成本付钱。如果一个固定机械臂能完成任务客户没有理由买一台更贵、更复杂、更难维护的人形机器人。人形机器人的机会只会出现在那些传统自动化设备覆盖不好、环境变化又比较大的场景里。这类场景通常不浪漫。夜间巡检、危险环境操作、仓库搬运、柔性制造、设备维护工作重复、辛苦有时还脏。但机器人商业化最早可能就从这些地方开始。两个变化放在一起看行业已经过了只靠故事融资的阶段。2024 年投资人追问的是“你们是不是中国版 Figure”。2025 年大家开始讨论“谁能做出中国版 Optimus”。到了 2026 年问题变成了“你们今年能交多少台毛利率多少客户续单吗”。问题变得难听也变得正常。人形机器人是一种资本密集型生意。它不像一个 App几个人写几个月代码就能上线也不像大模型应用先接 API 再找场景。机器人公司要同时处理硬件设计、供应链、控制算法、数据采集、整机制造、现场部署和售后服务。一台机器人背后不只是一个“大脑”还有关节模组、减速器、电机、传感器、电池、灵巧手、控制器、仿真系统和安全系统。任何一个环节出问题最终都会表现为机器人“不好用”。所以今年资本开始看产业链是一个自然结果。整机公司最容易被看见但未必最先赚钱。关节模组、灵巧手、伺服系统、力控传感器、仿真平台、遥操作数据平台都可能先出现稳定收入。新能源汽车产业曾经发生过类似的事。最初最受关注的是整车品牌后来电池、电机、电控、智能驾驶芯片和供应链公司逐渐获得定价权。机器人行业也可能经历这个过程。人形机器人是入口不一定是全部。北京人形机器人创新中心在这次大会期间发布了两个产品大一统具身智能模型 Pelican-Unify 和轻量化人形机器人天工 Omni。公开信息见北京人形登陆 2026 世界机器人大会发布 Pelican-Unify 与天工 Omni。这类发布的关键词已经不只是“机器人本体”而是“模型”和“本体”的一体化。过去机器人行业有很多分层视觉负责识别语言模型负责理解规划模块负责拆解任务控制系统负责执行。每一层都能优化但接在一起之后经常会出现误差累积。比如一个机器人听懂了“把桌上的杯子拿过来”但它识别错杯子的位置或者识别对了却无法判断杯子是否装了水判断对了手指力度又不合适力度合适走路时又晃了一下。人类觉得简单的动作机器需要拆成很多步骤每一步都可能失败。这也是具身智能和普通人工智能最大的区别。大语言模型说错一句话可以再生成一次机器人抓错一个杯子可能会把杯子摔碎。软件错误通常停留在屏幕里机器人错误会进入物理世界。所以 2026 年行业真正关注的不是机器人会不会聊天而是它能不能把“看见、理解、行动、反馈”连成一个稳定闭环。这也是 VLA 模型、世界模型、模仿学习、强化学习、遥操作数据和仿真平台持续升温的原因。VLA 是 Vision-Language-Action也就是视觉、语言、动作模型。它试图让机器人不再只是“看见物体”和“理解指令”而是直接学会“该怎么做”。世界模型则希望机器人在行动之前能对物理世界有基本预判箱子有多重门会怎么开杯子会不会倒地面会不会滑。这些词听起来像论文标题但落到商业上只有一个意义减少失败次数。海外公司把这件事称为 Physical AI。NVIDIA 在今年 3 月发布的资料中说它正和全球机器人企业一起推动 Physical AI 进入真实世界覆盖工厂、人形机器人、边缘 AI 和仿真训练等方向.MarketsandMarkets 7 月发布的市场趋势文章预计embodied AI 市场规模将从 2025 年的 44.4 亿美元增长至 2030 年的 230.6 亿美元。海外的路线和中国不完全一样。美国公司更强调平台。NVIDIA 提供算力、仿真、训练和部署工具Tesla 的 Optimus 依托汽车制造体系和自动驾驶数据经验Figure、Agility Robotics 等公司则围绕通用机器人或仓储场景推进。中国公司更强调速度、供应链和场景。北京、上海、深圳、杭州、苏州等地都在布局具身智能产业集群地方政府、产业基金、制造企业和创业公司同时入场。这两种路线各有优势。美国更擅长底层平台和开发生态中国更擅长供应链组织、工程迭代和成本控制。机器人行业最终需要两者同时成立模型要足够强硬件要足够便宜场景要足够真实。缺任何一个都只能停留在演示阶段。不过具身智能离真正爆发还有很长距离。最难的是数据。大语言模型有互联网文本图像模型有海量图片和视频但机器人没有一个现成的“互联网”。机器人学习一个动作需要真实世界里的交互数据。它要知道手碰到物体时的力物体移动时的变化不同材质、重量、光线和空间布局带来的影响。这些数据很贵。一条文本可以复制无数次一个动作数据却要在物理世界里采集。遥操作、仿真、合成数据都能缓解问题但还不能完全替代真实场景。第二个难题是泛化。机器人在实验室能拿起杯子不代表它在家庭厨房里也能拿起杯子。现实环境里有水渍、遮挡、杂物、反光、不同高度的桌面还有人类临时改变主意。一个看起来简单的任务会迅速变成复杂系统问题。第三个难题是成本。如果一台人形机器人售价几十万元甚至上百万元它就必须替代足够高价值的劳动。否则客户会继续选择更便宜、更成熟的自动化设备。第四个难题是安全。机器人进入工厂还只是开始。未来如果进入医院、养老院、学校、商场和家庭它要面对的不是单纯技术问题还有监管、责任和伦理问题。一个机器人撞到设备和撞到老人是完全不同的事故。这些问题会让具身智能的商业化比大模型慢得多。它不会像一个软件产品那样一夜增长。它更像新能源汽车、半导体或工业软件周期长、投入重、回报慢中间会死掉很多公司。但行业也确实已经过了最虚的阶段。8 月的北京展馆里机器人仍然不完美。它们动作慢反应有延迟很多任务还需要工作人员在旁边看着。一些公司展示的能力离真实客户使用还有距离。社交媒体上的热闹也会放大行业短期进展。但和两年前相比变化已经发生。机器人公司不再只讲“未来家庭里每个人都有一个机器人”。它们开始讲工厂、仓库、巡检和交付。投资人不再只问创始人背景和技术路线也开始看订单、成本和产能。客户不再只看演示视频而是要求试点、驻场和售后。这意味着行业进入了一个不那么兴奋、但更重要的阶段。从前人形机器人像一个答案AI 需要身体。现在它更像一个问题什么样的身体能在真实世界里工作答案不会在一场大会里出现也不会由某一家公司单独给出。它会出现在一个个枯燥的场景里机器人在夜里巡检一次没有报警在仓库里连续搬了几百个箱子在工厂里稳定上下料一整周在摔倒后自己站起来在工程师不在旁边时仍然完成任务。这些瞬间不会像发布会视频那样传播得很快但它们才是机器人行业真正的里程碑。2026 年 8 月具身智能最重要的事不是机器人更像人了。而是它终于开始被当作一种机器来要求。这比像人更难也更接近生意。