ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

399美元开源双足机器人Microduck:用强化学习训练步态

399美元开源双足机器人Microduck:用强化学习训练步态 当“399 美元”和“开源双足机器人”出现在同一句话里时大部分人的第一反应是怀疑。过去几年里开源机器人项目并不少见但双足机器人一直是个例外硬件结构复杂、电机成本高、控制算法难、调试周期长个人开发者想碰这个领域要么进实验室要么准备五位数以上的预算。Hugging Face 推出的 Microduck 改变的不是“双足机器人”本身而是把“开源硬件 强化学习训练步态”这条完整链路压缩到了个人开发者可以承受的价格区间。这个项目真正的看点不在于它走得有多稳而在于它把一套能够验证强化学习算法的闭环系统变成了一个可以买回家、跑起来、看得见效果的开发平台。这篇文章会从实际问题出发拆解 Microduck 为什么值得关注梳理双足步态控制和强化学习的基本概念然后重点说明如果开发者想在这个平台上训练自己的步态策略应该怎么准备环境、设计奖励、训练模型、评估效果以及真机部署时最容易踩哪些坑。读完之后你应该能判断这个项目适不适合自己也知道从哪里下手。1. 为什么 Microduck 值得关注它降低了哪一类成本先给出一个明确判断Microduck 的核心价值不在硬件性能而在“实验成本”。在机器人强化学习领域最贵的从来不是算法而是实验平台。仿真环境可以免费跑但仿真和真机之间存在巨大的差异真机实验又需要硬件、调试环境和安全防护。过去想验证一个步态强化学习算法通常要经历这样的痛苦流程在仿真环境里训练策略效果看起来很好想办法把策略部署到真机发现根本走不起来排查原因是电机响应不够快还是模型过拟合了仿真参数还是观测数据噪声太大调参、重新训练、再试。这个过程的时间和资金成本远超大多数个人开发者的承受范围。Microduck 的意义在于它提供了一个相对标准化的开源双足平台让研究者可以在一个可复现、可修改的硬件基础上做实验。399 美元的定价对照双足机器人领域常见的高门槛确实是一个非常有竞争力的切入点。还有一个容易被低估的点Hugging Face 做这个项目的优势不是硬件设计而是模型生态。Hugging Face 在开源模型、数据集和模型部署工具链上的积累可以让机器人策略模型的分发、版本管理和复现变得和分享一个 NLP 模型一样自然。这意味着未来 Microduck 用户可能不只是自己训练还可以直接下载社区里别人训练好的步态模型先跑通再改进。不过也要提醒一句Microduck 并不适合所有人。如果你完全不懂 Python、没有接触过强化学习也不想折腾仿真环境那它可能会让你失望。它不是开箱即用的玩具而是一个需要代码能力、控制理论基础和耐心的开发平台。更适合的人群是正在学习强化学习想找一个低成本真机验证平台的开发者研究 Sim2Real、机器人控制的研究生或工程师喜欢开源硬件生态愿意动手改机械结构和算法实现的爱好者想在教学场景里展示“训练到部署”完整流程的教师。如果你的目标是快速得到一个能稳定走路的成品机器人而不是参与训练和调试过程那购买一台消费级成品机器人可能更省心。2. 双足机器人的难点为什么“走路”这么难很多人觉得走路是人类与生俱来的技能但对于机器人来说双足行走是控制领域最经典也最困难的问题之一。理解这一点才能明白 Microduck 用强化学习训练步态的意义。2.1 双足行走的本质是不稳定平衡单脚支撑时机器人本质上就是一个倒立摆。想象一下你用手指直立一根扫帚你需要不断观察扫帚倾斜的方向然后快速移动手去补偿。双足机器人走路时每一步都处于这种不稳定状态控制器必须实时计算质心的位置、速度、角动量然后决定关节输出多少力矩。传统控制方法通常依赖动力学建模和 ZMP零力矩点理论通过精确计算支撑多边形内质心位置来保证稳定性。但这种方法对模型精度要求高运算复杂而且遇到不平整地面、外部扰动时很难做到像人一样自然适应。2.2 强化学习如何解决这个问题强化学习的思路和传统控制方法完全不同。它不是先建精确模型再设计控制器而是让智能体在一个环境里反复试错通过奖励信号学习出最优策略。用骑自行车做类比传统控制方法会先测量车身倾角、速度建立动力学方程然后算出应该转多大角度把车稳住强化学习则是让你在空旷场地上不断尝试骑摔倒后调整最终你的肌肉记忆学会了一系列动作。起步时可能会摔得很惨但练习足够多之后策略会变得非常鲁棒。在双足机器人上强化学习也是这样工作的定义状态比如关节角度、角速度、机身姿态、定义动作关节的目标位置或力矩、定义奖励走得远、走得稳、姿态自然等然后让策略网络反复与环境交互通过梯度更新不断优化步态。2.3 Sim2Real仿真到真机的鸿沟这里必须解释一个关键概念Sim2Real。大多数强化学习训练不会直接在真机上跑因为真机训练成本太高而且随机探索阶段很容易损坏硬件。通常的做法是在仿真环境里训练然后把策略迁移到真机。但仿真环境再精细也永远无法完全复现真机的物理特性。电机延迟、摩擦力、装配误差、传感器噪声这些差异会导致仿真里走得很好一到真机就摔。如何缩小这个差距是整个领域最核心的研究问题之一。Microduck 这类开源平台的价值就在于此它给了开发者一个统一的研究对象。仿真模型、硬件设计、训练代码都开源研究者可以针对同一款机器人对比不同算法的效果而不必像以前那样每个人都造一套自己的实验装置结果无法对比、无法复现。3. Microduck 与 Hugging Face 生态的定位要理解 Microduck 为什么值得关注不能只看硬件还要看它背后的生态。Hugging Face 已经成为开源 AI 模型的中心枢纽从大语言模型到视觉模型再到音视频模型开发者已经习惯在这里搜索模型、下载权重、查看数据集。从已经公开的信息来看Microduck 与 Hugging Face 机器人开源生态的关系可以这样理解它标志着 Hugging Face 试图把“模型仓库”的经验复制到机器人领域。机器人策略模型和语言模型一样都涉及训练、版本管理、分发、复现和部署的完整生命周期。Hugging Face 已经在另一个机器人项目中奠定了相关基础比如开源的机器人学习库 LeRobot 就是面向真实机器人操作任务的项目。从该生态的资产组合来看Microduck 大概率会沿袭同样的思路公开硬件设计、训练代码、仿真环境和预训练模型权重让社区可以在同一个起点上迭代。这意味着什么一个非常实际的场景是以前你想复现一篇双足机器人的论文可能需要发邮件向作者要代码和硬件参数还不一定得到回复。而在 Microduck 这条路上你只需要拉取仓库、下载模型权重、烧录固件就能在统一的软硬件环境下复现和对比实验结果。对于开源项目和学术研究来说这种可复现性价值极高。但也要注意一个边界Microduck 目前应该还处于早期阶段社区生态成熟度、文档完善度、硬件稳定性都需要时间验证。从定位来看它更适合作为研究入门平台而不是生产级应用设备。这一点在学习和选型时需要想清楚。4. 训练步态前的环境准备与前置条件如果你决定上手 Microduck那么首先要搞清楚训练一条步态策略需要哪些环境。这里把准备工作分成硬件、软件和知识三个层面。4.1 硬件准备Microduck 作为开源双足机器人硬件清单一般会包括机身结构件、舵机或电机、驱动器、主控板、惯性测量单元 IMU、电源模块等。具体型号和组装方式以官方仓库发布的物料清单为准。这里想提醒的是双足机器人的电机选型非常关键。双足行走过程中关节需要承受很大的瞬时冲击电机扭矩不够会出现“站着抖、走路摔”的现象扭矩太大则可能因为电机过重和响应问题带来新的不稳定性。在硬件上真正影响强化学习效果的是通信频率和延迟。如果电机通信频率太低策略输出的动作指令无法被及时执行训练效果会大打折扣。所以拿到硬件后建议先做一轮基础测试检查每路电机的响应延迟、角度反馈精度、IMU 姿态数据稳定性。4.2 软件环境从软件角度看训练步态强化的典型技术栈包括技术环节常用工具作用仿真环境MuJoCo、Isaac Gym、PyBullet提供物理仿真环境加速训练强化学习框架Stable-Baselines3、RLlib、自定义 PyTorch 代码实现 PPO 等算法深度学习框架PyTorch搭建策略网络训练监控TensorBoard、Weights Biases观察奖励曲线和训练状态硬件驱动/部署官方 SDK、ROS 2可选连接主控板发送动作指令由于不同项目的依赖差异较大这里不建议把版本号写死。以 Python 环境为例建议使用 Python 3.10 以上并优先用 conda 创建独立环境避免不同项目之间的依赖冲突。Microduck 大概率与 LeRobot 同属一个生态如果官方后续公开了仿真环境训练代码通常会直接兼容。在官方资料不完全透明的情况下更稳妥的策略是先安装 PyTorch 和一个主流强化学习框架跑通一个简单的双足仿真示例再接入 Microduck 的仿真模型。4.3 知识准备知识门槛上强化学习初学者最好先理解以下几个概念状态State策略网络输入什么。双足机器人通常是关节角度、关节角速度、机身俯仰/翻滚角、上一时刻的动作等。动作Action策略网络输出什么。常见的是关节的目标角度、目标力矩或归一化动作。奖励Reward如何评价动作好还是坏。这是整个训练中最影响结果的部分。策略Policy一个神经网络模型输入状态输出动作。回合Episode从初始状态走到终止状态的完整过程。如果第一次接触这些概念建议先用 Gymnasium 里最简单的连续控制任务例如倒立摆跑通一遍 PPO再回到机器人步态任务上来。直接上手双足步态强化学习很容易在环境配置和奖励设计里绕不出来。5. 步态强化学习的核心流程拆解有了环境和背景知识下面看训练步态策略的完整流程。整个流程可以分为六个阶段每一步都有容易出问题的地方。5.1 阶段一构建仿真环境训练双足机器人步态第一步不是直接调真机而是在仿真环境里建立机器人的物理模型。仿真环境需要提供机器人的质量、惯性、关节自由度、电机力矩限制、地面摩擦力、接触模型等信息。这一步的关键在于“模型保真度”。仿真模型和真实硬件的参数差异越小后续 Sim2Real 迁移就越顺利。实际操作中开发者需要做系统辨识也就是测量真机每个关节的实际角度范围、电机空载转速、堵转力矩等参数然后回填到仿真模型里。5.2 阶段二定义观测空间和动作空间观测空间是策略网络的输入。对于双足机器人常见观测包括所有关节的角度和角速度IMU 测得的机身姿态角和角速度上一时刻的动作可选机身目标速度、目标方向等任务信息。动作空间的选择直接决定了训练难度。如果输出的是关节目标角度那么控制频率可以低一些策略更稳定如果输出的是关节力矩控制更精细但训练难度更大容易震荡。从 Material 来看Microduck 这类入门级平台更适合先用目标角度作为动作空间降低训练难度。5.3 阶段三设计奖励函数这是整个强化学习训练里最容易被低估的环节。奖励函数直接决定了策略网络会“学到什么”。双足步态的奖励设计通常组合多个维度前进速度奖励鼓励机器人向目标方向移动生存奖励还没摔倒就奖励一个正的小值姿态奖励机身保持直立姿态角偏差小时给正奖励能量惩罚关节力矩或加速度过大时给惩罚让步态更自然动作平滑惩罚前后时刻动作变化过大时给惩罚避免抖动。这里最容易踩坑的“强化学习遇到错误奖励”问题奖励设计不合理时网络可能会学到非常诡异但奖励最高的行为比如原地打转、快速抖动、躺在地上“滑行”等。验证奖励函数是否合理需要在训练过程中持续观察行为而不只是看奖励数值在涨。5.4 阶段四训练策略网络训练过程中最常用的算法是 PPOProximal Policy Optimization。PPO 的核心思想是每次更新策略时限制更新幅度避免策略在单次更新中变化过大导致不稳定。训练时需要注意几个超参数学习率太高会导致训练发散太低会收敛缓慢批大小影响梯度估计的稳定性每回合最大步数影响训练速度和探索效率熵系数控制探索程度太高策略随机性过大太低容易陷入局部最优。5.5 阶段五仿真验证与策略分析训练结束后要把策略在仿真环境里跑很多次确认它的鲁棒性。可以直接观察平均累计奖励是否稳定机器人能否走完全程遇到随机扰动时是否还能恢复稳定。一个好的步态策略应该具备一定的扰动恢复能力而不是只在“理想条件”下能走。5.6 阶段六真机部署与 Sim2Real仿真验证通过后把策略导出部署到真机控制板上。这一步通常需要处理将训练时用的观测值换算成真机读取的物理量将策略输出的动作映射到电机控制协议设置控制频率和超时保护。从仿真到真机第一次实验最危险。建议先用绳索或支架吊住机器人让它在安全范围内试走确认基本运动逻辑没有问题再进行自由行走测试。6. 完整示例一个最小步态训练与部署框架这里用一个最小化的示例展示整个流程的代码结构。因为 Microduck 官方训练代码细节可能还在更新下面的示例以通用的 PPO 训练流程为框架重点是展示代码组织方式和关键逻辑。6.1 创建虚拟环境并安装基础依赖# 文件路径setup.sh conda create -n microduck python3.10 -y conda activate microduck # 安装深度学习框架以 CUDA 版 PyTorch 为例版本请按官方文档选择 pip install torch # 安装强化学习环境和算法库 pip install gymnasium pip install stable-baselines3 # 如果使用 MuJoCo 仿真具体包名以官方文档为准 pip install mujoco# 验证安装成功 python -c import torch, gymnasium, stable_baselines3; print(OK)6.2 定义双足步态环境实际的 Microduck 仿真环境应该是官方提供或社区封装的 Gymnasium 环境。在官方环境发布之前你可以先用一个简化版环境理解接口逻辑# 文件路径microduck_env.py 一个展示了双足步态 RL 环境接口的最小示例非 Microduck 官方环境。 import gymnasium as gym from gymnasium import spaces import numpy as np class MicroduckStandEnv(gym.Env): 简化版站立/步态环境。 真实环境中状态来自 MuJoCo 等仿真器 这里用随机数据模拟接口便于理解训练流程。 metadata {render_modes: []} def __init__(self): super().__init__() # 假设机器人有 6 个关节每个关节有角度和角速度 self.observation_space spaces.Box( low-np.inf, highnp.inf, shape(12,), dtypenp.float32 ) # 动作空间6 个关节的目标角度 self.action_space spaces.Box( low-1.0, high1.0, shape(6,), dtypenp.float32 ) self.state None def reset(self, seedNone, optionsNone): super().reset(seedseed) self.state np.zeros(12, dtypenp.float32) return self.state, {} def step(self, action): # 真实环境需要调用仿真器计算下一状态和奖励 # 这里用随机状态演示接口 noise self.np_random.normal(0, 0.01, sizeself.state.shape) self.state self.state noise reward float(-np.sum(np.square(action))) # 惩罚大动作 terminated False truncated False return self.state.copy(), reward, terminated, truncated, {} def render(self): pass这里的关键是理解 Gymnasium 环境接口reset()返回初始状态step()接收动作返回下一状态、奖励、是否结束等信息强化学习算法的训练循环完全依赖这个统一接口。6.3 使用 PPO 训练步态策略# 文件路径train_microduck.py 使用 PPO 在双足步态环境上训练策略的示例代码。 from stable_baselines3 import PPO from microduck_env import MicroduckStandEnv def train(): # 创建环境 env MicroduckStandEnv() # 创建 PPO 模型 model PPO( MlpPolicy, env, learning_rate3e-4, batch_size256, n_epochs10, gamma0.99, gae_lambda0.95, clip_range0.2, ent_coef0.005, verbose1, tensorboard_log./tb_logs/, ) # 训练 100000 步 model.learn(total_timesteps100_000) model.save(microduck_stand_policy.zip) if __name__ __main__: train()需要说明的是这个示例使用了 Stable-Baselines3 的高层接口适合快速把流程跑通。如果你需要更精细地控制训练过程比如加入 domain randomization、自定义奖励函数建议直接用 PyTorch 编写训练循环。6.4 设计奖励函数奖励函数是整个训练的核心。实际项目中可以把步态奖励拆成多个子项并分配权重# 文件路径reward.py 步态奖励函数设计与权重配置示例。 import numpy as np def compute_reward( forward_velocity: float, pitch_angle: float, joint_torques: np.ndarray, action_delta: np.ndarray, alive: bool, ) - float: 综合奖励函数鼓励前进、保持直立、减少能耗和动作抖动。 # 前进速度奖励单位m/s reward_velocity 1.0 * max(forward_velocity, 0.0) # 姿态奖励机身俯仰角接近 0 时奖励最大 reward_pitch 0.5 * np.exp(-(pitch_angle ** 2) / (2 * 0.02 ** 2)) # 能量惩罚关节力矩平方和 reward_energy -0.01 * np.sum(np.square(joint_torques)) # 动作平滑惩罚相邻时刻动作变化大则惩罚 reward_smooth -0.05 * np.sum(np.square(action_delta)) # 存活奖励 reward_alive 1.0 if alive else -10.0 total ( reward_velocity reward_pitch reward_energy reward_smooth reward_alive ) return float(total)奖励设计的一个经验法则是先加少量核心奖励项训练观察行为发现行为“走偏”再逐步加辅助奖励项修正。一次加太多奖励项很难判断是那一项导致的问题。6.5 真机部署的策略推理代码策略训练完成后部署到真机时通常会把 PyTorch 模型转为轻量级推理格式。这里展示的是部署时的核心逻辑# 文件路径deploy_microduck.py 真机部署时加载策略并控制机器人关节的最小示例框架。 import numpy as np import torch # 假设策略模型已经导出为 TorchScript 格式 policy torch.jit.load(microduck_stand_policy.pt) # 控制频率单位 Hz CONTROL_FREQ_HZ 50 DT 1.0 / CONTROL_FREQ_HZ def get_observation_from_robot(): 从真机传感器读取状态。 真实部署时需要实现电机角度读取、IMU 姿态读取等。 # 示例返回随机观测数据 return np.zeros(12, dtypenp.float32) def send_action_to_robot(action: np.ndarray): 将策略输出的动作发送到电机。 真实部署时需要通过串口或总线下发并做安全检查。 pass def control_loop(): 主控制循环感知-策略-动作。 while True: obs get_observation_from_robot() obs_tensor torch.from_numpy(obs).float().unsqueeze(0) with torch.no_grad(): action policy(obs_tensor).squeeze(0).numpy() # 可选动作裁剪和限幅 action np.clip(action, -1.0, 1.0) send_action_to_robot(action) time.sleep(DT)真机部署代码里有几个不能省的保护逻辑动作限幅策略网络可能输出超出电机安全范围的数值必须裁剪超时保护如果主控程序出现异常应该让电机制动或进入安全模式急停逻辑检测到姿态异常或通信中断时立即停止运动。6.6 训练配置文件示例实际项目中超参数和奖励权重最好放在配置文件里方便版本管理和复现# 文件路径config/train_config.yaml training: total_timesteps: 2000000 learning_rate: 3.0e-4 batch_size: 512 n_epochs: 10 gamma: 0.99 gae_lambda: 0.95 clip_range: 0.2 ent_coef: 0.005 environment: control_freq_hz: 50 episode_max_steps: 400 action_space: joint_angle reward: w_velocity: 1.0 w_pitch: 0.5 w_energy: 0.01 w_smooth: 0.05 w_alive: 1.0这样做的好处是每个实验设置都有对应的配置文件实验结果可以和配置文件一起存档后期复盘时能还原训练时的完整状态。7. 训练效果验证怎么判断步态真的“学会了”很多初学者在训练结束后只看一个数字平均奖励。这个做法有严重的误导性。奖励函数是你自己设计的奖励高只代表策略在奖励函数的目标上表现好不代表走姿一定自然、稳定。验证步态策略效果建议按下面的方法分步评估观察仿真视频。如果环境支持渲染直接看机器人在仿真里的行走姿态。重点看是否出现抖动、滑步、身体前倾等异常。记录训练曲线。用 TensorBoard 观察每个 epoch 的平均奖励、策略损失、熵值变化。奖励稳步上升说明学习正常奖励剧烈震荡说明学习率或批大小可能不合适。做扰动测试。在仿真里随机施加推力、改变地面摩擦系数看策略是否还能恢复稳定。真机小范围测试。第一次真机测试一定绑上支架设定好安全距离确认电机的目标角度和实际角度一致再逐步放开。一个更合理的判断标准是策略在仿真环境的多次测试中至少有 80% 以上的次数能完成“向前走 2 米”的任务且姿态没有剧烈震荡。如果连仿真里的成功率都很低就不要着急上真机。如果在真机部署时发现步态和仿真差异很大先不要急着改算法优先检查基础问题控制频率是否一致电机的角速度和力矩是否达到仿真模型的数值IMU 数据的滤波逻辑是否影响了姿态估计动作空间映射是否正确。8. 常见问题与排查思路训练和部署双足步态强化学习的过程中问题会非常多。这里整理一份高频问题排查表按概率排序。问题现象可能原因排查方式解决方案训练刚开始奖励就发散学习率过大或奖励尺度不一致查看 TensorBoard 中的 loss 和 reward 曲线降低学习率归一化奖励到相近数量级机器人站在原地不动但奖励很高奖励函数鼓励了“活着”而不是前进检查奖励权重观察仿真视频增大前进速度奖励权重取消过高的存活奖励动作剧烈抖动动作平滑惩罚过小控制频率低查看动作输出序列是否高频震荡增加动作平滑惩罚提高控制频率仿真里很好真机走不起来Sim2Real 差距模型参数与真机不一致检查电机力矩、延迟、传感器噪声做系统辨识加入 domain randomization真机测试时电机过热或发出异响动作变化过猛力矩超限查看关节实际力矩和动作变化率限制动作变化率降低输出增益训练速度非常慢仿真环境物理计算量大批次太小检查 GPU 是否被使用单步仿真耗时增大并行环境数量使用 GPU 加速仿真机器人向前走但总是向一侧偏左右关节不对称装配误差检查真机机械结构是否安装对称在奖励函数中加对称性惩罚校准电机零点模型下载或版本不匹配Hugging Face 仓库权重与代码版本不一致查看仓库的版本标签和依赖要求使用与权重匹配的代码版本或用 Git LFS 正确拉取文件这些问题的共同特点是表面上是算法问题实际上往往是工程问题。很多新手在强化学习的坑里绕了很久最后发现只是电机通信频率没有设对。9. 工程实践与安全边界把 Microduck 这类开源双足机器人用在学习和研究中有一些工程实践建议值得提前掌握。9.1 先跑通官方示例再改自己的算法拿到硬件或仿真环境后最忌讳直接改代码、换算法。建议先完整跑一遍官方的示例训练流程确认环境、依赖、硬件通信全链路没有问题再基于官方代码做修改。这个“最小闭环”思维能节省大量排查时间。9.2 把实验配置当成代码来管理奖励权重、超参数、环境参数这些配置要像代码一样做版本管理。每次实验的配置文件、训练日志、模型权重、仿真视频最好打包存档。机器人强化学习的调试周期很长很多问题是在对比历史实验数据时才发现规律的。9.3 安全永远是第一优先强化学习训练过程中策略会经历很长的“探索阶段”在这个阶段机器人会做出很奇怪的随机动作。真机实验必须遵守以下边界第一次真机实验必须使用保护支架或安全绳机器人活动范围要设置围栏避免伤到人必须设置急停开关且急停逻辑要独立于主控程序电机温度过高时自动停止运动严禁在没有保护的情况下进行高功率、高速度测试在公共环境测试时需要确保不会对他人和财产造成风险。9.4 不要把所有希望都寄托在强化学习上最后想提醒一点虽然强化学习是当前机器人步态控制的热门方向但它不是唯一方案。传统控制方法比如基于模型预测控制 MPC 和 ZMP 控制仍有自己的优势尤其在某些需要严格稳定保障的场景。Microduck 更适合用来学习强化学习的实践方法以及理解 Sim2Real 的难点。如果未来需要做工程化、商用化的双足机器人传统控制与强化学习的结合往往才是最优解。10. 总结与后续学习方向Microduck 把“开源双足机器人”和“强化学习步态训练”这两个原本门槛都不低的方向用 399 美元的价格串了起来。它的意义不是让所有人都会做双足机器人而是让更多开发者和研究者有机会亲手跑通 “仿真训练 → 策略评估 → 真机部署” 的完整链路。如果你决定上手建议按这样的顺序推进先复习强化学习基础理解 PPO 和 Gymnasium 接口跑通官方仿真环境在仿真里调整奖励函数观察不同权重下的行为差异最后再做真机迁移。每一步都验证清楚再进入下一步。值得继续深入的方向包括Sim2Real 中的 domain randomization 技术、接触式全身控制、模仿学习与人形机器人数据采集、基于模型的强化学习在步态生成中的应用以及多智能体强化学习在机器人协作中的前景。这些方向都可以在 Microduck 这样的小型开源平台上先做实验再逐步积累经验。最低成本的入门方式就是从“在仿真里让它走起来”开始——现在这个入口比以前任何时候都更近了。
返回列表