ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

自主机器人基础

自主机器人基础 自主机器人入门简介自主机器人具身 AI自主导航物体操控人机交互机器人系统与架构机器人系统集成仿真与测试开发框架硬件集成传感器执行器控制器自主软件架构理解周围环境感知摄像头激光雷达其它常见传感器感知的关键组成部分定位与建图定位的重要性建图技术导航与路径规划经典导航系统避障机器人控制系统反馈控制轨迹跟踪机器人发展趋势与未来利用基础模型完成机器人任务关键应用领域先进技术物理 AI 与仿真NVIDIA Cosmos移动基础模型VLM、LLM 和 RAG 在机器人领域的应用主要特性技术组件机器人领域面临的开放性挑战主要挑战发展机遇简介自主机器人自主机器人种类繁多包括水下机器人、无人机、自动驾驶出租车、家用机器人、救援机器人、四旋翼飞行器、四足机器人、人形机器人、外骨骼和机械臂。机器人广泛应用于各行各业包括制造、医疗保健、农业、物流、运输、探索、家用、零售、教育、公共安全和娱乐。可以看到机器人技术几乎能够影响所有市场。那么从宏观层面来看什么是机器人技术机器人又是如何工作的这张图概述了具身 AI。机器人的工作方式与人类非常相似。人类用眼睛进行感知用大脑进行认知并用手和腿等执行器采取行动。人类和机器人都是通过这种方式与世界交互的。感知模块接收来自外部世界的信息并将结果传递给认知模块也就是机器人的大脑随后机器人采取行动与世界交互。具身 AI具身 AI 是物理 AI 的一个子集代表着机器人技术和人工智能领域的一次重大飞跃使机器人能够以日益复杂的方式与物理世界交互。自主导航具身 AI 的主要能力之一是自主导航。它让机器人能够在各种环境中自主移动在没有人为干预的情况下规划路径并避开障碍物。物体操控物体操控是具身 AI 的另一个关键方面包括抓取牢固抓持不同形状和大小物体的能力复杂操控执行组装部件或折叠衣物等精细任务这些技能使机器人能够以接近人类能力的方式与环境交互。人机交互AI 领域的最新进展彻底改变了机器人与人类交互的方式包括自然语言处理让人类与机器人能够使用口头或书面语言进行交流协作让机器人能够与人类共同完成各种任务应用场景涵盖制造业和医疗机构等大语言模型的出现进一步增强了人机交互能力。这些模型显著提升了机器人理解和响应复杂指令及问题的能力使交互更加自然直观。机器人系统与架构机器人系统集成机器人系统的核心在于硬件与软件组件之间的无缝协作。集成过程包括硬件组件传感器、执行器以及让机器人能够与环境交互的其它物理部件软件系统控制机器人行为和决策过程的程序与算法目标是构建一个各部分协同工作的统一系统使机器人能够执行复杂操作并实现内部通信。仿真与测试借助 NVIDIA Isaac Sim、NVIDIA Isaac Lab 或 Gazebo 等仿真环境可以在将机器人部署到现实场景之前验证整个系统。此外还可以利用各种测试框架例如硬件在环 (HIL) 测试、软件在环 (SIL) 测试以及单元测试或系统级测试。开发框架机器人开发通常依赖专用平台和框架。一个典型示例是 ROS机器人操作系统它为编写机器人软件提供了灵活的框架。也可以使用其它中间件操作系统。硬件集成硬件集成的目标是将各种硬件组件整合为一个无缝协作的统一系统确保传感器、执行器与控制器之间能够可靠、高效地交互。传感器传感器对于环境感知、导航辅助以及向控制系统提供反馈至关重要。常见类型包括摄像头用于视觉输入LIDAR用于距离测量IMU惯性测量单元用于确定方向GPS用于位置跟踪执行器执行器负责实现移动和操控并根据传感器反馈施加作用力和进行调整。执行器的类型包括电机用于移动的 DC 电机和步进电机伺服机构用于精确的位置控制气动和液压执行器用于施加作用力控制器控制器负责处理传感器数据、执行控制算法并促进各组件之间的通信。例如微控制器例如 Arduino 和 PIC单板计算机例如 Raspberry Pi 和 NVIDIA Jetson嵌入式系统用于集成式控制解决方案集成过程需要确保所有硬件组件高效协作使整个机器人系统能够可靠运行并高效处理数据以支持实时决策。通过重点关注这些方面硬件集成使机器人能够精准、灵活地执行复杂任务。自主软件架构此图概述了一种相对复杂的自主软件架构常用于无人驾驶出租车等应用。它展示了自主系统所需各类组件的集成方式不过有些机器人可能只会使用其中一部分组件。感知与定位利用摄像头和 LIDAR 等传感器以及建图系统评估周围环境并确定机器人的位置和状态规划包括多个阶段全局规划类似于在地图上设定路线通过定义任务和途经点来抵达目标行为规划决定要采取的动作例如操作哪个物体以及如何操作局部规划为特定任务生成轨迹引导机器人沿精确路径移动控制与执行控制器跟踪轨迹状态来执行操作或导航动作并在虚拟仿真和真实场景中测试结果反馈循环持续收集传感器和定位数据以优化规划并提升系统性能。这一迭代过程确保机器人的行为具有适应性并能及时响应理解周围环境感知在机器人领域感知对于自主机器人理解周围环境至关重要。人类会综合运用视觉、听觉和触觉等多种感官来理解周围世界同样机器人也依赖传感器融合。此过程整合多个传感器的数据从而全面、准确地呈现环境。摄像头单目摄像头使用单镜头拍摄 2D 图像。这类摄像头结构简单、具性价比且易于获取非常适合基本的物体检测、图像识别和简单导航任务双目摄像头使用两个镜头同时拍摄图像模拟人类的双眼视觉。这种配置能够提供深度感知和 3D 信息适用于避障和 3D 建图。Hawk 3D 深度摄像头就是一个例子RGB-D 摄像头将标准 RGB 彩色成像与深度感知相结合提供可靠的 3D 感知能力。这类摄像头适用于高级导航、物体操控和交互。Intel RealSense 双目 RGB-D 摄像头是一种常见选择热成像摄像头检测红外辐射并根据温度差异生成图像。它们在黑暗环境中或透过烟雾和雾气时也能有效工作因此非常适合搜索、救援和监控任务事件相机具备高时间分辨率和低延迟非常适合高速运动检测与跟踪了解这些摄像头类型有助于为特定机器人应用选择合适的传感器从而增强机器人有效感知周围环境并与之交互的能力。激光雷达2D 激光雷达更简单、更便宜且速度更快但功能有限。非常适合基本的平面导航和障碍物检测3D 激光雷达能够提供详细的空间信息、宽广的视野和高分辨率适用于自动驾驶车辆建图。不过它通常比摄像头更昂贵固态、闪光式和 MEMS 激光雷达兼具耐用性和性价比通过激光脉冲测量距离并创建详细地图其它常见传感器超声波传感器发射声波并根据回声返回时间测量距离。价格实惠常用于家用吸尘机器人等低成本机器人雷达在各种环境条件下都能可靠工作可提供距离、速度和尺寸信息应用于无人驾驶出租车等场景GPS对于户外定位至关重要IMU惯性测量单元测量加速度和旋转速率以跟踪运动和姿态广泛应用于移动机器人车轮编码器测量车轮转动量以确定行驶距离磁传感器指南针检测地球磁场以确定姿态并提供航向信息环境传感器测量温度、湿度和空气质量触摸传感器具性价比可用于检测接触常见于家用机器人这些传感器共同增强了机器人感知周围环境并根据实时数据做出合理决策的能力。感知的关键组成部分传感器融合整合不同传感器的数据以全面了解周围环境物体检测与识别识别机器人环境中的物体并对其进行分类物体跟踪持续跟踪移动中的物体就像人眼追踪移动物体一样场景理解理解环境的整体情境使机器人能够做出合理决策NVIDIA 开发了 Isaac Perceptor这是一套专为移动机器人设计、基于摄像头的 3D 感知系统。该系统提供稳健的里程计跟踪机器人在环境中的移动就像人在行走时判断自身位置一样局部 3D 场景重建构建周围环境的三维地图为自主导航提供支持Isaac Perceptor 利用 VSLAM视觉同步定位与建图等技术实现精确的里程计并利用 NVBlox 完成细致的 3D 重建。这些技术的集成对于开发先进的机器人导航应用至关重要也为未来类人机器人视觉系统的创新奠定了基础。定位与建图定位与建图对机器人有效地在环境中导航并与环境交互至关重要。可以把机器人想象成一名旅行者需要借助地图和指南针探索陌生区域。通过这些过程机器人能够确定自身位置并绘制周围环境的地图。定位的重要性定位可帮助机器人确定自身在环境中的位置从而作出合理决策。例如在轨迹跟踪等任务中准确掌握位置对于确保机器人严格按照预定路径行进至关重要。GPS全球定位系统主要用于室外环境以提供位置数据视觉里程计利用摄像头图像估算运动将这项任务转化为计算问题基于激光雷达的定位使用激光传感器将当前位置与已有地图进行匹配建图技术建图是指创建环境的表示对于仓库或工厂等大型空间至关重要。SLAM同步定位与建图机器人在构建地图的同时跟踪自身在地图中所处位置的技术占用栅格将环境表示为网格每个单元格表示该位置被占用的概率这些技术是自主导航的基础使机器人能够有效地理解环境并与环境交互。导航与路径规划在自主移动机器人领域导航与路径规划对于确保机器人在环境中高效、安全地移动至关重要。其中包含多个规划层级每个层级各有侧重。经典导航系统路线与任务规划路线与任务规划用于确定地图网络中的首选路线常用算法包括 A*、D* 和 RRT快速探索随机树。这类似于在路口确定行进方向——决定直行还是转弯。仅靠这一层通常并不足够因此还需要其它规划层级。这就是引入运动规划的原因。运动规划运动规划会生成一系列动作使机器人能够沿规划路径行进同时避开障碍物。它通常需要几秒钟来处理决策和轨迹生成这两个部分。决策侧重于行为规划和交互例如决定是绕过托盘等障碍物还是避让移动中的叉车轨迹生成生成基于时间的轨迹详细指定速度、加速度和航向角以实现精确控制避障实时检测通过实时检测并避开障碍物来确保功能安全反应式导航利用传感器立即做出调整在主要自主系统未能检测到障碍物时作为备用机制这种分层方法使机器人能够与环境进行动态交互并有效执行复杂的导航任务。机器人控制系统机器人的轨迹和目标状态确定后控制系统会将这些信息转换为发送给机器人执行器的指令从而确保机器人准确地沿规划路径移动。反馈控制反馈控制根据传感器输入调整机器人的动作以实现预期行为。一种常见的反馈控制方法是 PID 控制比例-积分-微分。PID 控制是一种广泛使用的算法它通过持续调整运动最大限度地减小期望位置与实际位置之间的误差。其工作原理是将期望的轨迹状态与根据定位数据获得的实际状态进行比较并实时进行修正。轨迹跟踪可以使用轨迹跟踪来确保机器人准确地沿规划轨迹移动。一种常用的方法是 MPC模型预测控制。MPC 是一种高级控制策略它使用机器人行为的预测模型来优化机器人的路径。MPC 比 PID 控制更为复杂通常用于精准的轨迹跟踪和人形机器人的全身控制。这些控制方法对于确保机器人能够在环境中有效导航同时保持运动的准确性和安全性至关重要。在深入理解感知、定位、建图和控制系统等基础要素之后接下来可以探索机器人技术的当前趋势和未来发展方向。这正是基础模型发挥关键作用的领域。机器人发展趋势与未来利用基础模型完成机器人任务基础模型通过增强感知、决策和控制能力正在推动机器人技术变革。这些模型基于海量数据集进行预训练与传统方法相比具有更强的适应能力和泛化能力。关键应用领域机器人策略学习扩散策略、语言条件模仿学习和强化学习等技术可提高数据效率和上下文理解能力。这些模型利用语言驱动的奖励帮助机器人学习最优动作价值学习机器人不直接学习策略而是学习价值函数以选择成本最低的动作从而增强决策能力高层任务规划基础模型让机器人能够针对复杂任务进行认知层面的规划。例如人形机器人可以利用这些模型理解“拿起特定箱子”之类的高层指令基于 LLM 的代码生成大语言模型 (LLM) 可生成用于机器人训练和执行的代码。GenSim 等系统便体现了这种能力它们可以为各种应用创建任务仿真先进技术开放词汇目标检测与 3D 分类Dino V2 等模型无需预定义类别即可增强对各种对象的编码能力这对于动态环境至关重要语义分割开放词汇分割让机器人能够识别此前未见过的对象并与之交互从而拓展其任务范围3D 表征与可供性基础模型提供开放词汇 3D 表征让机器人能够推断对象的可供性即根据对象的属性决定如何与其交互物理 AI 与仿真像 Voyager 和 MineDojo 这样的物理 AI或具身 AI系统通过模拟任务在虚拟和现实环境中训练机器人。这些系统利用基础模型来提升任务执行能力和适应性。基础模型正在推动机器人系统变得更加智能、用途更加广泛使其能够在极少人工干预的情况下执行复杂任务。更多内容见文章机器人领域的基础模型应用、挑战与未来NVIDIA CosmosNVIDIA Cosmos 是一款世界基础模型旨在加速物理 AI 系统的开发包括机器人和自动驾驶汽车。Cosmos 推出了一系列世界基础模型 (WFM)专为生成符合物理规律的视频和世界状态而设计。世界基础模型是一类能够预测和生成符合物理规律的虚拟环境的神经网络。这些模型使用海量数据进行训练。Cosmos WFM 可帮助开发者高效生成大量基于物理规律的照片级真实感合成数据。这项能力显著减少了训练和评测物理 AI 模型所需的时间和成本。NVIDIA Cosmos 标志着物理 AI 和机器人开发取得了重大突破。通过提供强大的世界基础模型和工具它有望加快自动驾驶汽车、机器人及其它物理 AI 应用的创新或将开启智能机器的新时代。移动基础模型移动基础模型充当机器人系统的中央“大脑”处理稳健的视觉状态并生成词语模型和行动策略。该模型可适用于多种机器人形态包括自主移动机器人 (AMR)。主要特点基于仿真的训练该模型仅使用仿真数据进行训练无需开展实体测试即可高效开发零样本部署无需额外训练即可成功部署到 Hubble 实验室等真实环境中展现出良好的适应能力跨形态能力为 AMR 开发的策略可迁移到其它机器人上例如人形机器人、四足机器人和太空叉车该模型展现了机器人技术实现跨平台功能的潜力有助于解决复杂的计算难题并为多样化应用铺平道路。更多内容X-Mobility通过世界建模实现端到端的通用导航VLM、LLM 和 RAG 在机器人领域的应用视觉语言模型 (VLM)、大语言模型 (LLM) 与检索增强生成 (RAG) 的集成正通过一种称为附带感知的概念推动机器人技术变革。这种方法让机器人能够构建并利用记忆从而有效地在环境中导航并与环境交互。主要特性构建记忆机器人使用这些模型记住事件、地点和时间以便在需要时返回特定地点演示示例在最近的一次 NVIDIA 办公室演示中机器人接到指令去寻找一处“美景”。它回想起之前观察到的景象例如绿植并将用户带到那个位置执行任务机器人可以根据记忆执行取物等任务。例如它能通过回忆之前在哪里见过薯片在厨房中找到薯片技术组件视觉语言模型 (VLA)每隔几秒采集视频数据并生成说明将这些信息存入向量数据库形成长期记忆语音处理利用 NVIDIA 的 Vsper 将语音转换为文本增强交互能力开放词汇学习让机器人无需预定义类别也能理解并响应各种新的查询VLM、LLM 和 RAG 的集成让机器人拥有更持久的记忆和更强的交互能力为打造更加直观、响应更灵敏的机器人系统铺平了道路。更多内容ReMEmbR为机器人导航构建长时空记忆并基于记忆进行推理利用生成式 AI 让机器人借助 ReMEmbR 进行推理和行动机器人领域面临的开放性挑战尽管基础模型带来了显著进展但机器人领域仍面临多项挑战。主要挑战数据稀缺训练模型需要海量数据而机器人领域的数据通常有限。NVIDIA 提供的 Isaac Sim 和 Isaac Lab 等工具可通过环境仿真生成数据帮助解决这一问题实时性能基础模型的实时部署至关重要。NVIDIA 的 Orin 等技术支持在设备端进行处理从而减少对云计算的依赖并提升性能通用感知要实现能够应对各种任务和环境的真正通用感知系统仍然充满挑战统一表示将多模态输入例如视觉和听觉整合成连贯的理解十分复杂但这对于机器人表现出稳健的行为至关重要稳健性与安全性对机器人进行评测并确保其在不可预测的情况下安全可靠至关重要。OSMO软件在环和硬件在环等工具可为这一评测过程提供支持发展机遇边缘端部署如 NVIDIA 的 VLA 演示所示直接在设备上运行模型可以提升性能并减少对云端的依赖基准开发创建基准有助于比较算法在不同场景下的表现从而提高可复现性并改进性能评估人机交互增强社会化导航能力并更好地理解人类预期可以改善人类与机器人之间的协作这些挑战也带来了创新机遇推动机器人系统向能力更强、适应性更高的方向发展。
返回列表