
文章目录前言一、总述二、输入输出一、总输入输出总输入总输出二、分步输入输出第一步先将人话给转成命令第二步感知识别第三步再翻译命令第四步执行命令输出控制信号第五步持续感知和持续执行第六步按需触发翻译总结前言在具身智能领域VLA这个名称相信大家很熟悉不过VLA到底是什么意思或许大家似懂非懂本文就给大家解释一下这个名称的含义。一、总述VLA全程Vision-Language-Action Model顾名思义就是 视觉-语言-动作模型但是先提醒一点可不要看着这 视觉 语言 和动作名称上是串起来的就觉得这是他们的前后顺序绝对不要有这个先入为主的想法。我先简单说一下v视觉做的就是摄像头感知识别这个就是你们理解的传统的感知识别给识别到的物体分类打标签确定位置。L是语言模型这个就是接收人类的语言然后进行转换这个是VLA这里面概念不太好理解的部分先别急这里只是笼统的说一下下面会讲明白。A动作就是到了执行层这部分是规划控制。不清楚没关系接着往下看。二、输入输出又到了这部分我讲述的几乎所有内容都会把输入输出给先列清楚。只有先确认了输入输出我们理解起来之后目标才不会变。大家先记住一个任务拿苹果我们接下来讲解中的举例都是用这个距离。一、总输入输出这个是VLA这个玩意儿的总的输入输出。总输入总输入就是一句人话就是人类语言语音啦文字啦都可以。把苹果拿过来。拿苹果过来。拿过苹果来。麻烦把那个苹果拿过来。请把苹果拿过来给老子把苹果拿过来给dad把apple拿过来。等等等等相同的任务可能有几百种说法这个就是输入就是模仿人的交流。这个输入就是要做的事就是拿苹果随你怎么说。总输出输出是各个电机的实时控制扭矩或者转角。一定要清楚我们的控制对象最基本的就是执行器也就是电机。不用考虑什么液压之类的就按现在主流来。二、分步输入输出前面知道了输入和输出那VLA是怎么由输入到输出的接下来你们要时刻记得这个问题和总输入输出跟着我一步步往下走。第一步先将人话给转成命令这个就是L的其中一个作用L就是个翻译官上面说的各种语言它翻译的指令识别苹果然后把这个命令传给V。第二步感知识别L翻译出来了要识别 苹果给到V了V就开始感知识别然后把识别到的数据给输出比如说给识别出来了苹果的位置大小距离等等。第三步再翻译命令上面V输出了识别的信息传给LL得到信息再结合一开始的人话给A输出命令去123这个坐标位置有个半径是5cm的球形抓取后拿到234的坐标位置。第四步执行命令输出控制信号知道了上面具体的命令就交给A根据当前手和手臂的位置规划出手的一条能到苹果的轨迹然后计算当前控制周期内这几个关节电机的控制信号。第五步持续感知和持续执行A作为规划控制肯定得实时调整计算。V作为感知也得不停的反馈苹果的位置手的位置等。有可能还有压力反馈力矩反馈位姿反馈等等。第六步按需触发翻译理想环境下当然是不需要L再动了但是实际上可能苹果前有障碍物可能一次没拿稳苹果苹果掉了等这些通过V反馈上去后都需要L来处理再发命令是先拿走障碍物还是推到一边。总结分开讲这三部分更容易大家理解。大家也可以这么做但是现在更泛化的VLA模型这三者是你中有我我中有你。总之就是假设你开高达领导给你下命令让你消灭怪兽L理解领导的意思也V看到怪兽了就A驾驶高达打它