ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从CLIP到世界模型:多模态融合、Agent与World Model演进路线

从CLIP到世界模型:多模态融合、Agent与World Model演进路线 1. 技术主线为什么会这样走一个递进而非颠覆的过程过去两年如果只选一条主线来读多模态论文我的做法是盯住三个词Fusion、Reasoning Agent、World Model。这三个词正好对应2024-2026年多模态研究的三次重心转移也基本能覆盖从CLIP到多模态大模型再到Sora/Genie这条完整路线。说它是论文阅读清单也好技术路线图也好核心是帮我们理解一件事多模态模型到底在往哪个方向走。是从“让文本和图像在一个空间里对齐”起步到“让模型在真实或模拟环境里闭环决策”再到“让模型学会物理世界的因果规律”。很多刚入方向的朋友容易把这三个词当成三代技术觉得World Model出来之后Fusion就过时了。实际完全不是这样。它们是层层叠加的关系不是互相替代的关系。融合解决的是“模型能不能看到并理解多种输入”Agent解决的是“模型能不能带着这些理解去完成任务”World Model解决的是“模型能不能在没有真实环境反馈的情况下预演未来”。没有前面的融合基础后面两个无从谈起但只做融合又无法回答更深层的智能问题。这也是为什么我从2024年开始给组里同学列的阅读路线永远是这条先读通Fusion再读Reasoning Agent最后才碰World Model。1.1 Fusion解决了什么留下了什么Fusion阶段解决的核心问题是把图像、文本、音频、视频这些异构信号塞进同一个数学空间。不用把它想得太玄本质上就是给不同模态找一种共同语言。CLIP就是一个典型代表它拿海量图文对做对比学习让“一张猫的图片”和“Cat”这个单词在向量空间里靠得很近。这种做法的好处很明显模型突然获得了跨模态的联想能力zero-shot分类、图文检索都变得可行。但当年做完这批工作的人也很快发现对齐不等于理解。CLIP可以判断一张图里有没有猫但回答不了“猫在沙发上窗外在下雨如果窗户打开猫会不会被淋湿”这种需要空间关系、物理直觉和推理的问题。我那时候用CLIP做商品图匹配图文对匹配准确率看着不低但只要涉及属性组合、数量关系、场景因果结果立刻就崩。这个“崩”其实非常有价值它把Fusion的能力边界画得清清楚楚跨模态表示是地基但光有地基盖不了高楼。1.2 Reasoning Agent补上了什么Reasoning Agent阶段解决的问题是让模型从“输入多模态数据、输出一段文本”变成“输入多模态数据、输出动作序列或决策方案”。这类工作通常把多模态大模型当作一个Agent的大脑感知模块负责把屏幕截图、摄像头画面、用户语音变成上下文规划模块负责任务拆解执行模块负责调用工具或给出动作然后整个系统形成一个闭环——观察、推理、行动、再观察。举个例子你可能就明白了。拿一个手机截图给纯Fusion模型看问它“这个页面上的红色按钮是干什么的”它能答出来但如果问“帮我完成下单流程每一步要点击哪个位置”它答不了。因为它不具备把长任务拆成多个动作、每一步根据界面反馈重新决策的能力。而多模态Agent场景里CogAgent、AppAgent这一类工作就是在做这件事模型直接读图生成坐标点或者UI操作指令在真实App里跑通一个完整任务。这种能力比“会看图说话”明显上了一个台阶也是2025年前后很多AI智能体应用案例落地的基础。可以说多模态AGI的雏形不是来自更大的对话模型而是来自这种能感知、能决策、能行动的Agent架构。1.3 World Model为什么在2025-2026被推到前台再往后Reasoning Agent也遇到了瓶颈真实环境反馈太贵、太慢。机器人动一步要真实电机转一圈自动驾驶变一次道要真实车辆跑一遍路训练成本高到无法承受。于是研究者开始想能不能让模型在内部模拟一个环境自己先脑补几万种情况再决定怎么做这就是World Model的动机。World Model的目标不是单纯生成像不像的视频而是学习环境的状态转移规律。给它一个场景它能预测“如果我这样做接下来会发生什么”。真正能用的世界模型等于给Agent装了一个低成本试错沙盘。这跟视频生成有本质区别视频生成追求像素级别的逼真世界模型追求状态级别的正确。Sora这类大规模视频生成模型之所以被讨论得那么厉害是因为它从海量视频里学到了很多物理世界的动态规律具备成为世界模型的潜力但生成质量高不代表物理因果判断正确这是当前论文里争议最多的地方。所以我在2025年之后看论文遇到标题带World Model的都会先问一句它是在做视频预测还是真的在学习隐状态转移这两个东西在论文里经常被混为一谈。2. Fusion时代从对比对齐到原生多模态如果按时间线复盘多模态融合论文2024年之前的重心是“怎么把不同模态拼到一起”2024年之后的重心变成了“怎么从零开始训练一个原生多模态大模型”。这个转变非常关键理解它之后再看Qwen-VL、InternVL、Gemini这些模型就不会觉得只是变大了而是结构逻辑变了。2.1 CLIP式对齐仍然是地基先说CLIP式的对比对齐。它到今天依然是很多多模态系统的基础模块不是因为效果好到无敌而是因为它的训练方式极其稳定。把图像编码器和文本编码器分别映射到同一个向量空间用对比损失拉近匹配对、推远不匹配对就是这么简单的思路撑起了图文检索和视频检索这个品类。这套思路在应用层面也确实好使。做商品多模态支持的时候用户传一张实物图系统拿图片query去库里匹配商品主图和文本描述核心向量就是CLIP embedding。但使用中有个很典型的坑CLIP对“细粒度匹配”非常弱。同一个商品换个背景、换个角度、换个光线向量距离变化比换一个相似款还大。我试过直接拿CLIP做服装同款检索用户拍一张衣领细节系统返回的是整体外观相似的连衣裙细节完全不匹配。所以后来我养成了一个习惯CLIP做粗筛模型后面再接专门训练的目标识别或属性识别模块做精排。这也是Fusion阶段留给我们的最重要经验——不同粒度的匹配需要不同层级的表示单靠一个全局向量解决不了所有问题。2.2 从Adapter外挂到原生统一建模早期多模态大模型比如LLaVA系列走的是“外挂”路线。视觉编码器用CLIP的ViT文本用LLM中间加一个可训练的Projection矩阵把图像特征映射成LLM能读的token。这套方案性价比极高训练数据量小、收敛快、复现门槛低直到今天很多垂直场景的模型还是这么搭的。但它有明显的天花板图像侧和文本侧各自保留了自己的表达习惯中间只有一层薄薄的映射复杂跨模态交互很难涌现。2024年之后的趋势是把视觉和文本的token在Transformer早期就统一处理共享大部分参数甚至用统一的tokenizer把图像、音频、文本都切成同一种离散表示。这样做的好处是模型可以在更底层做模态融合而不是在语义层硬拼盘。Qwen-VL、InternVL这些模型在架构上就属于这个路线它们的能力天花板明显高于早期的Adapter方案。但代价也很现实训练数据要求成倍提高稳定性更难控制工程团队要处理统一的tokenizer、动态分辨率、长上下文等一系列问题。信息融合的等级从“特征拼接”变成了“结构统一”这是我看Fusion相关论文时最关注的一个维度作者到底是在哪个层级融合的是拼接、交互、还是底层统一。2.3 评价Fusion时代成果的标尺做多模态融合方向的人或多或少都得跟benchmark打交道。MMMU、MathVista、DocVQA、VideoMME这些名字在论文里反复出现。我的建议是看指标但别只看排名。MMMU涵盖多个学科用来测多模态大模型的知识面还行但里面的题目和预训练语料重叠度很高刷分空间不小。DocVQA测的是文档理解对OCR和布局理解敏感但难度阈值有限2025年之后很多模型在这类任务上已经接近饱和。真正需要看重的是那些有“反直觉”设计的数据集。比如数学图表推理要求模型把图表坐标、单位、公式串起来比如空间关系推理问“红色方块在蓝色圆球的哪一边”。这类任务能戳穿“看起来懂了实际上没有”的模型。复现多模态模型代码时的经验也指向同一个结论融合模型的指标崩坏往往不是因为模型看不懂图像而是因为评测数据的分布和训练数据差异太大。所以我的建议是与其盯着单一排行榜不如攒一个小规模但贴近自己业务场景的评测集用自己的数据说话。这才是判断一个多模态融合模型能不能用的最终标准。3. Reasoning Agent让模型闭环而不是单发如果说Fusion阶段是在训练“眼睛”和“语言区”那Reasoning Agent阶段就是在训练“小脑”和“执行器”。多模态大模型不再只是回答问题而是进入一个真实或模拟的交互环境通过工具调用和动作执行来完成具体任务。这个转变在2025年之后尤其明显几乎每两周就能看到一篇新的多模态Agent工作。3.1 多模态推理智能体的典型架构你拆开一篇多模态Agent论文基本都能找到五个模块的影子感知模块、规划模块、执行模块、记忆模块、反馈模块。感知模块负责把当前环境状态屏幕截图、相机画面、录音、传感器数据压成上下文token规划模块基于当前状态和任务目标生成推理过程决定下一步动作执行模块把动作转成具体的工具调用或界面操作记忆模块保存之前几步的观察结果避免模型忘事反馈模块把执行后的新状态带回给模型形成闭环。这个架构里的关键不是某个单一模块而是“循环”本身。ReAct思路在多模态场景的扩展就是这么做的模型看一眼截图用自然语言推理“当前页面有商品信息下一步应该点击价格栏”执行点击再看新截图继续下一步。这个过程长得像人在操作电脑优点是每一步都有环境反馈错了可以马上修正缺点是每一步都在消耗推理流量和时间长任务链的延迟非常高。我在跑这类系统时最深的感受是多模态Agent的瓶颈不在单步准确率而在长程任务中一步一步错误累积。单步准确率95%二十步之后任务成功率可能只剩三成。这也是为什么后来的论文都在强调记忆压缩、状态摘要、错误恢复这些机制。3.2 论文里的产品化影子GUI Agent、机器人、驾驶决策2024到2026年间的多模态Agent论文大致可以分成三类应用影子。第一类是GUI自动化代表工作像CogAgent直接看手机或电脑截图输出UI元素坐标替用户完成表单填写、下单、配置等操作。这类方向的产品化价值非常直接很多流程自动化软件已经往这个方向转型。第二类是机器人和智能驾驶模型接收相机画面和传感器数据输出轨迹规划或操作指令。跟GUI Agent相比这个方向对实时性和安全性的要求高了一个数量级目前更多集中在仿真环境里验证。第三类是通用工具型Agent模型判断该调用搜索引擎、图像生成、代码解释器还是外部API用一个多模态大模型做中枢支配一堆专业工具。聊到AI智能体应用案例很多团队一开始都想做通用大Agent什么任务都往上放。实际我见过跑得最稳的反而是那些把场景锁得很窄的案例比如只做报销单审核、只做库存拍照盘点、只做UI回归测试。场景越窄环境反馈越可控Agent的行为越容易收敛。这个经验跟论文里的趋势是吻合的——论文可以讲通用性产品必须讲确定性。3.3 评估与训练上的难点多模态Agent的评估是当前论文里最“艺术”的部分。传统多模态问答可以给一个标准答案打分但Agent任务是一个多步轨迹中间哪一步错了、哪一步对很难用单一指标衡量。用最终任务成功率来评估又忽略了过程合理性用过程奖励来评估又需要给每一步打标签人工成本极高。训练端的问题更棘手。Agent示范数据很难规模化获取人工录制操作轨迹非常昂贵用模型自动生成合成轨迹又存在分布偏移模型在模拟环境里学会了一到真实环境就傻眼。这个问题短期内没有银弹我看到比较有效的办法是混合策略一部分人工高价值示范保证行为质量一部分自动探索轨迹提高覆盖率再用真实环境的小批量反馈做调整。做这类方向时心态要放平论文里的成功率数字依赖特定环境换个环境基本不成立。别把“在Mind2Web上80%”理解成“在所有网页上80%”这个区别很关键。4. World Model从“生成像”到“生成规律”从Fusion到Reasoning Agent模型已经会看、会想、会动。但还有一个问题没解决模型在行动之前能不能先在脑子里预演一遍World Model方向回答的就是这个问题。2025年底开始这个词在论文标题里出现的频率暴涨但灌水也不少所以这章我把它们拆开讲清楚。4.1 世界模型不是简单的视频生成很多论文把视频生成模型包装成世界模型理由是“它能预测下一帧”。这其实是一个偷换概念。视频生成模型的目标是生成像素上看起来合理的下一帧世界模型的目标是维护一个持续更新的状态表征并基于这个状态表征预测不同动作下的未来结果。两者的关系是视频预测可以作为世界模型的一种输出形式或训练信号但世界模型不等于视频预测。打个比方视频生成相当于一个人看了天气预报动画能画出明天可能的样子世界模型相当于这个人还知道“如果我现在带伞淋雨概率会降低”。前者只需要外观一致性后者需要因果和物理规律的内部表达。这也是为什么很多做机器人学习的团队宁可放弃惊艳的视频生成效果也要用Dreamer这类隐状态世界模型——因为强化学习的想象回放需要的是状态预测不是像素预测。4.2 2024-2026的代表方向过去两年里我把World Model相关工作大致分成三条线。第一条线是基于视频大规模预训练的Simulator代表是Sora、Genie这类工作。Genie可以从完全无标注的游戏视频里学到可交互的游戏环境你在某个帧上给出一个动作它能生成对应的下一帧。这类模型最大的价值是证明了仅靠视频数据就能学到相当丰富的环境动态规律不需要任何动作标签。第二条线是视觉自监督世界模型V-JEPA是典型代表它学习视频帧之间的抽象表示对遮挡、光照变化有很强的鲁棒性。第三条线是用于决策和强化学习的梦模型Dreamer家族模型在训练时自己做梦在隐空间里想象大量的交互轨迹再拿这些想象的轨迹来训练策略。做机器人或者智能驾驶的组现在基本都在往第三条线靠。如果你做研究选题我建议重点关注第一条和第三条的交集用大规模视频预训练出一个Simulator再用它的隐空间去训练决策模型。这可能是未来两年性价比最高的方向。但前提是算力要扛得住这类实验对数据和显存的要求远超普通多模态大模型。4.3 为什么世界模型评测这么难World Model方向的评测可能是整个多模态领域里最不成熟的一块。图像生成可以算FID、算CLIP Score文本生成可以算BLEU、算Rouge但“世界模型学得好不好”没有公认的度量。你可以问模型“现在球在斜坡上松手之后它会怎么动”然后看它的预测视频是否合理但人对这个预测的评分标准非常模糊。两个模型一个生成模糊但对一个生成清晰但错你要怎么排我目前看到比较靠谱的评测思路是拆成若干个物理规则测试物体持久性、重力方向、阻挡关系、碰撞后的运动方向。这些测试不看像素好看不好看只看状态转移正不正确。另外有条件的话可以走“决策验证”路线把世界模型放到一个具体的强化学习或规划任务里看它做不出来更优的策略。如果世界模型学到的规律是错的那用它想象出来的轨迹训练策略最后任务表现一定好不了。这个验证方式的缺点是成本高但胜在结果可量化。给读者的忠告是看到论文声称自己的模型是World Model先看它测的是什么再判断这个“World Model”含金量高不高。5. 支撑层与落地视角统一处理、多模态数据库、垂直应用聊完研究主线还有一个非常重要的层面不能跳过工程落地的支撑。论文里的模型再强最后还是要用到真实的商品检索、内容审核、交通检测、文档解析这些场景里。这一章的视角会非常“不学术”但可能对做应用的人帮助最大。5.1 多模态统一处理的关键工程问题所谓多模态统一处理落到工程上就是四个字清洗、切分、编码、入库。文本要清洗无意义符号图片要抽帧、缩放、去模糊视频要按镜头切分并做关键帧提取音频要转写语音文档要做OCR。这些看起来是脏活累活但它们的质量直接决定上层模型的表现。我在一个商品多模态项目里就踩过坑视频抽帧用默认1秒一帧结果很多关键商品展示动作被漏掉导致后续图文匹配任务的数据质量很差不收敛。后来改成按场景切换运动幅度抽帧准确率立刻上来了。统一处理环节还有一个常被忽略的问题不同模态的数据怎么说进同一个系统。匹配阶段先把文本和图像都embedding化理解阶段要把切出来的视频帧、音频轨道、字幕文本在时间轴上对齐再拼成一条可送入多模态模型的上下文。这个对齐工作决定了模型能不能同时“看”和“听”。市面上已经有一些现成的多模态插件生态比如Qwen系列的周边插件能帮你快速把图像、视频、文档、语音接进来。我的建议是先在插件层把流程跑通再根据自己场景做定制不要一上来就造数据处理的轮子。5.2 多模态数据库与RAG现在做应用的人经常说多模态但很多系统的存储层根本配不上这个说法。传统关系型数据库存不了图像向量更存不了跨模态的相似度查询。多模态数据库这一块本质上是把不同模态的embedding统一放一个库里支持图文混合检索、向量相似度召回、标签过滤和语义排序。典型场景是电商商品库一个SKU的库记录里既有标题文本向量、又有主图视觉向量、还有属性标签向量用户上传一张图系统把视觉query转成向量在库里同时做视觉相似和文本语义匹配自然就能做到“以图搜同款、以文找风格”。我的落地经验是三层结构先通过传统的倒排索引或SQL筛掉明显不相关的候选缩小召回范围再在向量数据库里做多路召回文本向量一路、图像向量一路、标签一路最后用一个轻量级多模态大模型做精排和理由生成。这么做的好处是既保证了性能又不会把核心判断完全托付给一个黑盒向量。多模态RAG跟普通RAG的差异也在这里普通RAG检索的是文本段落多模态RAG检索的是带图像、表格、音频的整个知识单元对分块和表征的要求更高。做知识库产品的朋友可以在2026年多关注这块它正在从“玩具”变成“生产力”。5.3 垂直场景商品图搜、智慧交通、目标识别多模态技术落地最快的垂直方向我认为有三个。第一是商品多模态支持前面其实已经反复提到核心就是“图搜索属性理解推荐排序”三件套。第二是智慧交通和安防领域的目标识别比如基于YOLO做目标检测再加一个多模态AI分析层做场景理解。这类方案的思路是检测模型负责给出候选框多模态大模型负责判断候选框里的物体是什么关系、场景是否异常、事件严重程度如何。这个组合非常稳定因为YOLO类检测器对目标位置敏感大模型对语义关系敏感两者互补。第三个方向是多模态文档理解从发票、合同、设备说明书里抽取结构化信息。这个方向看起来不如Agent酷但每家企业都需要付费意愿也强。我见过一个比较典型的案例把质检员的缺陷描述文本和产品缺陷图像放进同一个向量空间工人在现场拍一张照片系统直接返回历史上类似的缺陷记录和维修建议。这个系统没有用特别复杂的模型就是CLIP加上一个多模态RAG但实际价值极高。所以别总盯着顶会把模型拿去解决一个具体的多模态目标识别问题才会真正理解论文里的技术细节哪里有用、哪里是花架子。6. 复现与评估的踩坑笔记最后这一章写给准备动手复现多模态模型代码的朋友。论文阅读再多不跑代码等于没读。我这两年在多模态方向踩过的坑比看过的论文还多挑几个最常见也最容易劝退的说一说。6.1 论文复现的常见坑第一个坑是数据配比导致的指标对不上。论文里写用了多少图文对、多少指令数据但开源出来的往往是蒸馏或子集版本你用公开数据复现出来的MMMU分数跟论文差五六个点非常正常。别一上来就怀疑代码写错了先看是不是数据配比和来源不一样。第二个坑是评测代码版本不一致。同一个MMMU有的仓库用官方原题有的用了转换格式分数能差出好几个点。我的习惯是把跑通的评测脚本版本固定下来记录在实验文档里不然两个版本之间对比毫无意义。第三个坑是输入分辨率。多模态大模型对图像分辨率极其敏感同样一张图resize到224和448推理结果完全不同。论文里如果没写清楚resolution你甚至要猜它默认是哪个尺寸。第四个坑是显存规划。一个7B参数左右的多模态LLM加视觉编码器fp16全精度推理大概需要20GB左右显存4bit量化之后能压到8-10GB但量化后的精度损失在某些任务上非常明显。如果要在单卡上加载模型务必提前算好显存里要分成几个部分还要预留KV cache的空间。还有一个容易忽视的坑batch size和学习率没有同步。多模态数据方差大小batch常需要更小的学习率直接从单卡batch size调到多卡大batch之后不把学习率按比例调上去模型会直接跑飞。6.2 benchmark不可尽信现在的多模态大模型排行榜娱乐属性大于参考价值。原因很简单benchmark数据在预训练阶段被广泛采集泄漏情况比公开讨论的严重得多。一个模型在MMMU上刷到高分不是你业务场景上的高准确率甚至连图文识别能力都代表不了。我一般会做三件事来对抗benchmark污染。第一自建与业务分布一致的小评测集控制在200-500条人工标注长期不更新用它来跟踪模型迭代。第二把同类任务的不同评测集交叉验证比如同时看DocVQA、ChartQA和自建的图表评测如果一个模型只在某一个集上暴涨、其他集上没变化那大概率是数据泄漏。第三保留历史模型版本每次换新模型之前先跑一遍旧模型确保指标波动不是因为评测环境漂移。这三件事很朴素但能省下大量被骗的时间和算力。6.3 多模态模型代码复现的推荐路径如果你是第一次复现多模态模型代码我的建议是从小到大走三条路。第一条是用Transformers库加载一个现成的开源多模态模型跑它的示例代码先体验模型输入输出格式跑通“图像文本→文本”和“视频文本→文本”两个最小demo。第二条是看一篇经典论文的官方实现比如LLaVA把它的预处理、训练循环、评测脚本完整看一遍不用全部理解但要能手动画出数据流的走向图像从哪里进、怎么变成图像token、怎么和文本token拼接、怎么过LLM、怎么生成答案。第三条是做一个小规模的微调实验用几百条自己的数据对模型做LoRA微调彻底走通训练和评测闭环。跑通这三步之后你再看新论文会非常有底气。很多论文所谓的新方法本质就是改数据组织方式、改融合位置、改loss组成这三件事里的某几件。有了基线代码和固定评测集别人论文里的提升到底是真的还是刷出来的你上手一复现基本心里就有数。我自己在前两年就是靠这套方法筛选出了真正值得follow的方向避开了一堆华而不实的工作。就我个人而言现在每天刷到新论文的第一反应已经不是“这模型好厉害”而是“这条技术线对Reasoning Agent或者World Model有没有帮助”。读论文不该只为了追热点更要把它放到主线里去看位置。多模态领域变化确实快但骨架就在那里先融合再闭环决策最后学会预演物理世界。沿着这条线往下走大概率不会迷路。
返回列表