ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI Agent_8 AI 大模型多模态

AI Agent_8 AI 大模型多模态 一、什么是多模态先建立直觉模态Modality 信息的 种类或渠道文字、图片、声音、视频、3D 模型、传感器数据…… 都是不同的模态。单模态 AI只能处理一种信号如纯文本聊天、纯语音识别。多模态 AI能同时 看 听 读 说还能让这些信息互相印证。示例你拍了一张电饭煲面板的照片问 这个 预约 键怎么用—— 模型需要同时理解图片里的按钮布局视觉、面板上的字OCR、你的问题文本再给出带语音的回答。这就是典型的多模态任务。为什么多模态是必然趋势人类理解世界本来就是多模态的 —— 我们同时用眼睛、耳朵、语言。一个只能读字的 AI永远理解不了 这张照片里的笑容只有多模态AI 才能处理真实世界的任务。维度单模态模型多模态模型输入一种多为文本文本 图像 音频 视频……理解深度只能 读能 看、听、读、说 并互证典型例子GPT-3纯文本GPT-4V、Gemini、豆包多模态版、Qwen-VL二、核心思想万物皆可 向量化多模态最难的问题图像是像素矩阵、语音是波形、文字是符号 —— 它们 长相 完全不同怎么放进同一个模型答案是把每一种模态都 翻译 成模型共同的语言 ——token 向量。下面这张图展示多模态大模型的统一架构各模态怎么 翻译 成向量这是关键模态翻译方式产物文本BPE 分词 → 查表得向量文本 token 序列图像切成 16×16 小块patch→ 每个 patch 经 ViT 变向量 位置信息视觉 token 序列音频波形 → 梅尔频谱 → 声学编码器或用码本量化成 声音 token声学 token 序列视频抽帧 → 每帧按图像处理 时间位置编码时空 token 序列两种主流架构路线图里是通用示意实际实现分两派编码器 - LLM 型如 LLaVA、早期 GPT-4V 方案用现成视觉编码器提取图像向量过一层投影层Projector映射进文本向量空间然后拼接进 LLM—— 优点是复用成熟 LLM训练轻。原生多模态型如 Gemini、Qwen-VL、豆包多模态把图像、音频也离散化成 token和文本 token 一起从零统一预训练 —— 模态融合更彻底但训练成本高。三、核心机制一跨模态注意力Cross-Attention多模态模型最关键的机制就是让一种模态的 token 去 注意 另一种模态的 token。示例图文问答深化你上传一张 草地上三只猫 的照片问 图里有几只猫图像被切成 patch变成一串视觉 token问题文本变成几个文本 token两者拼接成一条长序列进入 Transformer跨模态注意力让问题里的 猫 这个 token主动去 关注 图像里所有 像猫的区域 的视觉 token—— 模型实际上是在 数 那些被高亮关注的区域然后回答 三只。机理解释这和上一讲 Transformer 的自注意力是同一个机制只是 参与投票的 token 来自不同模态。正因为图像 token 和文本 token 在同一个注意力空间里模型才能做 图文互证—— 比如你问 这个按钮是什么颜色它能定位到图中按钮区域再回答。实际价值细节问答数物体、认颜色、读 OCR、图表理解这个季度增长了多少、医疗影像初筛这里有没有结节。四、核心机制二对比学习CLIP—— 多模态的 对齐训练有了架构还不够 ——模型怎么知道 图像里的猫 和 文字里的猫 是同一个概念答案是一种叫对比学习Contrastive Learning的训练方式最经典的实现是 OpenAI 的CLIP机制逐条解释双编码器图像进图像编码器得到向量i₁、i₂文本进文本编码器得到向量t₁、t₂。相似度计算把每个图像向量和每个文本向量算余弦相似度得到矩阵。训练开始时数值是随机的。对比损失训练目标非常巧妙 ——把对角线配对的图 - 文分数拉高把非对角线不配对的图 - 文分数压低。模型为了 完成作业被迫学会把 猫的照片的向量 和 猫的文字的向量 在空间里挪到相近位置。规模CLIP 用 4 亿个图文对做这件事。当 猫 这个词对应的向量和所有 猫 的图片对应的向量在空间里聚成一团模型就有了跨模态理解。示例零样本图像分类—— 给 CLIP 一张猫的照片再给它候选文字 猫 / 狗 / 汽车它分别算相似度选最高的 猫。它没见过任何一张带 猫 标签的训练图全靠图文对齐就完成了分类。实际价值以图搜图 / 以文搜图、训练数据清洗筛掉图文不匹配的样本、文生图模型的前置Stable Diffusion 就用 CLIP 的文本编码器把文字 翻译 成条件向量。五、任务谱系多模态能做什么任务输入 → 输出一句话机理图像描述图 → 文视觉 token 作前缀LLM 续写描述图 1 的架构图文问答 VQA图 问 → 答跨模态注意力让问题定位图中区域文生图文 → 图扩散模型从噪声逐步 去噪 出图图生视频文 / 图 → 视频时空 patch 时序扩散语音对话语音 / 文本 ↔ 语音声音 token 化后进 LLM输出再合成语音视频理解视频 问 → 答抽帧 时间位置编码逐帧理解多模态 Agent拍照 / 说话 → 操作感知层多模态输入→ 工具调用前几讲的完整链路图文检索图 ↔ 文CLIP 向量相似度下面挑四个最有代表性的展开讲。示例 1文生图扩散模型——画一只戴帽子的柴犬机理扩散模型分两个方向 ——训练阶段加噪拿真实图片一步步往里面加随机噪声直到变成纯雪花点。模型学习的是逆向过程给一张 更糊 的图预测 刚才的噪声是什么从而还原一步。生成阶段去噪从一张纯噪声图出发模型结合文字条件戴帽子的柴犬一步一步把噪声 擦掉几十步后得到清晰图片。文字怎么控制画面文字经编码器变成条件向量在每一步去噪时通过交叉注意力注入 —— 模型 看着文字决定往哪个方向擦噪声于是画出了符合描述的构图和元素。实际价值设计稿、电商图、插画、配图几秒出一张是内容创作的效率革命。示例 2图生视频Sora 类模型机理把视频看成 随时间变化的图像序列—— 抽帧后每帧切成 patch加上时间位置编码第 1 帧、第 2 帧……变成 时空 token再用扩散模型逐帧去噪并保证相邻帧的连续性一致性由时间维度的注意力保证。模型学的是 一个画面如何合理地动起来。示例 3语音多模态语音对话助手机理传统 ASR 是把语音转文字再交给 LLM新一代语音模型更进一步 —— 用码本量化把声音直接离散化成 声音 token类似文字的 token和文本 token 一起进 LLM。这样模型能直接 听 语调、语气、情绪回答时再通过声码器合成语音。示例你对语音助手说一句带情绪的 我太累了它能听出疲惫并给出安慰式的语气回复 —— 纯文本管道做不到这一点。示例 4多模态 Agent拍照办事机理把前三讲串起来 ——Agent 的 感知层 就是多模态组件拍照图像 token→ OCR 认字视觉理解→ 理解意图LLM→ 调用工具如 搜索这款产品价格→ 执行反馈。示例你拍一张路由器故障灯照片Agent 认出红灯闪烁检索说明书告诉你 重置方法甚至直接打开设置页教你操作。六、训练范式多模态大模型是怎么炼成的和上一讲 LLM 的三阶段类似多模态模型通常走四步模态对齐用海量 图文对 / 音文对 做对比学习CLIP 式—— 让不同模态 对上暗号。也可以在这一步训练投影层LLaVA 式冻结视觉编码器和 LLM只训投影层成本极低。统一生成式预训练把文本 图像 音频都当作 下一个 token 预测 来做图像被离散化成 token模型学会 看图续写、听声续写。指令微调用多模态对话数据训练看这张图回答……学会按要求完成任务。人类反馈对齐多模态 RLHF—— 人类对 回答是否符合图片内容 / 是否安全 排序让模型更准确、更安全。数据与成本示意多模态数据图文对、视频获取比纯文本贵标注成本高训练一个多模态大模型通常比同规模纯文本模型需要更多算力视觉 token 数量大。七、挑战与局限新手必看视觉幻觉模型会 看到 图里没有的东西或数错物体 —— 示例问 图里有几只鸟模型可能一本正经说 三只 其实是两只。原因和文本幻觉一样模型在 编最像样的答案没有真正的视觉校验。细节与 OCR 错误小字识别、密集图表、遮挡物容易出错。视频的时空一致性长视频中物体容易 变形、消失又出现动作物理不真实。对齐不完美CLIP 式的对齐是 粗粒度 的知道 猫 对应猫但分不清 左边那只还是右边那只跨语言、跨文化语义也可能错位。数据、算力与安全多模态数据采集成本高深度伪造换脸、合成语音带来滥用风险隐私照片、录音保护压力更大。一句话总结多模态大模型 各模态的 翻译官编码器 一个 联合大脑Transformer靠投影层 / 离散 token统一表示靠跨模态注意力互相参考靠对比学习让不同模态 对上暗号它让 AI 真正 会看、会听、会说也是 AI Agent 感知层和文生图 / 文生视频等一切多模态应用的技术底座。
返回列表