PYTHON+AI LLM DAY ONE HUNDRED AND TWENTY
今天聊聊BLIP3:BLIP-3 是 Salesforce AI Research 联合华盛顿大学等机构推出的新一代多模态大模型框架(也被称为 xGen-MM)。随着技术的发展,BLIP-3 已经从一个单纯的图像理解模型,演进为包含视频理解、原生图像生成等能力的统一多模态模型家族。基础架构革新:xGen-MM (BLIP-3).作为 BLIP-3 的基础版本,xGen-MM 在架构和训练流程上进行了大幅简化与优化:轻量化视觉采样器:摒弃了 BLIP-2 中复杂的 Q-Former 架构,采用更具可扩展性的感知器重采样器(Perceiver Resampler)。该结构通过单层注意力机制,将视觉 Token 高效降采样,大幅降低了大规模训练的计算障碍。底层语言模型:采用phi3-mini作为预训练的大型语言模型,结合感知器重采样器,使整个模型参数量保持在轻量级的 4B 左右。统一自回归损失:简化了训练目标,专注于多模态上下文中文本 Token 的自回归损失(Language Modeling),实现视觉与语言标记的无缝整合。动态高分辨率编码:引入分块编码策略,在保持图像高分辨率的同时减少视觉 Token 序列长度,增强了模型对富含文本图像(如 OCR 任务)的处理能力。视频理解拓展:BLIP-3-Video为了高效处理视频中的时序信息,BLIP-3-Video 引入了创新的时序压缩算法:时序编码器(Temporal Encoder):在传统视觉 Tokenizer 的基础上,增加了时序编码器(如可学习的时池化或 Token Turing Machines)。极致 Token 压缩:能够将多帧视频的时序信息映射为极其紧凑的视觉 Token 集合(例如仅用 32 个 Token 即可代表一段视频),在保持与 34B 级别大模型相当的问答准确率的同时,极大地降低了显存占用与计算开销。 原生图像生成:BLIP3-o 与 BLIP3o-NEXT.BLIP3-o 将模型能力从“图像理解”拓展到了“原生图像生成与编辑”,其核心算法设计如下:自回归 + 扩散(AR + Diffusion)混合架构:自回归模型负责理解指令并生成中间视觉特征(捕捉语义),随后扩散模型(Diffusion Model)基于这些特征生成高保真图像像素。CLIP 特征扩散:摒弃了传统的 VAE 像素级特征,采用 CLIP 模型将图像编码为语义丰富且紧凑的特征向量(固定为 64 维)。自回归模型预测 CLIP 特征,再由扩散解码器将其还原为真实图像,大幅提升了生成质量与多样性。流匹配损失(Flow Matching Loss):在训练扩散模型时采用流匹配损失函数,相比传统的 MSE 损失,能更好地捕捉图像特征的底层分布,使生成的图像具有更高的多样性。顺序预训练策略(Late Fusion):采用“先理解、后生成”的顺序训练。先训练图像理解能力,随后冻结自回归主干网络,仅训练扩散生成模块。这有效避免了联合训练中的任务冲突,保留了强大的图像理解能力。训练流程与安全对齐.BLIP-3 在训练配方上进行了精细的阶段划分:多阶段训练:涵盖大规模数据预训练、监督微调(SFT)、多图像微调以及后训练阶段6。DPO 安全对齐:在后训练阶段引入直接偏好优化(DPO),有效减轻了模型的幻觉问题,提升了事实准确性与输出安全性。总体而言,BLIP-3 算法的核心思想是“做减法与做融合”:通过感知器重采样和极致的视频 Token 压缩降低计算复杂度,同时通过 AR+Diffusion 的架构将理解与生成能力完美统一.