ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

统一多模态大模型的自回归统一表示:离散图像 Token 与连续嵌入的融合

统一多模态大模型的自回归统一表示:离散图像 Token 与连续嵌入的融合 统一多模态大模型的自回归统一表示离散图像 Token 与连续嵌入的融合在多模态人工智能的演进长河中大多数早期的多模态大模型如 LLaVA、BLIP-2本质上属于**“单向外挂式架构”**它们依赖一个独立的冻结视觉编码器CLIP/SigLIP提取连续的视觉特征通过线性投影层将图像作为前缀注入语言模型。这种架构存在着不可逾越的单向性缺陷——模型只能“看图写字Understanding”却无法在自回归因果流中原生实现“图文交织混合生成Interleaved Generation”与“以文生图Text-to-Image Synthesis”。以 Meta 的Chameleon、字节跳动与新加坡国立大学的Show-o以及Emu3为代表的原生全模态大模型彻底重构了多模态的底层表示逻辑通过将图像、音频与文本全部映射为统一离散词表空间中的 Token 序列并在一个纯粹的单一 Transformer 骨干中执行无差别的 Next-Token Prediction 自回归训练实现了多模态理解与多模态生成的终极大一统一、从外挂特征到统一离散词表的架构跃迁[外挂适配架构 vs 原生统一全模态自回归架构] 1. 经典外挂适配架构 (LLaVA 流派): 图像 ── [ 冻结 ViT ] ── 连续向量 ── [ 适配投影层 ] ── 注入 LLM ── 仅能输出文本 Token - 痛点: 无法原生生成图像图文模态表征割裂。 2. 原生统一全模态架构 (Chameleon / Show-o 流派): 文本 ── [ BPE Tokenizer (128k 词表) ] ──┐ ├── 【统一共享超大词表 V_unified (136k 槽位)】 图像 ── [ VQ-VAE 离散量化 (8k 码本) ] ──┘ │ ▼ 【单一 Transformer 骨干 (Single Transformer Backbone)】 无差别执行自回归因果预测: 既能自回归生成文本又能自回归绘制 1024 个图像 Patch Tokens!二、图像离散化与双向因果混合掩码Block-Causal Mask图像离散分词Vector Quantization, VQ-VAE将一张 $512 \times 512$ 的连续图像通过量化码本Codebook Size $K 8192$压缩为 $32 \times 32 1024$ 个离散整型 Token ID$$\mathbf{T}{\text{image}} [t_1, t_2, \dots, t{1024}], \quad t_i \in {0, 1, \dots, 8191}$$块级双向因果注意力掩码Block-Causal Masking在文本流上保持严格的因果下三角掩码Causal Mask每个词只能看历史在属于同一张图像的 1024 个 Token 内部启用全双向自注意力Bidirectional Attention让像素之间充分交互空间上下文在跨模态交织时维持全局宏观因果流向。三、统一多模态自回归损失函数全网络在海量图文交织语料库上共享同一个极简的负对数似然NLL目标$$\mathcal{L}{\text{omni}}(\theta) - \sum{i1}^N \log P_\theta\left( u_i \mid u_{i} \right), \quad u_i \in \mathcal{V}_{\text{unified}}$$无论当前时间步生成的是一个汉字 Token、一个英文单词还是图像中的一个像素网格码本索引优化器在底层执行完全相同的 Cross-Entropy 交叉熵更新四、PyTorch 代码实战统一离散多模态自回归生成骨架实现以下代码完整构建了一个原生支持图文离散 Token 混合输入与统一自回归生成的单模型骨架。import torch import torch.nn as nn import torch.nn.functional as F class UnifiedOmniModalTransformer(nn.Module): def __init__(self, text_vocab_size: int 1000, image_codebook_size: int 500, d_model: int 64): super().__init__() self.text_vocab_size text_vocab_size self.image_codebook_size image_codebook_size self.total_vocab text_vocab_size image_codebook_size # 统一词嵌入层: 前 1000 为文本后 500 为图像码本 self.unified_embedding nn.Embedding(self.total_vocab, d_model) # 统一 Transformer Block self.transformer_layer nn.TransformerEncoderLayer( d_modeld_model, nhead4, dim_feedforwardd_model*2, batch_firstTrue ) # 统一输出预测头 self.lm_head nn.Linear(d_model, self.total_vocab, biasFalse) def forward(self, input_ids: torch.Tensor) - torch.Tensor: :param input_ids: [B, L] 包含文本与图像混合离散 ID :return: logits: [B, L, TotalVocab] B, L input_ids.shape # 构造因果因果掩码 causal_mask nn.Transformer.generate_square_subsequent_mask(L, deviceinput_ids.device) # 统一词嵌入 h self.unified_embedding(input_ids) # 统一前向自注意力 h_out self.transformer_layer(h, maskcausal_mask, is_causalTrue) # 输出全词表 Logits logits self.lm_head(h_out) return logits if __name__ __main__: torch.manual_seed(42) B, D 1, 64 V_text 1000 V_img 500 model UnifiedOmniModalTransformer(text_vocab_sizeV_text, image_codebook_sizeV_img, d_modelD) # 模拟构建一条图文交织因果序列: # 文本: 画一只猫: (Token IDs: [101, 102, 103]) # 图像: 4 个离散 Patch (Token IDs: [1000 12, 1000 45, 1000 88, 1000 99]) # 文本: 生成完毕。 (Token IDs: [201, 202]) text_prefix [101, 102, 103] img_tokens [1000 12, 1000 45, 1000 88, 1000 99] text_suffix [201, 202] interleaved_sequence torch.tensor([text_prefix img_tokens text_suffix]) logits model(interleaved_sequence) print( 统一多模态自回归大模型测试 ) print(f总统一词表容量: {model.total_vocab} (包含 {V_text} 文本词汇 {V_img} 图像离散码本)) print(f输入交织序列长度: {interleaved_sequence.shape[1]} Tokens (文本与图像无缝混编)) print(f输出 Logits 形状: {logits.shape}) print(✅ 单一网络原生实现文本生成文本、文本生成图像、图像生成文本的大一统) print()四、未来多模态演进公理统一自回归全模态架构彻底终结了“理解模型与生成模型各自为战”的碎片化时代。在未来的通用智能体系中文本、图像、视频与音频都只是不同物理频率的离散 Token 序列单一因果自回归模型将成为融合物理世界全部感知与表达的终极底座。
返回列表