
AI技术总监级拆解大模型第11讲Tokenizer、语言模型与 GPT为什么“预测下一个 Token”足够强AI 学习系列第11讲 / 共26讲第10讲已经讲清楚 Transformer这一讲把它真正接到 GPT原始文本 → Tokenizer → Token ID → Embedding → Transformer → Logits → 概率 → 下一个 Token真正要回答的是GPT 到底怎样把人类文字变成数字、再一步一步生成下一段文字01模型不能直接吃文字人看到人工智能正在改变世界模型先要把它转换成可计算的离散单位TokenToken 不一定等于一个字也不一定等于一个词可能是汉字、英文单词的一部分、标点或特殊符号。所以文本 ↓ Tokenizer ↓ Token ↓ Token ID02为什么不用“整词”分词如果词表只收完整单词遇到新词、拼写错误、生僻词就容易出现 OOV。因此现代 Tokenizer 往往采用 Subword、Byte-level 等更细粒度方法常见部分 → 尽量合并 陌生部分 → 继续拆分核心目标在词表大小、文本覆盖率和 Token 长度之间取得工程平衡。BPE、Byte-level BPE、SentencePiece 不要混为一谈BPE一种子词合并算法。Byte-level BPE以字节级单元作为更稳健的基础表示。SentencePieceTokenizer 工具/框架可实现 BPE、Unigram 等方法。03Token ID 是什么假设我 → 101 喜 → 205 欢 → 307 AI → 88得到[101,205,307,88]这些数字通常只是词表索引。101并不比88“更有 AI 语义”。因此Token ID ≠ EmbeddingToken ID 只是定位 Embedding Table 某一行。04Token ID 怎么变成向量Embedding Table[E\in\mathbb{R}^{V\times D}]Token ID 为 (i) 时[e_iE[i]]所以Token ID ↓ Embedding Table ↓ 向量批量输入若为[B,T]Embedding 后通常为[B,T,D]05Tokenizer 为什么会影响模型成本Tokenizer 直接影响Token 数量 ↓ 序列长度 ↓ 计算量 ↓ 显存与延迟 ↓ 推理成本同一句话如果一个 Tokenizer 切成 20 个 Token另一个切成 35 个 Token后者序列更长Attention 等计算的压力也会更大。所以 Tokenizer 不是简单的切词工具而是模型输入空间的重要工程设计。06进入语言模型Transformer 输出隐藏表示后会经过语言模型头得到Logits例如猫2.1 狗1.2 鸟0.3再通过[P(x_i)\frac{e^{z_i}}{\sum_j e^{z_j}}]得到概率。所以Hidden State ↓ Logits ↓ Softmax ↓ Next Token Probability07GPT 的核心预测下一个 Token给人工智能正在预测世界数学形式[P(x_t\mid x_{t})]也就是给定前面的 Token预测下一个 Token。训练前文 ↓ 预测下一个 Token ↓ 和真实 Token 比较 ↓ Loss ↓ Backward ↓ Optimizer ↓ 参数更新08为什么这么简单的目标能产生复杂能力因为现实数据并不是随机 Token。代码有语法 变量 函数 控制流 上下文文本有语法 术语 上下文 概念关系为了不断提高“下一 Token”预测准确率模型就必须学习这些结构。因此训练目标很简单不代表完成目标所需要的内部表示很简单。但要注意预测能力形成复杂表示不等于已经证明模型拥有与人类完全相同的理解机制。09为什么不需要人工给每个 Token 写标签一段文本x1 x2 x3 x4 x5可以自动生成输入 x1 x2 x3 x4 目标 x2 x3 x4 x5因此海量文本、代码、文档都可以自动产生监督信号。这就是自回归语言模型非常强的工程优势。10从概率角度看训练目标联合概率[P(x_1,\ldots,x_n)\prod_{t1}^{n}P(x_t\mid x_{t})]取对数[\log P(x_1,\ldots,x_n)\sum_t\log P(x_t\mid x_{t})]于是常见训练目标[L-\sum_t\log P(x_t\mid x_{t})]这就是语言模型中的 NLL / Cross-Entropy 思想。如果正确 Token 的预测概率高Loss 小概率低Loss 大。11GPT 是怎么生成文字的例如人工智能正在 ↓ 预测下一 Token ↓ 世界 ↓ 人工智能正在世界 ↓ 再次预测 ↓ ……即已有上下文 ↓ Transformer ↓ Logits ↓ 概率 ↓ 选一个 Token ↓ 追加 ↓ 继续这叫Autoregressive Generation自回归生成。训练和生成不要混淆训练预测 → Loss → Backward → 更新参数 生成预测 → 选择 Token → 追加 → 再预测12把整条 GPT 数据流串起来原始文本 ↓ Tokenizer ↓ Token IDs ↓ Embedding ↓ Position Information ↓ Transformer ↓ Hidden States ↓ LM Head ↓ Logits ↓ Softmax ↓ 下一个 Token ↓ 继续生成13本讲真正必须记住的 8 件事1. Token 是模型处理的离散文本单元。 2. Token ID 通常只是词表索引。 3. Embedding 把 Token ID 变成向量。 4. Transformer 建模上下文。 5. LM Head 把隐藏表示变成词表分数。 6. Softmax 把分数变成概率。 7. GPT 的核心训练目标是预测下一个 Token。 8. 生成就是“预测 → 追加 → 再预测”。14一句话吃透第11讲Tokenizer 把文字变成 TokenEmbedding 把 Token 变成向量Transformer 建模上下文Logits → Softmax 给出下一个 Token 的概率模型不断用这个简单而统一的目标训练海量数据最终形成强大的语言建模能力。下一讲第12讲GPT-2、GPT-3 与 In-Context Learning规模为什么开始改变能力边界