
目录一、CLM和MLM1、CLMCausal Language Modeling2、MLMMasked Language Modeling二、GLM的自回归空白填充方法一基础概念二GLM的自回归空白填充方法三现在的ChatGLM / GLM模型预训练语言模型预训练语言模型通过在大规模无监督文本数据上进行训练学习语言的语法和语义信息。然后可以将预训练得到的模型应用于各种下游任务如文本分类、问答系统等以提高模型的性能。自编码模型与自回归模型自编码模型如BERT使用双向上下文信息通过重建被遮蔽的输入来学习语言表示双向性可以同时利用左侧和右侧的上下文信息信息泄露问题在训练过程中模型可以看到被遮蔽词的未来信息这在生成任务中不适用自回归模型如GPT使用单向上下文信息基于前面的词预测下一个词一、CLM和MLM1、CLMCausal Language ModelingCLM是因果语言建模训练模型预测一句话中的下一个词每个词只能利用它前面的上下文信息。应用用于生成任务例如GPT模型模型按顺序生成句子的每一个单词或字符训练方式在训练过程中模型只能看到到当前单词之前的所有词不能看到之后的词。属于一种自回归模型。2、MLMMasked Language ModelingMLM是掩码语言建模训练模型预测在一个句子中被随机掩盖masked的词。模型可以使用整个句子的上下文包括掩盖词的前后内容。应用用于表示学习任务例如BERT模型帮助模型更好地理解整个句子的语义训练方式在训练过程中句子中的一些词会被随机掩盖模型的任务是根据其余词来预测被掩盖的词。是一种双向建模。二、GLM的自回归空白填充方法一基础概念GLM 的自回归空白填充方法是在输入序列中引入空白让模型以自回归的方式逐步填充这些空白。自回归填充模型以自左向右的方式逐步预测并填充空白统一的生成和理解同时适用于自然语言理解和生成任务GLM的自回归空白填充方法与BERT中的使用遮蔽语言模型MLM的区别对比维度BERTMLMGLM自回归空白填充训练目标重建被遮蔽的词训练目标是最大化被遮蔽词的概率预测空白处的词序列训练目标是最大化空白填充序列的概率上下文利用利用双向上下文但存在信息泄露的问题以自回归方式填充避免了信息泄露应用范围主要用于理解任务如文本分类、问答匹配等兼顾理解和生成任务如机器翻译、文本摘要等二GLM的自回归空白填充方法GLM范式训练时上下文双向 空白单向推理时统一单向自回归在GLM的预训练阶段注意力不是全局双向的而是分区域、分角色的被遮住的空白片段【Part B】这部分是单向的。预测第一个空白 token 时只能看上下文预测第二个空白 token 时能看到上下文和第一个已生成的空白 token以此类推是标准的自回归没被遮住的上下文【Part A】这部分内部的token可以互双向可见就像BERT一样用来充分理解上下文。三现在的ChatGLM / GLM模型“ChatGLM系列模型也仅在第一代模型使用了GLM的预训练思想从ChatGLM2开始还是回归了传统的CLM建模。 在ChatGLM2中模型架构就基本回归了LLaMA架构预训练任务也回归经典的CLM放弃了GLM的失败尝试。”GLM 的初衷用“填空”统一理解与生成GLM 范式诞生于 BERT 和 GPT 分庭抗礼的时代。它的设计目标非常明确打破理解双向与生成单向的壁垒用一个模型同时干好两件事。让位的原因CLM 的“规模暴力”碾压了“结构精巧”进入 LLM 时代后评价标准变成了“在万亿级 Token 和千亿级参数下谁能更高效地 Scaling”。GLM 范式在这个阶段暴露出了几个关键劣势训练效率与工程复杂度GLM 的自回归空白填充需要处理变长空白、二维位置编码以及复杂的注意力掩码Part A 双向、Part B 单向。当模型规模飙升至千亿参数时这种复杂性的工程代价急剧放大。相比之下CLM 的“Next Token Prediction”目标极其简单、稳定且对硬件和并行策略极其友好更容易 Scale 到超大规模CLM 在规模下“理解能力”的追平GLM 的核心卖点是用双向注意力获得更好的理解能力。但实践证明当 CLM 的模型规模和训练数据达到一定程度时它在文本理解任务上也能具备甚至超越同等规模双向模型的能力。既然单纯的“大力出奇迹”就能解决理解问题GLM 为了兼顾理解而牺牲的“生成效率”就显得不那么划算了生成效率的损失GLM 的“自回归空白填充”在生成任务上需要模型在一遍前向传播中同时处理可见的 Context 和不可见的空白部分其计算模式不如纯 CLM 的 Decoder-only 架构在自回归生成时那样直接和高效。