ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

权重绑定深度语言模型:深度缩放、免费早退与一个基本权衡

权重绑定深度语言模型:深度缩放、免费早退与一个基本权衡 Tied-Depth Language Models: Depth Scaling, Free Early Exit, and a Fundamental Trade-off草稿 v2 | 2026-09-29 | 基于 DEQ-LM v1→v11 十一个版本、7.27M/23M 两个规模、约 18 小时 GPU 实验摘要权重绑定迭代块同一 Transformer 块反复应用 k 次承诺测试时深度缩放与按输入自适应计算。我们在 23M 语言模型上系统验证了这些承诺得到一个此前未被报道的基本权衡单深度训练使模型呈现强深度缩放k1→30: NLL 6.27→4.36但任何置信度早退都灾难性失败中间深度自信但错误多深度监督使早退完全免费k1 退出仅损 0.04 NLL但深度缩放消失k1 即达近最优。两者不可兼得且该定律跨规模7M→23M成立。进一步(a) 等参数 2×2 对照{绑定,纯堆}×{全反传,phantom}给出干净的因果分解——绑定架构三连胜PT 与 SFT 的全部三项指标均小幅优于纯堆层推翻 ALBERT共享负债在本设定的适用而 1 步 Phantom 反向在短视界1000 步看似无损、长视界39,695 步欠拟合 1.36 NLL尽管它省 46% 显存(b) 我们发现既有 30M 基准的后缀评测位置61.6% 是 padding——按真实 token 重排后冠军模型NLL 2.78实际垫底7.17而被判发散垃圾的模型15.2实际第二4.10© 绑定块从不收敛到不动点残差范数作为不确定性探针仅有弱信号r0.27~0.39。最终最优 23M 模型为 v11绑定全反传 PTSFT含pad 1.155 / 真实 2.915生成质量定性最优。1. 引言深度自适应计算的经典路线有三ACTGraves 2016、Universal TransformerDehghani 2019、DEQBai 2019。它们共同假设更多迭代 → 更好质量且模型应学会简单输入少想。我们在一个小而完整的 LM 测试床minimindvocab 230057M/23M全量 PT 39,695 步上重新审视这些假设发现深度缩放是真的——但它是训练机制的产物§4.1免费早退是可以的——但代价是深度价值§4.2两者在两个规模上均不可兼得§4.3, 定律评测基准本身可能被 padding 主导§5绑定架构无罪且小幅占优Phantom 是长程负债§5.5, 2×2 因果分解2. 架构三明治embpos → LN → 2×标准层 → [权重绑定块 ×k, z ← z α·Block(z)] → 2×标准层 → LN → head Block pre-norm causal attention SwiGLU, α 可学习标量 (sigmoid 参数化, init 0.1)7.27M (d128) / 23.05M (d320)。训练默认 k30单深度多深度变体在 k∈{1,2,4,8,16,30} 全部施加监督。3. 反向传播1 步 Phantom前向 no_grad 迭代 k 次至 z*反向梯度仅穿过一步图 z₁z₀α·f(z₀)。短视界实测23M, B32, L256, k30, 1000 步普通反传Phantom峰值显存6.45 GB3.50 GB (−46%)1000 步 val NLL4.8374.869 (0.032)步时143 ms69 ms (−52%)普通反传显存随 k 线性增长Phantom 恒定k 越大优势越大。⚠ 长视界警告§5.5 2×2 的关键教训上述 1000 步结论是视界假象。在完整 39,695 步 PT 上同架构下 phantom 比全反传差1.36 NLL3.867 vs 2.508——1 步梯度近似在早期足够、长程严重欠拟合。本文 v7/v8phantom 训练与 v10/v11全反传训练的全部差距来源于此。近似梯度的显存优势必须在完整训练视界上验证质量。4. 核心发现权衡定律4.1 深度缩放存在单深度训练k124816307M 单深度6.276.005.504.864.434.3623M 单深度5.665.455.114.634.294.2523M 单深度全量 39,695 步Phantom~10~10~10~109.714.24深度单调换质量随规模增强每个 k 点 23M 均优于 7M但长训练Phantom 将深度依赖推向极端k16 接近随机NLL≈10ln|V|轨迹只在第 30 步落地4.2 事后置信度早退失败多深度监督使其免费事后 maxprob 早退v3未训练早退τavg_kNLL0.4012.15.980.9526.76.21(统一 k16)16.04.43逐位置早退全面劣于统一深度中间深度的 logits自信但错误——max-softmax 概率在 k≈8 饱和而预测质量到 k≈30 才到位。“输出置信 ≠ 输出质量”。多深度监督v4/v6k∈{1,2,4,8,16,30} 全部算 loss训练k1k30早退τ0, 全部 k1 退出7M 单深度6.274.36不可能6.21k̄26.77M 多深度4.404.384.40090.03 免费23M 单深度5.664.25不可能23M 多深度4.304.264.2980.04 免费4.3 权衡定律深度缩放与免费早退不可兼得。深度缩放只在模型被允许仅在最深处监督依赖深度时出现被强制在所有深度都好之后一次迭代即可达到近最优——说明迭代的深度并不携带一步无法携带的信息此前测得的深度缩放是计算路由的伪影而非信息的串行精化。该定律在 7M 与 23M 上一致成立v3↔v4, v5↔v6 对照且多深度监督不损失质量上限4.251 两边一致7M 上甚至略升 4.36→4.34。对文献的含义任何报告权重绑定深度缩放的工作若未含多深度对照其深度缩放主张不成立任何报告 ACT/早退的工作若未含单深度对照则未展示其放弃的深度价值。5. 基准的 padding 主导问题既有 30M 对比基准suffix NLL预测 x[193:256]中61.6% 的评测位置是 paddingtoken 0。含 pad 与仅真实 token 的排名完全反转模型含 pad仅真实 tokenCEDLR-Hybrid2-30M SFT“2.78 冠军”2.7827.173垫底Meta-ASH-30M PT“15.2 发散垃圾”15.2424.099第二本文 DEQ-LM 23M PTk3015.6813.867第一CEDLR 的训练目标含 pad 后缀 → 学会大量预测 token 0 → 含 pad 口径虚高Meta-ASH 与 DEQ-LM 以 ignore_index0 训练 → pad 位置未定义NLL 15→ 含 pad 口径被冤枉SFT在含 pad 目标上微调使 Meta-ASH 真实 token NLL 从 4.10 退化到 4.73灾难性遗忘文本、学会 pad教训序列填充占评测位置 5% 时必须报告掩码口径否则基准测的是填充预测器。协议差异已注明CEDLR 为 192 前缀SWA-32 窗解码DEQ-LM/Meta 为全因果注意力任务难度不完全等价。5.5 等参数纯 Transformer 对照关键控制实验v9设置5 层普通 Transformer无绑定块23.05M 参数精确对齐v8同数据、同 PT 39,695 步、同 SFT 28,304 步、同评测。模型 (23.05M)含 pad NLL真实 token NLLv9 纯 5 层 PTSFT1.1672.940v8 绑定深度 PTSFT230×tied21.6284.066v9 纯 5 层 PTSFT 前9.9652.536v7 绑定深度 PTk3015.6813.867v9 对照的初步结论后被 v10/v11 修正见下方 2×2纯堆层在两个口径上大幅领先 phantom 训练的绑定模型真实 token 2.536 vs 3.867——初步指向绑定是负债与 ALBERT 一致v8 的双指标冠军确认为缺少等参数对照的假象其优势来自全注意力协议与训练充分度但该结论混淆了绑定与phantom两个变量——v7/v8 都是 phantom 训练的归因不干净需要 2×2 分解2×2 分解绑定 vs 纯堆 × Phantom vs 全反传39,695 步真实 token NLL全反传Phantom纯堆 5 层2.536 (v9)—绑定 230×tied22.508 (v10)3.867 (v7)分解结论三段式反转的最终版绑定无罪且小幅占优tied全反传 (2.508) 略优于纯堆 (2.536)——三明治设计下跨层共享不损失质量区别于 ALBERT 单体共享的负债结论可能因三明治保留异构外层绑定块仅占中层Phantom 是真凶tiedphantom (3.867) 比 tied全反传 (2.508) 差1.36 NLL——1 步梯度近似在短视界1000 步 memtest 差距仅 0.03看似无损长程训练严重欠拟合v8/v7 的全部劣势来自训练方法而非架构v8 对 CEDLR 的胜利则来自全注意力协议而非绑定2×5.5 多明治扩展v12/v13循环内多样性检验如果单段循环的优势瓶颈是一个函数重复 30 次缺乏多样性则把循环拆成多个不同函数应更好。结构参数均精确对齐 23.05M全反传 39,695 步循环函数数模型真实 token NLL增量0v9 纯 5 层 [std×5]2.536—1v10 [std×2][A×30][std×2]2.508−0.0282v12 [std][A×15][std][B×15][std]2.4994−0.0093v13 [std][A×10][B×10][C×10][std]2.4922−0.0074v14 [std][A×8][B×8][C×7][D×7]2.51400.022 ↩️结论多样性收益在 3 段达峰后回落——v14 (4 段) 甚至差于 v10 (1 段)。两个归因混淆已注明① v14 无后桥 std输出侧异构层比第 4 个循环函数重要② 每段仅 7-8 次迭代不足——v14 末段 α 膨胀到 0.261其他段 0.07-0.15被迫迈大步补偿循环语义退化为普通层最优配置是三段×10v13多样性 × 每段足够迭代的平衡点α 角色分化v12 (0.057/0.092)v13 (0.059/0.072/0.126)——循环自发学出精化型/中间型/主力型分工排序逻辑最终版有效深度~33 层是主菜循环内多样性是调料适量即止3 种最佳输出侧异构桥不可省SFT 后优势保持v13SFT (1.1429/2.8802) 双指标胜 v11 (1.155/2.915) 与 v9S (1.167/2.940)——多明治三段是全流程双指标冠军v11v10 SFT28,304 步全反传将绑定优势锁定为三连胜同参数同协议同评测阶段 / 指标绑定全反传纯堆 5 层差距PT 真实 token2.508(v10)2.536 (v9)−0.028SFT 含pad1.155(v11)1.167 (v9-SFT)−0.012SFT 真实 token2.915(v11)2.940 (v9-SFT)−0.025幅度小0.01-0.03 NLL但三处方向一致——三明治绑定共享在等参数下是小幅一致净赢。另SFT 使真实 token 从 2.51→2.91 退化v10→v11v9 同样 2.54→2.94——网格 SFT 数据本身携带 ~0.4 真实 token 代价换取 pad 能力且污染生成§6.5v9-SFT 会 pad 刷屏v10 纯 PT 生成最流畅且从不输出 pad。方法论教训普适①近似梯度的显存优势必须在完整训练视界上验证质量短程 memtest 会严重误导②归因需要 2×2——没有 v9 会错误归功于绑定没有 v10 会错误归罪于绑定。6.5 定性生成对比2×2 结论的定性印证同提示同采样top-k50, top-p0.9, rep1.2, T1.0。第一轮v9/v10/v8提示v9 纯堆 SFTv10 绑定全反传 PTv8 phantom SFT“人工智能是”可理解但跑偏随后 pad 刷屏“如何改变我们生活的重要技术…应用于医疗、金融、工业等各个领域”词沙拉购物对话语境半连贯后话题出轨对话风格自然延续立即 pad 刷屏法语文本前缀中英混杂混乱自然转入连贯中文 QA 轮次乱码第二轮v13/v13S/v10 参照提示v13 三段 PT (2.4922)v13S 三段 SFTv10 单段 PT“人工智能是”“基于自然语言处理技术的智能系统…应用于医学、金融和交通”最具体准确跑偏到电影文化流畅但泛泛购物语境在题搜索/价格语境自然延续跑偏到汽车跑偏到阅读法语文本前缀先短暂延续法语再自然转中文最佳语码切换乱码无视法语直接转中文v13 PT 是全项目最佳生成器最在题、最具体、语码切换最自然——与 NLL 排名一致双重确认SFT 伤开放域生成v13S 与 v9S 均跑偏/乱码——网格 SFT 数据换 pad 能力的 ~0.4 真实 token 代价在生成端定性可见纯 PT 模型v10/v13从不输出 pad 且生成更稳v8 的 phantom 欠拟合 (1.36 NLL) 在生成中定性可见事实性错误仍存在23M PT 模型的预期水平6. 负结果与诚实边界主张结果绑定块收敛到不动点DEQ 语义✗ 相对残差恒 ~0.15/步30 步不收敛本架构实为绑定深度而非隐式模型残差范数不确定性△ r0.27~0.3923M 强于 7M但不构成可用探针事后 maxprob 早退✗ 灾难性失败§4.2深度缩放信息串行精化✗ 伪影§4.37. 相关工作ACT(Graves 2016)训练 halting本文证明事后置信 halt 不可行支持其必须训练立场Universal Transformer(Dehghani 2019)报告深度缩放无多深度对照——按 §4.3 其主张存疑DEQ(Bai 2019)、Phantom Gradient (Geng 2021)本文 phantom 实测 −46% 显存与其承诺一致ALBERT(Lan 2020)跨层参数共享损失性能本文三明治缓解早期退出CALM, Bert-shallow-deep 等层间异构退出本文为同块迭代退出权衡或更本质8. 局限23M/minimind 规模定律在 ≥1B 上未验证但 7M→23M 方向一致多深度监督只测了均匀 6 点curriculum 或加权变体可能部分恢复两者k30 上限更大 K 下定律外推未验证§5 跨模型比较含架构性协议差异窗注意力 vs 全注意力9. 结论绑定迭代块的语言模型存在一个此前未明的基本权衡深度缩放与免费早退互为代价因为深度缩放本身是训练伪影。等参数 2×2 对照链v7/v9/v10由 v11 收尾给出了干净的因果分解与最终裁决绑定架构无罪且小幅占优——v10tied全反传PT 真实 token 2.508 胜纯堆 v9 的 2.536v11v10SFT三连胜1.155/2.9151 步 Phantom 是唯一的真凶1.36 NLL 长程负债短程 memtest 无损是视界假象。在此基础上多明治扩展v12/v13证明循环内函数多样性带来持续递减但未饱和的增益0→1→2→3 个循环函数2.536/2.508/2.4994/2.4922α 自发分化为三种角色v13S三段循环 PTSFT1.1429/2.8802成为全流程双指标冠军。基准评测必须掩码 padding——否则排名反转61.6% 位置是填充时冠军与垫底互换。本文六条最终贡献权衡定律深度缩放 ↔ 免费早退不可兼得跨规模——UT/ACT 类工作的必要对照等参数 2×2三明治绑定共享三连胜异构堆叠区别于 ALBERT 单体共享的负债结论Phantom 长程警告−46% 显存的代价在 39,695 步才显现1.36 NLL——近似梯度必须全视界验证基准方法论padding 主导的排名反转——掩码口径必须成为标配多明治多样性定律循环内函数数 0→1→2→3 单调改善−0.028/−0.009/−0.007并在 3 段达峰第 4 段回落v14 过碎 丢后桥——三段×10 是甜点循环 α 自发分化为精化/中间/主力角色末段迭代不足时 α 膨胀退化最优 23M 全流程模型 v13S三段多明治 [std][A×10][B×10][C×10][std]含pad 1.1429 / 真实 2.8802 双指标冠军纯 PT 天花板 v132.4922——均远超既有 CEDLR (7.17)/Meta (4.10)附录 A版本对照版本配置关键数字v17M, h_deq 丢弃 bug4.394层对照v2谱范数低lr4.45容量受损v3修复k 扫描 6.27→4.36事后早退失败v4v3多深度k1 即 4.40早退免费v523M5.66→4.25探针 0.385v623M 多深度定律跨规模成立v723M Phantom 全量 39,695 步全序列 4.2385真实token 3.867v8v7SFT含pad 协议, 28,304 步, phantom含pad 1.628 / 真实 4.066v9等参数纯 5 层对照39,69528,304 步全反传PT 真实 2.536 / SFT 1.167/2.940v10绑定全反传对照39,695 步真实 2.508v11v10SFT28,304 步全反传含pad 1.155 / 真实 2.915全流程双指标冠军v12多明治双段[std][A×15][std][B×15][std]真实 2.4994α 分化 0.057/0.092v13多明治三段甜点[std][A×10][B×10][C×10][std]真实 2.4922PT 冠军α 0.059/0.072/0.126v13Sv13SFT1.1429/2.8802全流程双指标冠军v14多明治四段 [std][A×8][B×8][C×7][D×7]真实 2.5140 ↩️ 趋势回落过碎无后桥附录 A2终评矩阵最终完整版后缀 NLL 含pad / 真实token模型含pad NLL真实 token NLLv13S 多明治三段 PTSFT (23M)1.14292.8802v13 多明治三段 PT (23M)10.0622.4922v12 多明治双段 PT (23M)10.3792.4994v11 绑定全反传 PTSFT (23M)1.1552.915v9 纯 5 层 PTSFT (23M)1.1672.940v10 绑定全反传 PT (23M)9.8502.508v9 纯 5 层 PT9.9652.536v8 绑定phantom PTSFT1.6284.066CEDLR-Hybrid2-30M SFT2.7827.173CEDLR-Hybrid2-30M PT2.7857.185Meta-ASH-30M PT15.2424.099Meta-ASH-30M SFT14.5564.732v7 绑定phantom PT15.6813.867绑定架构三连胜同参数同协议PT 真实 token: v10 (2.508) v9 (2.536)SFT 含pad: v11 (1.155) v9-SFT (1.167)SFT 真实 token: v11 (2.915) v9-SFT (2.940)幅度小0.01-0.03 NLL但三处方向一致——三明治绑定共享在等参数下是小幅净赢区别于 ALBERT 单体共享的负债结论。另SFT 使真实 token 从 2.51→2.91 退化v10→v11, v9 同样 2.54→2.94——网格 SFT 数据本身携带 ~0.4 真实 token 代价换取 pad 能力。附录 B调试记录三个架构级 bugh_deq 计算后被丢弃——DEQ 块完全旁路k 扫描全同最隐蔽α 参数化sigmoid(0.1)0.525 ≠ 0.1须 logit 参数化exact_k 循环计数写反附录 C复现python deqlm_v3.py / deqlm_v4_multidepth.py # 7M 定律对照 python deqlm_v5_30m.py / deqlm_v6_30m_multidepth.py # 23M 定律对照 python phantom_memtest.py # 显存/质量 (短视界) python deqlm_v7_full.py python deqlm7_vs_cedlr2.py # phantom 全量跨模型掩码评测 python deqlm_v9_vanilla.py # 等参数纯堆对照 (PTSFT) python deqlm_v10_tied_fullbp.py # 绑定全反传 (2x2 完成) python deqlm_v11_sft.py # v10SFT → 全流程冠军 python matrix30_masked.py / matrix30_final.py # 30M 全模型掩码矩阵 python gen_compare.py # 定性生成对比https://github.com/dfytensor/OpenAshAnyWhere/blob/master/rubikgla
返回列表