ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Beam 拆解:501B 只激活 23B,一亿次 rollout 和 13 亿沙箱堆出的开源权重

Beam 拆解:501B 只激活 23B,一亿次 rollout 和 13 亿沙箱堆出的开源权重 10 月 5 日Reflection 发布首款开源权重模型 Beam501B 总参数激活仅 23B。发布页面上没有权重下载链接只有一个 early access 的邮箱登记框。HN 热榜评论区的高赞声音很直接把权重放出来否则别自称开放。争议归争议这份技术博客里的工程数字密度是今年开源发布里少见的。一万零五百块 GB300 连跑四周生成超过一亿次 rollout动用约十三亿个沙箱。这组数字指向一个判断前沿 RL 的竞争已滑出算法论文落进分布式系统工程。本文按四条线拆这次发布跑分站位、推理成本账、RL 工程栈、发布策略。跑分只是入场券真正值得核验的是它如何把一百万个 RL 环境跑成流水线。Beam 是稀疏 MoE 架构主打编码、推理与智能体负载权重本月以 Apache 2.0 放出。在权重落地前所有结论都标注来源跑分引官方博客质疑引 HN 原帖。一、跑分表只是入场券与 GLM-5.2 贴身、离 Kimi K3 还差一截官方给出的对照组有七个覆盖 Inkling、Nemotron 3 Ultra 到 DeepSeek V4.1 Flash。DeepSWE v1.1 上 Beam 拿 44.4恰好压在 GLM 5.2 的 44.0 上方零点四分。基准BeamGLM 5.2GLM 5.3Kimi K3Qwen 3.8-MaxDS V4.1 FlashDeepSWE v1.144.444.061.068.051.074.2SWE-Bench Pro v2-Hard77.2NR84.388.2NRNRSWE-Bench Pro v165.562.1NRNR67.7NRTerminal Bench 2.180.181.088.288.386.690.6SWE-bench Verified80.9NRNRNRNRNRSWE-bench Multilingual78.0NRNRNRNRNR同一项 DeepSWE 上 GLM 5.3 是 61.0Kimi K3 是 68.0头部阵营的分差并不小。Terminal Bench 2.1 上 Beam 拿 80.1比 GLM 5.2 的 81.0 还低将近一分。SWE-Bench Pro v2-Hard 是它最好看的一行77.2 对 Inkling 的 56.9 拉开二十分。SWE-bench Verified 拿到 80.9多语言版本拿到 78.0均属已报告阵营的高位。SWE Atlas 代码库问答只有 34.6对照组里 GLM 5.3 是 61.0这一行明显掉队。官方定性很克制与 GLM 5.2 持平、逼近 Qwen 3.8-Max原始能力落后 Kimi K3。HN 网友的直白翻译是它在跟 GLM 上一代打平而 GLM 5.3 Flash 更小更快。把这表读成超越开源前沿是过度解读读成西方开源阵营重回牌桌更准确。注意表里大量 NR 空格七个对照组在七项基准上的报告口径并不完整。缺报集中在 GLM 5.2 的新版基准与 Qwen 3.8-Max 的多数行横比时要打折。官方注明别家分数引自 Artificial Analysis 与 DataCurve并非同一 harness 重跑。这意味着表内数字混着不同评测环境分差两三分以内的行不宜下硬结论。真正站得住的事实只有两个它和 GLM 5.2 同档且激活参数只有 23B。同档能力配更低激活参数才是这次发布的真正卖点——推理侧的成本账。二、推理账本用 23B 激活参数换 3 到 4 倍算力差Beam 对推理效率的声明很具体高级推理基准打平 GLM 5.2算力少 3 到 4 倍。它给出的估算公式是 FLOPs 约等于 2 乘激活参数乘平均生成 token 数。这个口径只算生成阶段的前向传播把每次乘加计为两次浮点运算。MoE 模型按每 token 实际激活的参数量代入而不是拿总参数充数。生成 token 数把推理链和最终答案一起计入长推理的成本被如实放大。口径同时排除了预填充、注意力运算和服务开销官方自述是近似而非实测。排除项恰恰是企业落地的大头长上下文场景的预填充成本不在公式里。对 2T 以上参数家族如 Qwen 3.8-Max它声称优势更明显但未给具体倍数。HN 网友整理的对照表显示DeepSeek V4.1 Flash 总参 552B预填充只激活 8B。同一对照里 Beam 预填充与解码都激活 23B也没有 n-gram 外置参数层。也就是说 Beam 的省算力是相对 GLM 5.2 这一代而非相对所有稀疏架构。DeepSeek 系靠 n-gram 参数外置把知识搬进廉价存储Beam 没走这条路。有 HN 用户直接提问新模型为什么都不用 n-gram这是低成本扩知识的现成方案。官方博客对此没有回答架构细节要等本月的技术报告才能验证。可控长度惩罚是效率故事的另一半奖励正确解同时惩罚多余 token。RL 早期出现罕见组合完成长度在下降任务成功率反而在上升。到训练中后段智能体能力增强长度重新增长但新增 token 换来了对应分数。官方把这条曲线称为帕累托前沿的两阶段运动先向内收缩再向外扩张。用户侧拿到的是 reasoning effort 参数低档省 token高档换难题表现。对按 token 计费的企业部署这个旋钮比跑分表上的零点四分值钱得多。三、一亿次 rolloutRL 被跑成一场分布式系统工程RL 是 Beam 的核心扩增轴官方把算法、环境和基础设施列为同等级投入。硬件底座是 10,500 块 NVIDIA GB300连续跑了四个星期。产出是超过一亿次 rollout单次 rollout 的上下文上限放到 256K token。仅推理专家一个组件就消耗其中八千万次而 Inkling 整个训练只用三千万次。小米 MiMo 公开的 RL 规模是七十五万三千次 rollout量级差了两位以上。官方称这是开放实验室迄今最大规模 RL 运行之一限定词用得谨慎。支撑这一亿次尝试的是近一百万个环境主体来自合成数据流水线。其余环境来自专有供应商数据与开源来源三条渠道按统一标准过滤。难度过滤的标准是不能次次做对、也不能次次做不对两端都喂不出梯度信号。质量过滤排除表述欠定、误导、可猜测、可钻空子和带噪声的任务。过滤不是一次性的任务先经 RL 实测暴露的问题回流到下一轮采集。官方坦承数据质量妥协会直接造成能力平台期质量迭代是上涨的前提。整个运行结束时评估曲线没有饱和迹象言下之意是算力加码仍有收益。平台侧持续维持的平均并发是十一万次 rollout 同时进行。推理与训练的 GPU 配比在 3.9 比 1 到 5.4 比 1 之间随负载动态调整。训练器在同一训练血缘内切换过五种 GPU 网格配置且没有丢失训练状态。新权重抵达推理集群的中位耗时约十二秒。分层分发先跨机架走 RoCE 网络再在机架内经 NVLink 本地共享。相比每个副本独立拉取这套方案把跨机架流量降低百分之七十五。全集群采纳同一版新权重的速度因此快了 2.2 倍。四周内平台处理了七十一起推理故障训练任务一次都没有因此终止。推理容量恢复的中位时间是八分钟。故障损失的容量只占已服务 GPU 分钟的万分之二。沙箱层的峰值并发是十七万个实例同时存活。全周期累计处理超过十亿次沙箱创建请求。这些请求横跨二十个集群、两家云厂商和四个地理区域。百分之九十的新沙箱在十秒内完成就绪。动态打包把训练批次的平均填充率维持在 99.99%。平均 rollout 长度在周期内上涨近七成单卡训练吞吐波动压在 1.5% 以内。训练与打分合计的沙箱总用量约十三亿个此前没有实验室公开过这个量级。四、样本落后 107 个版本还能学全异步 RL 的稳定性从哪来全异步意味着 rollout 由不同版本的 checkpoint 混合生成轨迹越长跨版本越多。早生成的 token 相对当前策略越来越陈旧这是异步方法失稳的头号来源。训练引擎与推理引擎之间的数值误差会进一步放大这种陈旧。Beam 的做法是给每个 token 打上产生它的权重版本号让算法显式感知陈旧度。官方声称新算法让系统能从一天前生成的交互中稳定学习。最极端的展示是批量中最老样本落后当前策略 107 个权重版本数值仍不发散。可回放的奖励记录让奖励如何进入训练全程可审计。独立判分器会二次筛查通过样本专门清理钻评分器漏洞的投机解。逐 token 记录还支撑训练与推理两侧的数值一致性校验每一步都可比对。这套设计的含义是稳定性不靠更大的 batch 硬扛而是靠可测量换来。下面这段 Python 用纯标准库实现陈旧度感知修正的核心机制可直接运行。它模拟新旧两个策略分布对陈旧样本做重要性截断观察估计偏差的变化。import math, random def softmax(logits): m max(logits) e [math.exp(x - m) for x in logits] s sum(e) return [v / s for v in e] V 8 random.seed(42) new_logits [random.gauss(0, 1) for _ in range(V)] base_old [x random.gauss(0, 0.6) for x in new_logits] new_p softmax(new_logits) true_value sum(i * new_p[i] for i in range(V)) def sample_index(p): r random.random() acc 0.0 for i, v in enumerate(p): acc v if r acc: return i return V - 1 def estimate(staleness, n4000, clip2.0): drift [x random.gauss(0, 0.15 * staleness ** 0.5) for x in base_old] beh softmax(drift) # 行为策略随陈旧度漂移 naive, corrected [], [] for _ in range(n): tok sample_index(beh) r new_p[tok] / max(beh[tok], 1e-12) naive.append(tok * r) corrected.append(tok * min(r, clip)) # 截断抑制方差 return sum(naive) / n, sum(corrected) / n print(ftarget mean {true_value:.4f}) for stale in (1, 8, 107): raw, fixed estimate(stale) print(fstale{stale:3} naive{raw:.4f} clipped{fixed:.4f})输出显示陈旧度升高时未修正估计的偏差显著放大截断后收敛回目标附近。有效样本量随陈旧度上升而下降这正是 Beam 必须维持高速权重分发的原因。权重下发每慢一秒批量里的平均陈旧度就抬高一分有效样本量就缩水一分。把这个关系和十二秒的中位下发时间放在一起看工程指标与算法稳定是同一笔账。HN 上有工程师留言想看这种规模训练的运维日志因为 GPU 故障是常态输入。万卡集群里随时有节点掉线能带病续训的系统设计本身就是研究壁垒。五、预训练底座95% 淘汰率与被打捞的 1.8 万亿 tokenRL 的前提是一个足够强的底座Beam Base 用 6,144 块 GB300 NVL72 训练。端到端预训练用时不到四周损失曲线全程没有不可恢复的大幅尖刺。预训练数据是 23.8 万亿 token来自公开网页、公共来源与专有授权数据。数据管线先经解析、去重与清洗约百分之九十五的原始互联网 token 被淘汰。自训质量分类器按网页、代码和 STEM 三个域分别打分分桶到细粒度质量层级。官方给出的反直觉数字是传统开源过滤框架会漏掉约 1.8 万亿高质量 token。被打捞回来的部分包括百分之八十七的精选网页代码 token。代码数据按语言单独调过滤器剔除低质自动生成与不可学习的内容。另有分类器专门识别损坏代码因为这类样本会直接伤害训练稳定性。占比过高的语言与文件类型会被再平衡防止模型的接触面收窄。PDF 管线用视觉语言 OCR 模型加自研质量分类器分布式跑在数千块 GPU 上。这条管线处理 PB 级技术文档负责把 STEM 知识灌进底座。高价值代码与技术内容在周期内被重复多次配合模糊去重控制收益递减。架构稳定性设计包括局部与全局注意力交替、细粒度路由专家和受控残差流。负载均衡沿用 DeepSeek 的无辅助损失方案叠加专家偏置更新的余弦衰减。序列级均衡让模型在预训练分布之外的数据上也维持专家利用均匀。训练结束时最忙专家的负载仅为平均值的 1.04 倍接近完美均匀。残差流用按深度缩放加 SandwichNorm、逐元素注意力门控和 FP32 累加控制数值。全部五十二层的残差 RMS 全程有界没有出现持续的激活增长。整个运行只执行九次半自动回卷末期 goodput 达到 92.3%。六、安全对齐双教师蒸馏与可以被预测的奖励对齐采用双教师结构一个大规模 RL 教师一个专职安全与对齐教师。两位教师的能力经多教师同策略蒸馏合并进最终模型官方缩写为 MOPD。安全原则分三层不可违反的规则、应始终满足的品质、默认交互风格。第二层包括利用给定上下文、做准确声明、承认不确定性、透明执行用户要求。安全训练采用审议式对齐把安全策略直接写进模型的推理过程。数据集按对抗迭代构建训一轮模型生成能诱发违规的提示再折回下一轮。安全 RL 的场景覆盖单轮、多轮、越狱和施压工具调用四类。目标是同时压低过度拒绝与有害顺从这两个指标通常此消彼长。大量对齐环境是不可验证奖励由生成式奖励模型当裁判。官方声称能在跑 RL 之前预测奖励带来的行为变化相关系数 0.79。作为对照仅用 Best-of-N 上限做预测的相关系数只有 0.46。可预测性让团队在训练前迭代评分标准定点压制幻觉与过度格式化。安全评测结果将随技术报告发布内部安全评测套件承诺开源。可检验的开源安全标准如果真落地会是这次发布里被低估的一项资产。七、权重未到先开发布会一场精心计算的生态卡位这次发布最大的争议不是技术而是没有权重的开源权重模型发布。HN 的高赞评论把它类比为空开宣称开放却不放出实际产品。更尖锐的质疑指向融资动机在收购窗口期前用发布抬高身价。也有网友给出截止日推演承诺本月放权重期限就是十月三十一日。官方的时间线是红队测试与评估收尾本月放出权重、报告、模型卡与开发件。放出的不只是权重还有运行、评测与微调全栈以及一批分发伙伴。泛化实验的插曲更值得记录官方称 180×90 经纬网格谜题上线仅数日。官方用训练数据来不及收录论证 Beam 的 95.5% 覆盖率属于真泛化。HN 用户当天就挖出同类实验今年八月已出现在 LessWrong。用谜题很新证明泛化的论证链因此断了一环95.5% 仍在但含义变了。这个插曲的教训是凡以数据新鲜度论证泛化必须先做收录可能性审计。Beam 的 95.5% 介于 Opus 5 的 92.5% 与 Fable 5 的 97.8% 之间排位并不差。Reflection 的底色解释了发布节奏融资超四十亿美元估值约二百五十亿。这家公司在完全隐身状态下运营至今Beam 是它第一个公开模型。有评论认为正确节奏是 Qwen 路径先在别人的权重上做后训练证明有用。Reflection 选了相反的重资产路径先自建万卡预训练再一次性摊牌。两条路径没有对错但重资产路径的每一步都必须经得起复算。一个务实提醒来自 HN权重落地后的固定 harness、断网复测才是真考试。在此之前Beam 对行业的真实贡献是这份公开的 RL 工程清单本身。如果月底权重如期以 Apache 2.0 放出西方开源阵营才算真正回到牌桌。
返回列表