750 亿参数只激活 37 亿:LG 开源 K-EXAONE 2.0,与 DeepSeek 的路线之争迎来新玩家

750 亿参数只激活 37 亿:LG 开源 K-EXAONE 2.0,与 DeepSeek 的路线之争迎来新玩家

7 月 31 日,LG AI 研究院在 Hugging Face 上放出了 K-EXAONE 2.0 的完整权重,三个数字在开源圈迅速传开:750B 总参数37B 激活参数Apache 2.0 许可证。这是韩国迄今规模最大的 AI 基础模型,总规模是初代 K-EXAONE(236B/23B)的 3 倍以上,而激活率从初代的 9.7% 一路压到4.9%——比 DeepSeek-V3 的 671B/37B(激活率 5.5%)更狠。同一天,美国商务部对 Anthropic 模型的出口管制风波尚未平息,韩国国家队模型以 Apache 2.0 全量开源登场,时间点本身就意味深长。

先看三个关键事实。第一,K-EXAONE 2.0 采用混合注意力 MoE架构,总参数 750B、激活参数 37B,规模是初代的三倍,参数效率却是初代的近两倍。第二,它在韩国科技信息通信部主权人工智能基金会模型项目框架下开发,定位是国家级数字基础设施,而非单纯的商业产品。第三,许可证选择 Apache 2.0 而不是更常见的 MIT,等于把专利授权也一并交了出来——这在主权模型的语境里几乎可以翻译成一句话:你们放心用,我们不做商用陷阱

但真正值得开发者关注的,不是"又一个 700 亿级参数开源模型",而是它站队的技术路线。2026 年的开源大模型世界已经分裂成两条路线:一条以 Kimi K3 为代表,总参数冲到 2.8T、激活参数约 72B,用极致稀疏换容量上限;另一条以 DeepSeek 为代表,671B 总参数、37B 激活,在容量与推理成本之间取平衡点。LG 的 K-EXAONE 2.0 加入的不是第三条路,而是把 DeepSeek 的平衡点往韩国国情方向又推了一步——在算力受限的条件下,把每个 GPU 的利用率榨到极限。这篇文章就沿着这条路线,拆一拆它的激活参数账、注意力账、许可证账,最后给出开发者现在就能落地的四条路径。

一、激活参数才是真正的成本账

总参数决定模型的"知识容量",激活参数决定推理时的"算力消耗"。一个 MoE(混合专家)模型把网络拆成多个专家子网络,每个 token 只经过其中一小部分专家。750B 参数的模型,如果只有 37B 在干活,意味着单次前向传播的 FLOPs 和一个 37B 的稠密模型相当,却享受了 750B 模型的容量。这套逻辑在推理成本上体现得最直接:每百万 token 的推理成本大致与激活参数成正比,一个 37B 激活的模型,单 token 推理成本大约只有同规模稠密模型的 5%。

对中小团队来说,这个比例意味着两件很实在的事。第一,同样预算下可以服务约20 倍的用户量,或者把单次调用的毛利提升一个数量级;第二,可以把更大参数的模型塞进同样的显卡集群——48GB 显存的单卡就能扛住 37B 激活的推理,这在稠密模型的世界里是不可想象的。K-EXAONE 2.0 把激活率压到 4.9%,等于告诉所有算力受限的团队:你要的"大模型自由",不一定靠买更多卡,也可以靠更聪明的架构

当然,稀疏不是免费的午餐。路由开销、专家并行、负载均衡这三座山,每一座都压过不少团队。路由开销指每个 token 都要经过一个 router 网络动态决定走哪几个专家,这个决策本身要消耗算力,也引入新的失败模式:如果 router 学偏了,大量 token 挤在同一个专家上,稀疏性就名存实亡,模型退化成稠密模型的性能加卡顿的体验。K-EXAONE 2.0 采用 top-k 路由加负载均衡约束,下面这段代码模拟了它的核心路由逻辑——这也是 MoE 模型最值得手写一遍的部分,理解它你才能真正理解 4.9% 是怎么来的:

import numpy as np def moe_route(router_weights, k=8): """模拟 MoE 的 top-k 稀疏路由。 router_weights: (batch, num_experts) 每个 token 的路由分数 k: 每个 token 激活的专家数量 """ # 归一化路由分数 probs = np.exp(router_weights - router_weights.max(axis=-1, keepdims=True)) probs = probs / probs.sum(axis=-1, keepdims=True) # top-k 选择:只激活分数最高的 k 个专家 top_k_idx = np.argsort(probs, axis=-1)[:, -k:] top_k_probs = np.take_along_axis(probs, top_k_idx, axis=-1) # 负载均衡辅助损失:惩罚"所有 token 挤同一专家" expert_usage = top_k_probs.mean(axis=0) balance_loss = (expert_usage ** 2).sum() * k return top_k_idx, top_k_probs, balance_loss # 模拟 128 个专家、batch=4、k=8 的路由 rng = np.random.default_rng(42) scores = rng.normal(0, 1, size=(4, 128)) active, probs, loss = moe_route(scores, k=8) print("一个 token 激活的专家下标:", active[0]) print("稀疏度: {:.2%}(128 个专家只激活 8 个)".format(len(active[0]) / 128)) print("负载均衡损失: {:.4f}".format(loss))

运行这段代码你会直观看到:128 个专家只激活 8 个,稀疏度 6.25%,和 K-EXAONE 2.0 的 4.9% 属于同一数量级。路由器把 95% 以上的网络"短路"掉,这就是稀疏激活模型能同时拥有大容量和低成本的原因。值得注意的是,负载均衡损失那一行不是装饰——MoE 训练里最经典的翻车事故,就是 router 收敛到"所有人挤一个专家",让稀疏模型退化成稠密模型的性能加卡顿体验,LG 在技术报告里专门强调了对这一项的约束。换句话说,4.9% 这个数字背后,是训练阶段每一轮都在跟路由崩溃搏斗的结果。

到这里,反对的声音也该听一听。稀疏 MoE 不是没有代价:专家之间的通信开销在跨机部署时尤其明显,一个 128 专家的模型做张量并行,all-to-all 通信可能占掉 30% 以上的时间;训练时的路由崩溃需要额外的辅助损失和温度退火来压制;更重要的是,稀疏模型的"知识分布"不均匀,冷门专家训练不充分,导致某些领域的表现明显弱于同等容量的稠密模型。所以选型时不要只看激活率一个数——如果你的场景是低延迟交互(语音助手、实时翻译),稠密模型或小激活模型可能反而更合适;如果你的场景是离线批处理、长上下文分析,稀疏大模型才是性价比之王。K-EXAONE 2.0 的 4.9% 激活率适合后者,这一点要心里有数。

二、混合注意力省下的是 KV Cache

MoE 解决的是参数利用效率,注意力机制解决的是上下文处理成本。标准全注意力(full attention)每个 token 都要和上下文里所有 token 计算相关性,复杂度随序列长度平方增长,而且 KV Cache(键值缓存)随上下文线性膨胀——128K 上下文在 8 卡 A100 上,KV Cache 就能吃掉几十 GB 显存。长上下文模型的部署成本,一半以上都花在这个缓存上,这也是为什么很多团队测长上下文模型时,发现显存先爆、算力还富余。

K-EXAONE 2.0 的"混合注意力"把两种机制拼在一起:对关键位置用全注意力保证质量,对长距离位置用线性或稀疏注意力降低复杂度。这和大模型领域正在发生的趋势完全一致——Kimi K3 走的是线性注意力路线,DeepSeek 系在 MLA(多头潜在注意力)上压缩 KV Cache,各家路径不同,目标相同:把长上下文推理的显存成本压下来。LG 的混合方案本质上是"不做单选题":哪些位置值得全量计算,哪些位置可以近似处理,让模型自己学。对部署团队来说,这套方案的实际收益是显存占用曲线被压平:短上下文时和普通模型没区别,长上下文时不再呈线性暴涨,预算规划因此变得可预测。

把 K-EXAONE 2.0 放进开源 MoE 家族的坐标系里看,它的定位非常清楚。下表汇总了当前四个代表性模型的参数与许可证情况:

模型总参数激活参数激活率许可证机构
K-EXAONE 2.0750B37B4.9%Apache 2.0LG AI 研究院
K-EXAONE(初代)236B23B9.7%MITLG AI 研究院
DeepSeek-V3671B37B5.5%MIT深度求索
Kimi K32.8T约 72B约 2.6%开源(部分条款)月之暗面

这张表最值得盯的不是绝对值,而是趋势:激活率在一年内从 9.7% 压到 4.9%,而 Kimi K3 已经做到 2.6%。如果稀疏度再压一个数量级,推理成本还会再降一个台阶。对预算敏感的团队,激活参数正在成为比总参数更重要的选型指标——下次看模型卡的时候,先看激活参数,再看总参数,顺序别反。顺便说一句,Kimi K3 的 2.6% 激活率是把双刃剑:容量上限拉满,但训练和推理的工程复杂度也拉满,不是所有团队都扛得住;K-EXAONE 2.0 选的 4.9% 恰好是"工程可控"和"成本优势"之间的一个务实折中。

三、Apache 2.0 背后是主权 AI 的算盘

K-EXAONE 2.0 由韩国科技信息通信部的主权人工智能基金会模型项目资助开发,这个背景决定了它的开源策略不是纯技术决策。2026 年 7 月,美国商务部刚刚对 Anthropic 的 Claude Fable 5 实施过 19 天的出口管制暂停;韩国、日本、欧盟都在加速"主权模型"布局。在这种局面下,一个由本国大厂主导、Apache 2.0 全放开的基础模型,是数字基础设施层面的战略对冲——你可以在贸易摩擦的任何时候,依赖一个不受任何国家出口管制约束的模型底座。

Apache 2.0 和 MIT 的区别很多人忽略:MIT 只保证"你拿去用",Apache 2.0 额外给了明确的专利授权——如果 LG 或其关联方持有相关专利,使用者不会因为实现模型细节而被起诉。对一个承载国家级 AI 战略的项目,这个条款把"商用风险"降到了接近零。这也是为什么 Apache 2.0 正在成为主权模型的事实标准:Llama 系、Gemma 系、Qwen 系全部采用或兼容它,而 K-EXAONE 2.0 的加入让这个标准阵营又多了一个重量级成员。

更深一层,K-EXAONE 2.0 的架构选择本身就是主权 AI 的"性价比策略":算力受限的国家买不到足够多的高端 GPU,就让每个 GPU 干更多的活。4.9% 的激活率意味着同样的推理集群可以服务 20 倍的请求——这是用架构创新弥补算力差距的典型打法。韩国没有中国这样庞大的本土芯片供应链,也没有美国这样宽松的算力供给,它选择的路是:把软件效率做到极致,让每一块能买到的 GPU 都物尽其用。这条路对东南亚、中东、拉美的主权 AI 项目,参考价值可能比想象中大——它们面临的约束几乎一模一样:卡难买、钱有限、但不想把数字主权交给任何一家美国公司。

对开发者而言,主权模型还有一个容易被忽视的好处:版本稳定性。闭源 API 的模型两个月换一代,接口说变就变,你的代码要跟着适配;而 Apache 2.0 的模型一旦部署,就是你自己的资产,没有弃用通知、没有价格表突变、没有数据合规的灰色地带。这在做长周期项目时是实打实的省心。当然,代价是你得自己养推理集群、自己处理安全更新——这笔账算下来,小团队通常还是 API 划算,主权模型的红利更多落在有运维能力的组织手里。

四、开发者现在能做什么

第一,本地推理。37B 激活参数配合 4-bit 量化,单卡 48GB 显存(如 A6000 / L40S)就能跑起来,消费级 24GB 显卡配合 CPU offload 也可以做实验。对韩语场景(商务文档、客服、代码注释)它的基准表现明显优于同量级通用模型,这本来就是 K-EXAONE 系列的看家领域;对中文场景,它的优势没这么突出,但作为多语言模型的基础能力是完整的,拿来跑翻译、摘要、信息抽取这类任务没有问题。

第二,私有化部署。Apache 2.0 意味着金融、医疗、政企客户可以完全离线部署,数据不出内网——在数据合规压力越来越大的 2026 年,这是闭源 API 给不了的优势。部署时优先用 vLLM 或 SGLang 这类支持 MoE 优化的推理引擎,显存占用可以比 naive 加载低 60% 以上,吞吐能再翻一倍。这类引擎对 top-k 路由的 kernel 级优化,直接决定 4.9% 激活率能不能兑现成真实的成本优势,部署前一定要先跑一遍 benchmark,别拿吞吐当参数吹。

第三,微调与蒸馏。MoE 模型的微调门槛比稠密模型高:路由器层学习率要单独调,专家并行要考虑负载均衡损失。一个稳妥的起点是从LoRA 适配器开始,冻结大部分专家,只训练路由器和顶层,显存需求能压到全参微调的三分之一。如果要做领域蒸馏,优先蒸馏它的韩语能力而非通用能力——那是它真正的护城河,也是社区里最稀缺的部分。等社区放出 SFT 数据集的整理版本,这个动作的成本还会再降一截。

第四,关注它的韩国生态落地。LG 旗下的家电、汽车零部件业务,以及韩国公共部门的政务系统,都在测试把 K-EXAONE 2.0 接入业务流。韩国市场验证过的"主权模型+行业纵深"模式,对国内做行业大模型的公司有直接的参照价值——同样的故事,Qwen 和 DeepSeek 已经在国内讲过一遍,但韩国的执行细节(许可证策略、算力补贴、公共采购绑定)值得单独研究。主权 AI 的竞争已经不只是模型的竞争,而是整个配套制度的竞争,谁先把制度跑通,谁就拿到了下一轮的门票。

K-EXAONE 2.0 发布后,下一个值得盯的时间点是韩国科技信息通信部的主权模型二期计划——如果二期把激活率进一步压到 2% 以下,同时保持韩语基准不掉点,那"稀疏激活+主权 AI"这条路就真的跑通了。到那时,750B 参数的门槛就不是参数量,而是谁能把每个 GPU 的利用率榨得更干净。开源模型的竞争已经进入下半场:比的不再是谁的参数更多,而是谁让每一块钱算力都花得值。K-EXAONE 2.0 给出了一个值得抄的答案,剩下的就看你的场景适不适合。