750 亿参数只激活 37 亿:LG 开源 K-EXAONE 2.0,与 DeepSeek 的路线之争迎来新玩家

发布时间:2026/8/1 5:05:55

750 亿参数只激活 37 亿:LG 开源 K-EXAONE 2.0,与 DeepSeek 的路线之争迎来新玩家 750 亿参数只激活 37 亿LG 开源 K-EXAONE 2.0与 DeepSeek 的路线之争迎来新玩家7 月 31 日LG AI 研究院在 Hugging Face 上放出了 K-EXAONE 2.0 的完整权重三个数字在开源圈迅速传开750B 总参数、37B 激活参数、Apache 2.0 许可证。这是韩国迄今规模最大的 AI 基础模型总规模是初代 K-EXAONE236B/23B的 3 倍以上而激活率从初代的 9.7% 一路压到4.9%——比 DeepSeek-V3 的 671B/37B激活率 5.5%更狠。同一天美国商务部对 Anthropic 模型的出口管制风波尚未平息韩国国家队模型以 Apache 2.0 全量开源登场时间点本身就意味深长。先看三个关键事实。第一K-EXAONE 2.0 采用混合注意力 MoE架构总参数 750B、激活参数 37B规模是初代的三倍参数效率却是初代的近两倍。第二它在韩国科技信息通信部主权人工智能基金会模型项目框架下开发定位是国家级数字基础设施而非单纯的商业产品。第三许可证选择 Apache 2.0 而不是更常见的 MIT等于把专利授权也一并交了出来——这在主权模型的语境里几乎可以翻译成一句话你们放心用我们不做商用陷阱。但真正值得开发者关注的不是又一个 700 亿级参数开源模型而是它站队的技术路线。2026 年的开源大模型世界已经分裂成两条路线一条以 Kimi K3 为代表总参数冲到 2.8T、激活参数约 72B用极致稀疏换容量上限另一条以 DeepSeek 为代表671B 总参数、37B 激活在容量与推理成本之间取平衡点。LG 的 K-EXAONE 2.0 加入的不是第三条路而是把 DeepSeek 的平衡点往韩国国情方向又推了一步——在算力受限的条件下把每个 GPU 的利用率榨到极限。这篇文章就沿着这条路线拆一拆它的激活参数账、注意力账、许可证账最后给出开发者现在就能落地的四条路径。一、激活参数才是真正的成本账总参数决定模型的知识容量激活参数决定推理时的算力消耗。一个 MoE混合专家模型把网络拆成多个专家子网络每个 token 只经过其中一小部分专家。750B 参数的模型如果只有 37B 在干活意味着单次前向传播的 FLOPs 和一个 37B 的稠密模型相当却享受了 750B 模型的容量。这套逻辑在推理成本上体现得最直接每百万 token 的推理成本大致与激活参数成正比一个 37B 激活的模型单 token 推理成本大约只有同规模稠密模型的 5%。对中小团队来说这个比例意味着两件很实在的事。第一同样预算下可以服务约20 倍的用户量或者把单次调用的毛利提升一个数量级第二可以把更大参数的模型塞进同样的显卡集群——48GB 显存的单卡就能扛住 37B 激活的推理这在稠密模型的世界里是不可想象的。K-EXAONE 2.0 把激活率压到 4.9%等于告诉所有算力受限的团队你要的大模型自由不一定靠买更多卡也可以靠更聪明的架构。当然稀疏不是免费的午餐。路由开销、专家并行、负载均衡这三座山每一座都压过不少团队。路由开销指每个 token 都要经过一个 router 网络动态决定走哪几个专家这个决策本身要消耗算力也引入新的失败模式如果 router 学偏了大量 token 挤在同一个专家上稀疏性就名存实亡模型退化成稠密模型的性能加卡顿的体验。K-EXAONE 2.0 采用 top-k 路由加负载均衡约束下面这段代码模拟了它的核心路由逻辑——这也是 MoE 模型最值得手写一遍的部分理解它你才能真正理解 4.9% 是怎么来的import numpy as np def moe_route(router_weights, k8): 模拟 MoE 的 top-k 稀疏路由。 router_weights: (batch, num_experts) 每个 token 的路由分数 k: 每个 token 激活的专家数量 # 归一化路由分数 probs np.exp(router_weights - router_weights.max(axis-1, keepdimsTrue)) probs probs / probs.sum(axis-1, keepdimsTrue) # top-k 选择只激活分数最高的 k 个专家 top_k_idx np.argsort(probs, axis-1)[:, -k:] top_k_probs np.take_along_axis(probs, top_k_idx, axis-1) # 负载均衡辅助损失惩罚所有 token 挤同一专家 expert_usage top_k_probs.mean(axis0) balance_loss (expert_usage ** 2).sum() * k return top_k_idx, top_k_probs, balance_loss # 模拟 128 个专家、batch4、k8 的路由 rng np.random.default_rng(42) scores rng.normal(0, 1, size(4, 128)) active, probs, loss moe_route(scores, k8) print(一个 token 激活的专家下标:, active[0]) print(稀疏度: {:.2%}128 个专家只激活 8 个.format(len(active[0]) / 128)) print(负载均衡损失: {:.4f}.format(loss))运行这段代码你会直观看到128 个专家只激活 8 个稀疏度 6.25%和 K-EXAONE 2.0 的 4.9% 属于同一数量级。路由器把 95% 以上的网络短路掉这就是稀疏激活模型能同时拥有大容量和低成本的原因。值得注意的是负载均衡损失那一行不是装饰——MoE 训练里最经典的翻车事故就是 router 收敛到所有人挤一个专家让稀疏模型退化成稠密模型的性能加卡顿体验LG 在技术报告里专门强调了对这一项的约束。换句话说4.9% 这个数字背后是训练阶段每一轮都在跟路由崩溃搏斗的结果。到这里反对的声音也该听一听。稀疏 MoE 不是没有代价专家之间的通信开销在跨机部署时尤其明显一个 128 专家的模型做张量并行all-to-all 通信可能占掉 30% 以上的时间训练时的路由崩溃需要额外的辅助损失和温度退火来压制更重要的是稀疏模型的知识分布不均匀冷门专家训练不充分导致某些领域的表现明显弱于同等容量的稠密模型。所以选型时不要只看激活率一个数——如果你的场景是低延迟交互语音助手、实时翻译稠密模型或小激活模型可能反而更合适如果你的场景是离线批处理、长上下文分析稀疏大模型才是性价比之王。K-EXAONE 2.0 的 4.9% 激活率适合后者这一点要心里有数。二、混合注意力省下的是 KV CacheMoE 解决的是参数利用效率注意力机制解决的是上下文处理成本。标准全注意力full attention每个 token 都要和上下文里所有 token 计算相关性复杂度随序列长度平方增长而且 KV Cache键值缓存随上下文线性膨胀——128K 上下文在 8 卡 A100 上KV Cache 就能吃掉几十 GB 显存。长上下文模型的部署成本一半以上都花在这个缓存上这也是为什么很多团队测长上下文模型时发现显存先爆、算力还富余。K-EXAONE 2.0 的混合注意力把两种机制拼在一起对关键位置用全注意力保证质量对长距离位置用线性或稀疏注意力降低复杂度。这和大模型领域正在发生的趋势完全一致——Kimi K3 走的是线性注意力路线DeepSeek 系在 MLA多头潜在注意力上压缩 KV Cache各家路径不同目标相同把长上下文推理的显存成本压下来。LG 的混合方案本质上是不做单选题哪些位置值得全量计算哪些位置可以近似处理让模型自己学。对部署团队来说这套方案的实际收益是显存占用曲线被压平短上下文时和普通模型没区别长上下文时不再呈线性暴涨预算规划因此变得可预测。把 K-EXAONE 2.0 放进开源 MoE 家族的坐标系里看它的定位非常清楚。下表汇总了当前四个代表性模型的参数与许可证情况模型总参数激活参数激活率许可证机构K-EXAONE 2.0750B37B4.9%Apache 2.0LG AI 研究院K-EXAONE初代236B23B9.7%MITLG AI 研究院DeepSeek-V3671B37B5.5%MIT深度求索Kimi K32.8T约 72B约 2.6%开源部分条款月之暗面这张表最值得盯的不是绝对值而是趋势激活率在一年内从 9.7% 压到 4.9%而 Kimi K3 已经做到 2.6%。如果稀疏度再压一个数量级推理成本还会再降一个台阶。对预算敏感的团队激活参数正在成为比总参数更重要的选型指标——下次看模型卡的时候先看激活参数再看总参数顺序别反。顺便说一句Kimi K3 的 2.6% 激活率是把双刃剑容量上限拉满但训练和推理的工程复杂度也拉满不是所有团队都扛得住K-EXAONE 2.0 选的 4.9% 恰好是工程可控和成本优势之间的一个务实折中。三、Apache 2.0 背后是主权 AI 的算盘K-EXAONE 2.0 由韩国科技信息通信部的主权人工智能基金会模型项目资助开发这个背景决定了它的开源策略不是纯技术决策。2026 年 7 月美国商务部刚刚对 Anthropic 的 Claude Fable 5 实施过 19 天的出口管制暂停韩国、日本、欧盟都在加速主权模型布局。在这种局面下一个由本国大厂主导、Apache 2.0 全放开的基础模型是数字基础设施层面的战略对冲——你可以在贸易摩擦的任何时候依赖一个不受任何国家出口管制约束的模型底座。Apache 2.0 和 MIT 的区别很多人忽略MIT 只保证你拿去用Apache 2.0 额外给了明确的专利授权——如果 LG 或其关联方持有相关专利使用者不会因为实现模型细节而被起诉。对一个承载国家级 AI 战略的项目这个条款把商用风险降到了接近零。这也是为什么 Apache 2.0 正在成为主权模型的事实标准Llama 系、Gemma 系、Qwen 系全部采用或兼容它而 K-EXAONE 2.0 的加入让这个标准阵营又多了一个重量级成员。更深一层K-EXAONE 2.0 的架构选择本身就是主权 AI 的性价比策略算力受限的国家买不到足够多的高端 GPU就让每个 GPU 干更多的活。4.9% 的激活率意味着同样的推理集群可以服务 20 倍的请求——这是用架构创新弥补算力差距的典型打法。韩国没有中国这样庞大的本土芯片供应链也没有美国这样宽松的算力供给它选择的路是把软件效率做到极致让每一块能买到的 GPU 都物尽其用。这条路对东南亚、中东、拉美的主权 AI 项目参考价值可能比想象中大——它们面临的约束几乎一模一样卡难买、钱有限、但不想把数字主权交给任何一家美国公司。对开发者而言主权模型还有一个容易被忽视的好处版本稳定性。闭源 API 的模型两个月换一代接口说变就变你的代码要跟着适配而 Apache 2.0 的模型一旦部署就是你自己的资产没有弃用通知、没有价格表突变、没有数据合规的灰色地带。这在做长周期项目时是实打实的省心。当然代价是你得自己养推理集群、自己处理安全更新——这笔账算下来小团队通常还是 API 划算主权模型的红利更多落在有运维能力的组织手里。四、开发者现在能做什么第一本地推理。37B 激活参数配合 4-bit 量化单卡 48GB 显存如 A6000 / L40S就能跑起来消费级 24GB 显卡配合 CPU offload 也可以做实验。对韩语场景商务文档、客服、代码注释它的基准表现明显优于同量级通用模型这本来就是 K-EXAONE 系列的看家领域对中文场景它的优势没这么突出但作为多语言模型的基础能力是完整的拿来跑翻译、摘要、信息抽取这类任务没有问题。第二私有化部署。Apache 2.0 意味着金融、医疗、政企客户可以完全离线部署数据不出内网——在数据合规压力越来越大的 2026 年这是闭源 API 给不了的优势。部署时优先用 vLLM 或 SGLang 这类支持 MoE 优化的推理引擎显存占用可以比 naive 加载低 60% 以上吞吐能再翻一倍。这类引擎对 top-k 路由的 kernel 级优化直接决定 4.9% 激活率能不能兑现成真实的成本优势部署前一定要先跑一遍 benchmark别拿吞吐当参数吹。第三微调与蒸馏。MoE 模型的微调门槛比稠密模型高路由器层学习率要单独调专家并行要考虑负载均衡损失。一个稳妥的起点是从LoRA 适配器开始冻结大部分专家只训练路由器和顶层显存需求能压到全参微调的三分之一。如果要做领域蒸馏优先蒸馏它的韩语能力而非通用能力——那是它真正的护城河也是社区里最稀缺的部分。等社区放出 SFT 数据集的整理版本这个动作的成本还会再降一截。第四关注它的韩国生态落地。LG 旗下的家电、汽车零部件业务以及韩国公共部门的政务系统都在测试把 K-EXAONE 2.0 接入业务流。韩国市场验证过的主权模型行业纵深模式对国内做行业大模型的公司有直接的参照价值——同样的故事Qwen 和 DeepSeek 已经在国内讲过一遍但韩国的执行细节许可证策略、算力补贴、公共采购绑定值得单独研究。主权 AI 的竞争已经不只是模型的竞争而是整个配套制度的竞争谁先把制度跑通谁就拿到了下一轮的门票。K-EXAONE 2.0 发布后下一个值得盯的时间点是韩国科技信息通信部的主权模型二期计划——如果二期把激活率进一步压到 2% 以下同时保持韩语基准不掉点那稀疏激活主权 AI这条路就真的跑通了。到那时750B 参数的门槛就不是参数量而是谁能把每个 GPU 的利用率榨得更干净。开源模型的竞争已经进入下半场比的不再是谁的参数更多而是谁让每一块钱算力都花得值。K-EXAONE 2.0 给出了一个值得抄的答案剩下的就看你的场景适不适合。

相关新闻