Laguna S 2.1 深度解析:118B MoE 开放权重编码模型,单机可跑的代码助手新标杆

发布时间:2026/7/24 1:22:41

Laguna S 2.1 深度解析:118B MoE 开放权重编码模型,单机可跑的代码助手新标杆 AI编程开源模型MoE架构本地部署2026年7月21日旧金山AI实验室Poolside扔下了一颗不大不小的炸弹——Laguna S 2.1正式开源。说不大是因为118B的总参数量放在今天动辄万亿参数的巨头面前确实不算出挑说不小则是因为这个模型在Terminal-Bench 2.1上拿下了70.2%的成绩而且最夸张的是它的完整权重能塞进一台NVIDIA DGX Spark里跑起来。这意味着什么意味着你书桌上那台看起来像个精致小盒子的设备突然有了跟数据中心级模型掰手腕的底气。Poolside的联合CEO Jason Warner在发布当天说了一句很直白的话西方需要值得信赖、可以运行并在此基础上进行开发的开源模型。这句话背后藏着一层焦虑——自OpenAI在2025年8月放出gpt-oss-120b之后整整11个月西方实验室在同级别开源编码模型上几乎交了白卷。Laguna S 2.1的出现恰好填上了这个空档。参数不大门道不少Laguna S 2.1 的架构到底特殊在哪很多人看到118B总参数、8B激活参数这组数字第一反应可能是又是MoE那一套稀疏激活省算力嘛。但Laguna S 2.1的混合专家设计里藏了不少Poolside自己的小心思。整个模型堆了48层里面塞了256个路由专家和1个共享专家。每个token进来门控网络会挑出排名前10的路由专家参与计算再加上那个始终在线的共享专家。这种256选101的组合让单次前向传播的实际计算量控制在了8B参数的级别。作为对比DeepSeek-V4-Pro-Max的总参数是1.6TKimi K3更是飙到了2.8T——Laguna S 2.1的体量连人家的零头都够不上却在Terminal-Bench上把DeepSeek-V4-Pro-Max的64.0%甩在了身后。更值得关注的是它的注意力机制。Poolside没有无脑堆砌全局自注意力而是采用了一种交替策略每1层全局注意力配3层滑动窗口注意力窗口大小锁死在512个token。这种设计在长上下文场景下相当务实——既保留了捕捉远距离依赖的能力又把KV缓存的内存占用压到了可接受的范围。配合8个KV头的分组查询注意力GQA百万token的上下文窗口在付费端点上成了现实而不是PPT上的数字。路由门控用的也不是常见的softmax top-k而是sigmoid门控加归一化专家权重每层还带了旋转尺度。这些细节听起来很工程化但翻译成人话就是Poolside在专家调度上花了真功夫不是简单套了个MoE的壳子就出来交差。Terminal-Bench 70.2% 意味着什么这个分数到底硬不硬聊编码模型基准测试是绕不开的坎。Laguna S 2.1在Terminal-Bench 2.1上拿了70.2%在Poolside自家的编译排行榜上排第11。单看排名似乎一般但你要是把榜单拆开看前面那些排在前面的要么是Claude Fable 588.0%、GPT-5.6 Sol88.8%这种闭源黑盒要么是Kimi K388.3%这种2.8T参数的庞然大物。在开放权重、80亿以下激活参数的圈子里Laguna S 2.1基本就是天花板级别的存在。横向拉几个同量级的对手出来比比差距就更明显了。腾讯的Hy3总参数295B、激活21BTerminal-Bench得分71.7%只比Laguna S 2.1高1.5个百分点但参数规模几乎是人家的三倍。Inkling更夸张975B总参数、41B激活得分却只有63.8%被Laguna S 2.1反超了6个多点。SWE-Bench Pro公开版上Laguna S 2.1的59.4%同样压过了Hy3的57.9%和DeepSeek-V4-Pro-Max的55.4%。Poolside为了堵上刷榜的嘴直接把每次评估的完整轨迹挂到了trajectories.poolside.ai上。每个分数都是pass1每个任务测3到4次取平均。这种透明度的做法在当下的模型发布里并不多见至少说明Poolside对自己的结果是有底气的。当然社区里也冒出了一些不同的声音——有Reddit用户反馈在不同测试平台复现时某些模式任务的得分会在0.40到0.79之间大幅波动max_tokens的设置对结果影响显著。这也提醒我们基准测试分数看看就好真刀真枪地用到项目里才是试金石。从云端到桌面Laguna S 2.1 的部署方案有多灵活如果说性能是Laguna S 2.1的敲门砖那部署友好度就是它真正的杀手锏。这个模型从发布第一天起就铺满了各种渠道Hugging Face上能下到BF16、FP8、INT4、NVFP4、GGUF、MLX六种格式的权重Ollama一条命令就能拉起来vLLM和SGLang原生支持OpenRouter同时开了免费层和付费层Vercel AI Gateway、Baseten、OpenCode、Kilo Code、Cline也在当天完成了对接。但真正让开发者眼睛发亮的是单机可跑这四个字。Q4_K_M量化版本大约需要75GB内存这意味着一台128GB统一内存的Apple Silicon Mac或者NVIDIA DGX Spark就能把它跑起来。Hugging Face的Thomas Wolf直接给了定语目前你可以在本地单台设备上运行的最佳编码模型。社区实测数据也佐证了这一点——Apple M5 Max配合Ollama的Q4_K_M版本短上下文下解码速度能到49 tok/s即使把上下文拉到16K速度也还能维持在36 tok/s左右。在单块DGX Spark上无推测解码时速度约13到14 tok/s开启DFlash推测解码后能飙到22到24 tok/s。说到DFlash这是Poolside随主模型一起放出的一个配套草稿模型专门用来搞推测解码。原理不复杂先用一个轻量级的草稿模型快速生成候选token再由主模型批量验证。在RTX 6000 PRO上代码提示的单流解码速度从109 tok/s提到了271 tok/s提升幅度相当可观。不过社区也反馈了几个坑DFlash在散文类文本上效果一般高并发时 rejected draft 会占用批处理容量反而可能拖后腿。Poolside CEO Eiso Kant也承认RTX 6000 PRO在发售后24小时内确实暴露了一些稳定性问题正在紧急修复。实际用起来怎么样社区首日反馈里的真实画像基准测试是实验室环境真实世界的代码库才是模型的考场。Laguna S 2.1发布当天社区里已经有人把它塞进了各种奇奇怪怪的场景里。一位独立评估员在自己的私有安全沙箱里成功跑通了六级工具链按他的说法这是他在任何本地模型上测过的最深层级。Kilo Code团队更直接把纽约市的开放数据丢给模型让它现场搭了一个地形分区可视化工具从数据清洗到前端渲染一条龙搞定。代码库问答方面SWE Atlas的得分是46.2%虽然离顶尖闭源模型还有距离但对于一个能本地跑的开放权重模型来说这个水平已经够用了。Terminal-Bench测的主要是基于终端的Agent能力——在shell里解任务、改文件、跑命令。Laguna S 2.1在这个方向上的优化是肉眼可见的。它支持思考模式和非思考模式的按需切换百万token的上下文窗口也给长推理轨迹和多轮Agent交互留足了空间。不过目前思考控制还是二元的开或关Poolside把更精细的调控列进了路线图短期内可能还做不到像某些闭源模型那样滑动调节思考深度。也有不那么乐观的声音。一项私人评估显示Laguna S 2.1在压力下的 grounding 表现得分只有0.80而Qwen 3.5 122B能做到0.97。具体表现就是在某些陷阱题里会捏造数字和人名。这说明模型在极端场景下的可靠性还有提升空间不能盲目信任它的输出。跟同行比Laguna S 2.1 到底站哪一档把Laguna S 2.1放进当前AI编码模型的版图里它的位置其实挺有意思。往上够它碰不到Claude Fable 5、GPT-5.6 Sol、Kimi K3这种闭源前沿模型的天花板。这三家在Terminal-Bench上的得分都在88%以上SWE-Bench Pro上Claude Fable 5更是干到了80.3%属于另一个维度的存在。但往下比在开放权重、可本地部署、可商业二次开发的赛道上Laguna S 2.1几乎找不到同级别的对手。Hy3和Inkling虽然也是开放权重但参数规模大得多部署门槛高了一大截实际得分却没有拉开明显差距。定价策略上Poolside走了一条很聪明的路线。OpenRouter付费端点输入0.10美元/百万token、输出0.20美元/百万token缓存读取只要0.01美元/百万token。同时保留了一个免费的262K上下文层级——虽然免费层的数据会被用于训练但对于想先试试水的开发者来说这个门槛几乎为零。这种低价付费免费尝鲜的组合拳比那些一上来就设高门槛的模型友好得多。许可证方面OpenMDW-1.1明确允许商业用途。权重文件在Hugging Face上第一天就全量放出没有那种先放个小模型吊胃口大模型藏着掖着的套路。这种坦诚在当下的开源生态里反而成了一种稀缺品质。训练背后的故事九周、四千块H200、Poolside的迭代节奏Laguna S 2.1的训练规模也值得一提。整个预训练在4096块NVIDIA H200上跑完耗时不到九周起点是2026年5月22日。三个月内连发三个模型——从Laguna XS 2.133B到Laguna S 2.1118BPoolside的迭代速度快得有点吓人。这家由Eiso Kant和Jason Warner共同掌舵的旧金山实验室核心方向一直锁死在政府、国防机构和受监管企业的编码模型上。这种背景也解释了为什么Laguna S 2.1在Agent能力和长上下文工程任务上下了重注——这些场景恰恰是B端客户最买账的卖点。不过训练速度快不等于训练质量差。从终端 bench 的得分和社区反馈来看Laguna S 2.1的代码理解和工具调用能力确实达到了一个很高的水准。关键是在这么短的训练周期里Poolside还顺手做了DFlash草稿模型和完整的评估轨迹公开工程执行力相当在线。写在最后它适合你吗如果你是个追求极致性能的开发者非Claude Fable 5或Kimi K3不用那Laguna S 2.1确实给不了你那个级别的天花板。但如果你想要的是一个能本地跑、能商用、能二次开发、性能又足够硬的编码模型Laguna S 2.1几乎是目前的最优解。128GB内存的Mac或者一台DGX Spark就能让它全速运转Ollama一条命令搞定部署OpenRouter上还能免费试玩——这种低门槛高可用性的组合在当下的开源编码模型市场里并不多见。接下来值得关注的几个风向标第三方独立平台比如Artificial Analysis的Terminal-Bench和SWE-Bench复测结果RTX 6000 PRO的稳定性补丁什么时候落地免费OpenRouter层级在真实流量压力下的表现以及Poolside承诺的更精细思考控制和视觉支持什么时候上线。如果这些短板能陆续补上Laguna S 2.1的适用范围会从纯编码拓展到更通用的AI助手场景到时候它的竞争力还会再上一个台阶。总之Poolside用Laguna S 2.1证明了一件事开源编码模型不一定非要堆到万亿参数才能打。118B总参数、8B激活、精巧的MoE路由、务实的注意力设计再加上对本地部署的极致友好——这套组合拳可能比盲目追求参数规模更有现实意义。

相关新闻