本文要点
- 从只看官方分数,变为可下载权重并检查最终评测轨迹。
- 从 225B-A23B 的 M.1,变为 118B-A8B 的更低运行激活规模。
- 从单一回答模式,变为按请求切换关闭或最大思考。
阅读辅助
先看数字、证据和来源,再读正文。
Laguna S 2.1 是 118B 总参数、每 token 约激活 8B 的 MoE 开放权重模型。
2026-04-28 · Poolside 发布 Laguna M.1 与 XS.2;这是本次公告回溯的家族背景,不是 7 月 21 日新增。
Laguna S 2.1 值得关注,不是因为又多了一个代码模型名字,而是 Poolside 把 118B 总参数、每 token 约激活 8B、最高 1,048,576 token 上下文和开放权重放进同一版本,并把最终评测轨迹交给外部检查。它试图回答一个更实际的问题:长时代码 Agent 是否可以不依赖超大云端集群,也能进入企业自有硬件和数据边界。
已经确认的事实是,Poolside 在 2026 年 7 月 21 日发布 Laguna S 2.1。主模型仓库查询时公开且不需要 gated 申请,模型卡列出 BF16 主权重,并链接 FP8、INT4、NVFP4、GGUF、MLX 与 DFlash 等变体。公告明确写明,思考和非思考模式都支持最高 100 万 token;模型卡给出的精确值是 1,048,576 token。
不确定性主要集中在两个“可运行”上。第一,Poolside 称推理优化覆盖到单台 NVIDIA DGX Spark,但没有公开单机所用量化、吞吐、并发或实际上下文长度。第二,官方公布的 benchmark 来自内部 Harbor fork、内部沙箱与自家 pool harness;轨迹可以审计运行过程,却不能替代第三方在相同硬件和公开环境中的复现。
对开发者而言,权重、许可证和轨迹已经把试用门槛降下来。对企业部署团队而言,8B 激活参数不等于只需装下 8B 权重,模型的 118B 总权重仍决定静态内存底座,百万上下文还会继续增加 KV 缓存和运行时开销。采购或架构决策应以具体精度、吞吐和上下文实测为准,而不是把三个官方上限直接相乘。
这次究竟开放了什么
Laguna S 2.1 是文本到文本的 MoE 模型,定位是 Agentic coding 与长时任务。公开模型卡描述了 48 层结构,其中 12 层使用全局注意力、36 层使用滑动窗口注意力,滑动窗口为 512 token。路由部分包含 256 个路由专家,每个 token 选择其中 10 个,另有 1 个共享专家。这些公开配置与公告的 118B-A8B口径相互对应,但参数总量仍是发布方披露,本文没有下载全部张量重新计数。
“开放权重”需要和“完整开放训练栈”分开。7 月 21 日的可核验增量是,后训练模型权重、配置、推理模板、许可证和部分评测结果已经公开。公告还称 BF16、FP8、INT4、NVFP4、官方 GGUF 与 MLX 转换、DFlash 草稿模型从首日提供。基础模型,也就是后训练之前的权重,没有作为同一个公开下载物直接列出;公告要求研究者发邮件联系 Poolside。因此,这次发布不是训练数据、训练代码、基础权重全部开源。
仓库时间也不能简化成“7 月 13 日已经发布”。Hugging Face API 记录主仓库的 createdAt 为 7 月 13 日 13:58 UTC,但创建时间不能证明当时已经公开或可完整下载。可精确核验的对外发布锚点是 Poolside 官方 X 的 7 月 21 日 17:05 UTC,同日官方公告上线;API 又记录主仓库在 7 月 21 日 22:26 UTC更新。较稳妥的表述是:仓库可能为发布预先建立,正式对外事件发生在 7 月 21 日,之后主仓库仍在更新。
| 项目 | 已确认状态 | 不能据此推导 |
|---|---|---|
| 模型规模 | 118B 总参数,约 8B 每 token 激活 | 下载体积、显存占用或 KV 缓存只有 8B 规模 |
| 上下文 | 两种模式最高 1,048,576 token | 每个托管端点都开放 1M,或单台工作站能跑满 1M |
| 思考控制 | off 与 max;max 默认开启 | 已支持 low、medium、high 等细粒度预算 |
| 主权重 | BF16 仓库公开,模型卡估算约 236GB | BF16 可直接装入单台 128GB DGX Spark |
| 量化与转换 | 公告称 FP8、INT4、NVFP4、GGUF、MLX 首日提供 | 各精度的质量损失、吞吐与全上下文能力相同 |
| 许可证 | OpenMDW-1.1 允许广泛使用、修改和分发 | 无再分发义务、无权利清理责任或等同完整开源训练栈 |
| 评测轨迹 | 最终运行轨迹站公开任务级记录 | 第三方已在独立环境复现分数 |
思考与非思考不是两套上下文
官方原文把模式写成 off 和 max。max 默认启用,由模型为问题决定测试时计算预算;本次发布没有提供可由用户选择的 low、medium、high 档位。模型卡则展示了按请求传入 enable_thinking: False 的关闭方式,也建议 Agent 场景保留历史消息里的 reasoning content,以便工具调用之间继续思考。
这里需要保留两个状态边界。其一,“两种模式都支持 1M”描述的是模型上下文上限,不是说两种模式具有相同成本。Poolside 公布的图表显示,思考模式会显著增加平均 completion token。其二,模式开关和服务商端点不是同一层。公告称 OpenRouter 免费端点提供 256K,单独的付费端点才提供完整 1M。因此,模型卡写 1M 与某个 API 实际只给 256K 并不矛盾。
Poolside 自报,max thinking 将 Terminal-Bench 2.1 从 60.4%提高到 70.2%,相对非思考基线增加 9.8 个百分点;DeepSWE 从 16.5%提高到 40.4%,增加 23.9 个百分点。这些差值的基准是同一模型的非思考模式,不是相对其他模型的增长,也不是第三方平均提升。官方还承认,Laguna S 2.1 可能长时间思考却没有取得进展,尤其是在竞赛数学任务上,未来版本才计划增加更细的 effort control。
单台 DGX Spark 的主张要怎样理解
Poolside 的准确措辞是,NVIDIA 帮助优化其硬件上的推理,从 Blackwell 系统上的 TRT-LLM 与 NVFP4,一直到单台 NVIDIA DGX Spark。这能确认双方把单机作为支持目标,却没有说明单机演示使用 BF16、FP8、INT4、NVFP4 还是 GGUF,也没有给出 tokens/s、首 token 延迟、并发数和最大实测上下文。
硬件边界说明了为什么不能把这句话写成“118B BF16 单机运行”。模型卡估算 BF16 权重约 236GB;NVIDIA 产品页给单台 DGX Spark 标注 128GB 一致性统一系统内存。仅静态 BF16 权重就超过设备内存,还没有计算运行时状态和百万上下文的 KV 缓存。单机要成立,必然需要更低精度、内存映射或其他压缩与卸载方案;具体是哪一种,公告没有给出。
同理,“单台可运行”和“单台跑满 1M”是两个不同命题。上下文越长,KV 缓存、注意力计算、首 token 等待和持续功耗越难忽略。Laguna S 2.1 使用全局与滑动窗口交错注意力,有助于控制部分长序列成本,但这不能替代硬件实测。当前最可靠的结论只是:Poolside 宣布至少一种优化配置可以落到单台 DGX Spark;完整精度、完整上下文和可用吞吐仍待公开。
评测轨迹比排行榜多了什么
Poolside 为 Laguna S 2.1 公布了 Terminal-Bench 2.1 70.2%、SWE-bench Multilingual 78.5%、SWE-Bench Pro 59.4%、DeepSWE 40.4%、SWE Atlas 46.2%和 Toolathlon Verified 49.7%。这些数字均是 Poolside 的发布口径,不应写成 benchmark 官方对模型的独立认证。
方法细节决定可比性。公告脚注称 Agent 评测使用内部 fork 的 Harbor Framework、公开的 pool Agent harness、最多 500 步和内部沙箱。SWE-bench Multilingual、SWE-Bench Pro 与 Terminal-Bench 2.1 按每题 4 次尝试计算平均 pass@1;DeepSWE 与 SWE Atlas 按 3 次尝试;Toolathlon 取 3 次运行平均。DeepSWE 的官方榜单使用 mini-swe-agent,而 Poolside 报告的是 pool harness,官方自己也明确承认 harness 不同。
横向比较还有另一层口径差异。Poolside 的图表对其他模型取厂商自报、benchmark 作者榜单或 Artificial Analysis 第三方榜单中的最大值,SWE Atlas 是例外。这种做法避免故意选低分对手,却也把不同 harness、不同运行预算和不同报告来源放进同一张表。表格适合判断大致位置,不适合把几分差距解释成稳定能力优势。
轨迹公开仍然是实质进步。轨迹站能展示任务、成功或失败、步数、思考模式和运行记录,外部可以检查模型是否反复试错、是否依赖异常路径,以及得分和过程是否一致。不过,站点自述覆盖五项软件工程 benchmark,并提示全局超时可能不生成轨迹;官方文章对 Toolathlon 使用了另一套 EC2 沙箱和自定义 Agent。由此可见,“完整轨迹”应理解为官方最终评测运行中生成并发布的记录,而不是每一次尝试都必然有文件,更不是外部已经重跑成功。
OpenMDW-1.1 到底允许什么
许可证原文给予用户免费处理模型材料的广泛权利,覆盖使用、修改和分发,并涉及材料中包含的版权、专利、数据库和商业秘密权利。它也明确规定,使用模型产生的输出不受该许可证额外限制。对企业而言,这比只准研究或禁止商用的权重许可证更宽松。
但“开放”不是“没有条件”。再分发任何模型材料时,需要保留许可证副本和适用的版权及来源声明。若用户主动参与诉讼,主张模型材料直接或间接侵犯专利或版权,授权可能终止;针对他人先发诉讼的回应除外。许可证还明确不提供准确性、无缺陷、不侵权等担保,第三方权利清理、必要同意和尽调由使用者负责。
模型卡另外提示,使用者应确认模型适合目标场景,并应与 Poolside 的可接受使用政策保持一致。许可证正文、模型卡提示与企业内部政策应分别审阅,不能只读“commercial and non-commercial”一句就完成合规判断。与此同时,OpenMDW-1.1 覆盖已提供的模型材料,并不会自动补齐未提供的训练数据、基础模型或完整训练基础设施。
已知限制会直接影响 Agent 接入
Poolside 在发布时列出了三类限制。第一是 harness overfitting:第三方 Agent harness 的工具定义与 pool 相似但略有差异时,模型第一次调用可能凭记忆使用错误接口,而不是严格读取 schema;若 harness 拒绝并要求重试,模型通常可在上下文中修正。
第二是嵌套工具调用与 JSON 转义。模型采用类似 XML 的工具调用标记,当参数本身需要 JSON 数组时,可能生成错误转义或无效 JSON。第三是过度思考,模型可能在取得实质进展之前生成很长的思考序列。这三项都意味着,部署团队不能只验证 benchmark 分数,还要测试工具 schema 校验、失败重试、最大思考预算、超时和成本上限。
Laguna S 2.1 的核心价值在于把权重、许可证、运行配置和最终评测轨迹放到同一交付面。开放权重让企业能够自己选择推理引擎和数据边界;公开轨迹则让采购者从“模型得了多少分”追问到“模型怎样得到这个分”。这套可检查的交付面,比单纯增加一个排行榜名次更接近可采购、可审计的 Agent 基础设施。
采购判断仍要拆开三组口径:8B 描述每 token 的激活参数,并未说明权重内存;1M 是模型上限,各服务端点可能另有限额;单台硬件可运行也未承诺 BF16 与满上下文都能在同一台设备上完成。Poolside 原文没有合并这些命题。量化后的质量、长上下文吞吐和 Agent 工具可靠性,才共同决定本地部署价值。
公开轨迹提高了官方自报的可检查性,独立复现仍是缺口。内部 Harbor fork、内部沙箱和 pool harness 都可能影响结果;DeepSWE 的比较甚至明确跨了不同 harness。Laguna S 2.1 因此已经构成一个材料较完整的第三方复现候选,但尚未建立可跨模型、跨硬件直接比较的本地代码 Agent 基线。
接下来看什么
第一,看单台 DGX Spark 配方能否完整公开。至少需要模型精度、推理引擎、权重与运行时内存、可达到的上下文长度、首 token 延迟和持续吞吐。若只展示“能够加载”,它与可用于数小时代码任务仍有明显距离。
第二,看第三方是否用公开 harness 重跑思考模式差值。Terminal-Bench 2.1 的 9.8 个百分点和 DeepSWE 的 23.9 个百分点都很大,但思考 token 也明显增加。复现应同时报告任务成功率、平均输出 token、墙钟时间和成本,才能判断 max thinking 是否具有工程性价比。
第三,看百万上下文的有效利用,而不只是配置值。测试应覆盖远距离代码依赖、跨仓库检索、上下文干扰与多轮工具调用,并报告不同位置的信息召回和修改正确率。能接收 1M token 与能稳定使用其中关键证据,是两件不同的事。
第四,看 Agent 兼容性修复。若模型仍会凭记忆误用第三方工具 schema,开放权重带来的多 harness 选择反而会放大接入成本。工具调用一次成功率、无效 JSON 比例、重试后恢复率和过度思考超时率,可能比再增加一个代码 benchmark 更能决定实际采用。
现阶段可以确认的是,Laguna S 2.1 已在 7 月 21 日完成正式发布,主权重、模型卡、OpenMDW-1.1 许可证和大量最终评测轨迹可公开访问;118B 总参数、8B 激活、两种模式最高 100 万 token均有官方材料互相印证。仍需等待的是单台 DGX Spark 的完整运行口径、第三方 benchmark 复现,以及开放权重在真实企业代码 Agent 中能否同时兑现速度、可靠性与数据控制。