模型发布

Poolside 发布 Laguna S 2.1 开放权重模型

开放权重、稀疏激活与长上下文进入同一代码模型,但单机部署和评测优势仍待独立复现。

2026年7月22日 · 周三深度报告高置信重要度 4/5
#Poolside#Laguna#开放权重#MoE#本地部署

本文要点

  • 从只看官方分数,变为可下载权重并检查最终评测轨迹。
  • 从 225B-A23B 的 M.1,变为 118B-A8B 的更低运行激活规模。
  • 从单一回答模式,变为按请求切换关闭或最大思考。

阅读辅助

先看数字、证据和来源,再读正文。

118B总参数
约 8B每 token 激活参数
5 条 Claim Audit

Laguna S 2.1 是 118B 总参数、每 token 约激活 8B 的 MoE 开放权重模型。

5 个时间点

2026-04-28 · Poolside 发布 Laguna M.1 与 XS.2;这是本次公告回溯的家族背景,不是 7 月 21 日新增。

7 个来源6 个非 X 来源

Laguna S 2.1 值得关注,不是因为又多了一个代码模型名字,而是 Poolside 把 118B 总参数、每 token 约激活 8B、最高 1,048,576 token 上下文和开放权重放进同一版本,并把最终评测轨迹交给外部检查。它试图回答一个更实际的问题:长时代码 Agent 是否可以不依赖超大云端集群,也能进入企业自有硬件和数据边界。

已经确认的事实是,Poolside 在 2026 年 7 月 21 日发布 Laguna S 2.1。主模型仓库查询时公开且不需要 gated 申请,模型卡列出 BF16 主权重,并链接 FP8、INT4、NVFP4、GGUF、MLX 与 DFlash 等变体。公告明确写明,思考和非思考模式都支持最高 100 万 token;模型卡给出的精确值是 1,048,576 token

不确定性主要集中在两个“可运行”上。第一,Poolside 称推理优化覆盖到单台 NVIDIA DGX Spark,但没有公开单机所用量化、吞吐、并发或实际上下文长度。第二,官方公布的 benchmark 来自内部 Harbor fork、内部沙箱与自家 pool harness;轨迹可以审计运行过程,却不能替代第三方在相同硬件和公开环境中的复现。

对开发者而言,权重、许可证和轨迹已经把试用门槛降下来。对企业部署团队而言,8B 激活参数不等于只需装下 8B 权重,模型的 118B 总权重仍决定静态内存底座,百万上下文还会继续增加 KV 缓存和运行时开销。采购或架构决策应以具体精度、吞吐和上下文实测为准,而不是把三个官方上限直接相乘。

这次究竟开放了什么

Laguna S 2.1 是文本到文本的 MoE 模型,定位是 Agentic coding 与长时任务。公开模型卡描述了 48 层结构,其中 12 层使用全局注意力、36 层使用滑动窗口注意力,滑动窗口为 512 token。路由部分包含 256 个路由专家,每个 token 选择其中 10 个,另有 1 个共享专家。这些公开配置与公告的 118B-A8B口径相互对应,但参数总量仍是发布方披露,本文没有下载全部张量重新计数。

“开放权重”需要和“完整开放训练栈”分开。7 月 21 日的可核验增量是,后训练模型权重、配置、推理模板、许可证和部分评测结果已经公开。公告还称 BF16、FP8、INT4、NVFP4、官方 GGUF 与 MLX 转换、DFlash 草稿模型从首日提供。基础模型,也就是后训练之前的权重,没有作为同一个公开下载物直接列出;公告要求研究者发邮件联系 Poolside。因此,这次发布不是训练数据、训练代码、基础权重全部开源。

仓库时间也不能简化成“7 月 13 日已经发布”。Hugging Face API 记录主仓库的 createdAt7 月 13 日 13:58 UTC,但创建时间不能证明当时已经公开或可完整下载。可精确核验的对外发布锚点是 Poolside 官方 X 的 7 月 21 日 17:05 UTC,同日官方公告上线;API 又记录主仓库在 7 月 21 日 22:26 UTC更新。较稳妥的表述是:仓库可能为发布预先建立,正式对外事件发生在 7 月 21 日,之后主仓库仍在更新。

项目已确认状态不能据此推导
模型规模118B 总参数,约 8B 每 token 激活下载体积、显存占用或 KV 缓存只有 8B 规模
上下文两种模式最高 1,048,576 token每个托管端点都开放 1M,或单台工作站能跑满 1M
思考控制offmax;max 默认开启已支持 low、medium、high 等细粒度预算
主权重BF16 仓库公开,模型卡估算约 236GBBF16 可直接装入单台 128GB DGX Spark
量化与转换公告称 FP8、INT4、NVFP4、GGUF、MLX 首日提供各精度的质量损失、吞吐与全上下文能力相同
许可证OpenMDW-1.1 允许广泛使用、修改和分发无再分发义务、无权利清理责任或等同完整开源训练栈
评测轨迹最终运行轨迹站公开任务级记录第三方已在独立环境复现分数

思考与非思考不是两套上下文

官方原文把模式写成 offmaxmax 默认启用,由模型为问题决定测试时计算预算;本次发布没有提供可由用户选择的 low、medium、high 档位。模型卡则展示了按请求传入 enable_thinking: False 的关闭方式,也建议 Agent 场景保留历史消息里的 reasoning content,以便工具调用之间继续思考。

这里需要保留两个状态边界。其一,“两种模式都支持 1M”描述的是模型上下文上限,不是说两种模式具有相同成本。Poolside 公布的图表显示,思考模式会显著增加平均 completion token。其二,模式开关和服务商端点不是同一层。公告称 OpenRouter 免费端点提供 256K,单独的付费端点才提供完整 1M。因此,模型卡写 1M 与某个 API 实际只给 256K 并不矛盾。

Poolside 自报,max thinking 将 Terminal-Bench 2.1 从 60.4%提高到 70.2%,相对非思考基线增加 9.8 个百分点;DeepSWE 从 16.5%提高到 40.4%,增加 23.9 个百分点。这些差值的基准是同一模型的非思考模式,不是相对其他模型的增长,也不是第三方平均提升。官方还承认,Laguna S 2.1 可能长时间思考却没有取得进展,尤其是在竞赛数学任务上,未来版本才计划增加更细的 effort control。

单台 DGX Spark 的主张要怎样理解

Poolside 的准确措辞是,NVIDIA 帮助优化其硬件上的推理,从 Blackwell 系统上的 TRT-LLM 与 NVFP4,一直到单台 NVIDIA DGX Spark。这能确认双方把单机作为支持目标,却没有说明单机演示使用 BF16、FP8、INT4、NVFP4 还是 GGUF,也没有给出 tokens/s、首 token 延迟、并发数和最大实测上下文。

硬件边界说明了为什么不能把这句话写成“118B BF16 单机运行”。模型卡估算 BF16 权重约 236GB;NVIDIA 产品页给单台 DGX Spark 标注 128GB 一致性统一系统内存。仅静态 BF16 权重就超过设备内存,还没有计算运行时状态和百万上下文的 KV 缓存。单机要成立,必然需要更低精度、内存映射或其他压缩与卸载方案;具体是哪一种,公告没有给出。

同理,“单台可运行”和“单台跑满 1M”是两个不同命题。上下文越长,KV 缓存、注意力计算、首 token 等待和持续功耗越难忽略。Laguna S 2.1 使用全局与滑动窗口交错注意力,有助于控制部分长序列成本,但这不能替代硬件实测。当前最可靠的结论只是:Poolside 宣布至少一种优化配置可以落到单台 DGX Spark;完整精度、完整上下文和可用吞吐仍待公开。

评测轨迹比排行榜多了什么

Poolside 为 Laguna S 2.1 公布了 Terminal-Bench 2.1 70.2%、SWE-bench Multilingual 78.5%、SWE-Bench Pro 59.4%、DeepSWE 40.4%、SWE Atlas 46.2%和 Toolathlon Verified 49.7%。这些数字均是 Poolside 的发布口径,不应写成 benchmark 官方对模型的独立认证。

方法细节决定可比性。公告脚注称 Agent 评测使用内部 fork 的 Harbor Framework、公开的 pool Agent harness、最多 500 步和内部沙箱。SWE-bench Multilingual、SWE-Bench Pro 与 Terminal-Bench 2.1 按每题 4 次尝试计算平均 pass@1;DeepSWE 与 SWE Atlas 按 3 次尝试;Toolathlon 取 3 次运行平均。DeepSWE 的官方榜单使用 mini-swe-agent,而 Poolside 报告的是 pool harness,官方自己也明确承认 harness 不同。

横向比较还有另一层口径差异。Poolside 的图表对其他模型取厂商自报、benchmark 作者榜单或 Artificial Analysis 第三方榜单中的最大值,SWE Atlas 是例外。这种做法避免故意选低分对手,却也把不同 harness、不同运行预算和不同报告来源放进同一张表。表格适合判断大致位置,不适合把几分差距解释成稳定能力优势。

轨迹公开仍然是实质进步。轨迹站能展示任务、成功或失败、步数、思考模式和运行记录,外部可以检查模型是否反复试错、是否依赖异常路径,以及得分和过程是否一致。不过,站点自述覆盖五项软件工程 benchmark,并提示全局超时可能不生成轨迹;官方文章对 Toolathlon 使用了另一套 EC2 沙箱和自定义 Agent。由此可见,“完整轨迹”应理解为官方最终评测运行中生成并发布的记录,而不是每一次尝试都必然有文件,更不是外部已经重跑成功。

OpenMDW-1.1 到底允许什么

许可证原文给予用户免费处理模型材料的广泛权利,覆盖使用、修改和分发,并涉及材料中包含的版权、专利、数据库和商业秘密权利。它也明确规定,使用模型产生的输出不受该许可证额外限制。对企业而言,这比只准研究或禁止商用的权重许可证更宽松。

但“开放”不是“没有条件”。再分发任何模型材料时,需要保留许可证副本和适用的版权及来源声明。若用户主动参与诉讼,主张模型材料直接或间接侵犯专利或版权,授权可能终止;针对他人先发诉讼的回应除外。许可证还明确不提供准确性、无缺陷、不侵权等担保,第三方权利清理、必要同意和尽调由使用者负责。

模型卡另外提示,使用者应确认模型适合目标场景,并应与 Poolside 的可接受使用政策保持一致。许可证正文、模型卡提示与企业内部政策应分别审阅,不能只读“commercial and non-commercial”一句就完成合规判断。与此同时,OpenMDW-1.1 覆盖已提供的模型材料,并不会自动补齐未提供的训练数据、基础模型或完整训练基础设施。

已知限制会直接影响 Agent 接入

Poolside 在发布时列出了三类限制。第一是 harness overfitting:第三方 Agent harness 的工具定义与 pool 相似但略有差异时,模型第一次调用可能凭记忆使用错误接口,而不是严格读取 schema;若 harness 拒绝并要求重试,模型通常可在上下文中修正。

第二是嵌套工具调用与 JSON 转义。模型采用类似 XML 的工具调用标记,当参数本身需要 JSON 数组时,可能生成错误转义或无效 JSON。第三是过度思考,模型可能在取得实质进展之前生成很长的思考序列。这三项都意味着,部署团队不能只验证 benchmark 分数,还要测试工具 schema 校验、失败重试、最大思考预算、超时和成本上限。

早报观点

Laguna S 2.1 的核心价值在于把权重、许可证、运行配置和最终评测轨迹放到同一交付面。开放权重让企业能够自己选择推理引擎和数据边界;公开轨迹则让采购者从“模型得了多少分”追问到“模型怎样得到这个分”。这套可检查的交付面,比单纯增加一个排行榜名次更接近可采购、可审计的 Agent 基础设施。

采购判断仍要拆开三组口径:8B 描述每 token 的激活参数,并未说明权重内存;1M 是模型上限,各服务端点可能另有限额;单台硬件可运行也未承诺 BF16 与满上下文都能在同一台设备上完成。Poolside 原文没有合并这些命题。量化后的质量、长上下文吞吐和 Agent 工具可靠性,才共同决定本地部署价值。

公开轨迹提高了官方自报的可检查性,独立复现仍是缺口。内部 Harbor fork、内部沙箱和 pool harness 都可能影响结果;DeepSWE 的比较甚至明确跨了不同 harness。Laguna S 2.1 因此已经构成一个材料较完整的第三方复现候选,但尚未建立可跨模型、跨硬件直接比较的本地代码 Agent 基线。

接下来看什么

第一,看单台 DGX Spark 配方能否完整公开。至少需要模型精度、推理引擎、权重与运行时内存、可达到的上下文长度、首 token 延迟和持续吞吐。若只展示“能够加载”,它与可用于数小时代码任务仍有明显距离。

第二,看第三方是否用公开 harness 重跑思考模式差值。Terminal-Bench 2.1 的 9.8 个百分点和 DeepSWE 的 23.9 个百分点都很大,但思考 token 也明显增加。复现应同时报告任务成功率、平均输出 token、墙钟时间和成本,才能判断 max thinking 是否具有工程性价比。

第三,看百万上下文的有效利用,而不只是配置值。测试应覆盖远距离代码依赖、跨仓库检索、上下文干扰与多轮工具调用,并报告不同位置的信息召回和修改正确率。能接收 1M token 与能稳定使用其中关键证据,是两件不同的事。

第四,看 Agent 兼容性修复。若模型仍会凭记忆误用第三方工具 schema,开放权重带来的多 harness 选择反而会放大接入成本。工具调用一次成功率、无效 JSON 比例、重试后恢复率和过度思考超时率,可能比再增加一个代码 benchmark 更能决定实际采用。

现阶段可以确认的是,Laguna S 2.1 已在 7 月 21 日完成正式发布,主权重、模型卡、OpenMDW-1.1 许可证和大量最终评测轨迹可公开访问;118B 总参数、8B 激活、两种模式最高 100 万 token均有官方材料互相印证。仍需等待的是单台 DGX Spark 的完整运行口径、第三方 benchmark 复现,以及开放权重在真实企业代码 Agent 中能否同时兑现速度、可靠性与数据控制。