模型训练

单源跟进|Marin 535B公开训练

Marin 535B更像公开训练过程的待验证样本。

2026年8月23日 · 周日深度报告低置信重要度 4/5
#Marin#开放训练#MoE#GB200#Stanford

本文要点

  • Marin 535B计划从原帖披露,进入8月22日社区和公开报告跟踪。
  • 训练计划从背景愿景,变成可按训练曲线、checkpoint和仓库变更跟踪的事件。
  • 同日仓库活动显示checkpoint读取和CoreWeave对象策略仍在修补。

阅读辅助

先看数字、证据和来源,再读正文。

535B-A23B目标模型
18.75T训练tokens
5 条 Claim Audit

535B-A23B训练启动是单源披露,尚非官方发布页确认。

7 个时间点

2026-05-11 · Open Athena发布Delphi缩放套件文章,称用小模型预测更大训练。

8 个来源6 个非 X 来源

这条新闻值得读,但必须带着边界读。8月22日,中文社区转述了 Percy Liang 前一晚关于 Marin 535B-A23B 的训练计划,W&B 公开报告也在同日更新。训练启动这件事仍追溯到 Percy Liang 8月21日原帖,直接证据尚未升级为非 X 官方公告或模型卡确认。

可以核到的增量分成三层。第一,Percy 原帖列出 18.75T tokens80% pretraining20% midtraining11 x GB200 NVL72、约 3个月2.7e24 FLOPs 等计划数字。第二,W&B 报告提供公开跟踪入口,早前 GitHub issue 只作为背景线索。第三,8月22日 Marin 仓库合入了 TensorStore 低速请求重试和 CoreWeave bucket 访问策略调整。

这意味着本篇不能把 Marin 535B 写成“模型发布”,也不能把原帖里的训练计划写成已完成结果。更准确的新闻口径是:训练计划在8月22日进入社区转述和公开跟踪阶段;启动状态仍按单源披露处理;同日基础设施修补显示训练相关工程栈仍在推进。

对研究者来说,当前价值来自一个可跟踪的前沿级训练样本,而非立即可用的新模型。若 Marin 后续真的公开训练曲线、checkpoint、数据配方和失败记录,社区获得的将是一条从缩放实验走向大模型训练的过程链。

单源披露了哪些具体计划

Percy Liang 原帖给出的核心句式是“Marin 535B-A23B started training this week”。这句话的时态是已经开始训练,排除了“即将开始”或“已经完成”的含义。由于目前直接证据主要来自这条 X 原帖,早报采用“单源跟进”的标题和低置信标记。

原帖同时给出了一组很具体的训练账本。目标模型是 535B-A23B,其中 A23B 可理解为每 token 激活约 23B 参数的口径。训练数据量为 18.75T tokens,其中 80% 用于 pretraining,20% 用于 midtraining,之后还有 post-training。硬件计划是 11 x GB200 NVL72,周期约 3个月,总计算量约 2.7e24 FLOPs

这组数字的特殊之处在于,它属于训练开始时的计划清单。对公开训练项目来说,计划口径本身有新闻价值,因为它给外部观察者提供了未来三个月可追踪的基线:如果训练曲线、checkpoint或中途调整被公开,读者可以把后续变化放回这张账本里比较。

项目原帖披露的口径本文采用写法不确定性
训练状态started training this week单源称本周开训尚无非 X 同等公告确认
目标模型535B-A23B535B总参数级MoE,A23B为激活参数口径架构细节未在非X来源展开
数据规模18.75T tokens18.75T tokens训练计划数据混合与清洗细节待公开
训练阶段80% pretraining20% midtraining预训练占80%,中期训练占20%post-training计划未见细节
算力与周期11 x GB200 NVL72,约 3个月训练资源和周期计划实际利用率、中断和迁移待核
计算量2.7e24 FLOPshero run计划计算量与README中5e24 model-FLOPs目标需后续对齐

表里的每个数字都应按“计划披露”处理。尤其是 2.7e24 FLOPs18.75T tokens,它们属于训练计划,不代表模型效果,也不能推出最终能力。当前更稳妥的问题是:Marin是否会把这些数字从一条原帖,转化为可持续更新的训练记录。

非 X 来源能证明什么

Marin README 提供了项目定位。它说 Marin 是一个 research program、software platform 和 community,关注训练大语言模型,范围包括数据整理、转换、过滤、tokenization、pretraining、posttraining 和 evaluation。README 还说 Marin 承诺公开分享构建这些模型所需的 process knowledge,并记录从原始数据到最终模型的每个步骤,失败实验也是记录的一部分。

Open Athena 的“Open Development of Frontier AI”文章给出了更大的方法论背景。文章区分了模型权重、技术报告和过程知识,认为前沿 AI 的关键不只在最终权重,也在实验如何被设计、数据如何被选择、训练风险如何被处理。它把 Marin 描述为把前沿 AI 过程知识变成公共物品的一次尝试。

Delphi 缩放套件文章说明 Marin 此前已经用“公开缩放实验”做过铺垫。Open Athena 称 Delphi 覆盖从 3e181e23 FLOPs 的开放 scaling suite,并用较小运行外推更大运行的表现。这个背景不能证明 535B-A23B 已经开训,但能解释为什么 Percy 原帖特别强调缩放阶梯和公开训练曲线:Marin 的叙事聚焦小规模实验如何通向大规模训练。

同日 GitHub 活动能支撑的结论更窄。8月22日 commit be0571f 处理 TensorStore curl 低速请求,目标是在 checkpoint 读取卡住时通过原生 S3 重试恢复。另一个 commit 0699eaf 调整 CoreWeave bucket policies,保留 Open Athena organization 的 S3 访问,并对 marin/grug/hero-* 路径下对象和版本删除设置 deny。这些变更与训练运行、checkpoint、对象存储和基础设施可靠性相关,但它们不能单独证明 535B-A23B 训练状态。

所以本文把非 X 来源放在两个位置:一是证明 Marin 公开开发的制度背景,二是证明仓库和 W&B 在目标窗口内有可跟踪活动。训练启动本身仍回到 Percy Liang 原帖。这种区分比简单堆来源更重要,因为信源数量不能替代信源能证明的事实。

缩放阶梯为何是核心线索

原帖里最值得盯的是 “4-rung scaling ladder from 1.6B-A61M 48B tokens to 27.7B-A1.2B 926B tokens”。它说明团队先用四档小规模运行建立缩放判断,再把结果推向 hero run,降低直接启动超大MoE配置的风险。

这个表达也对应 Marin 过去几个月的公开材料。Delphi 文章强调,用一致 recipe 训练不同 compute budget 的模型,可以让小模型结果预测大模型表现。Marin 32B retrospective 则展示了另一面:即使有前序经验,放大到 32B 时仍会遇到 loss spike、重启、优化器替换、QK-Norm切换、cooldown数据问题等中途事件。公开训练的价值,恰恰来自这些不顺利过程也能被留下来。

这对 535B-A23B 尤其关键。MoE训练的公开结果通常容易停在参数量、token量和少数benchmark上,但训练期的难点往往分布在路由、负载均衡、数据混合、checkpoint恢复、跨集群调度和中途决策。若 Marin 继续按开放开发方式记录,外部研究者有机会看到一个大规模MoE如何从若干小阶梯、工程修补和训练日志中逐步走出来。

缩放线索原帖或背景材料对读者的意义
起点1.6B-A61M48B tokens低成本运行用于验证配方和缩放方向
终点前阶梯27.7B-A1.2B926B tokens中等规模MoE用来降低直接上hero run的风险
目标训练535B-A23B18.75T tokens若公开日志持续更新,将成为前沿MoE训练过程样本
过程理念README与Open Athena强调公开过程知识新闻价值取决于后续公开程度,而非单条宣布

这里还有一个数字口径要分开。Percy 原帖写 2.7e24 FLOPs,Marin README 的“Frontier mixture-of-experts”背景写当前关注的是从零预训练并后训练一个 5e24 model-FLOPs500 billion+ total parameters 的大型MoE。两个数字的关系不能靠猜测补齐,可能涉及是否只统计某阶段、是否使用不同FLOPs口径、是否包含后训练或更完整目标。早报只保留“需后续对齐”的观察点。

对开放训练的考验

公开训练的核心难点在持续公开中间状态。一次三个月级别的训练会遇到很多新闻稿不愿呈现的内容:吞吐不稳定、训练中断、数据管线延迟、checkpoint读取失败、某个缩放假设不成立、路由负载出现偏差、评测曲线不如预期。Marin过往材料把失败实验和过程知识放进公开记录,这让本次 535B 计划有了可观察价值。

但也正因为它还在训练开始阶段,读者需要警惕两类过度推断。第一,不能把“计划训练 18.75T tokens”理解成已经训练完这么多 tokens。第二,不能把 535B-A23B 理解成可下载、可调用或已通过评测的模型。今天可验证的只是一条单源启动披露,以及公开仓库中训练基础设施继续活跃。

对学术实验室和开源社区来说,这种披露如果持续,会补上开源权重常常缺失的一层材料。很多模型发布会告诉你最终得分,却不会告诉你小规模试验如何失败、为什么某个数据混合被放弃、训练期如何判断该不该切换 recipe。Marin 若把这些材料公开,将提供一种不同于“开源权重”的公共品。

对商业模型公司来说,这条线索短期不会改变产品格局。三个月训练周期意味着它现在尚未成为可用模型;post-training、评测、许可和服务部署都没有定论。它更像一个公开的生产过程样本,对想理解大模型训练的人重要,对今天选型模型API的团队影响有限。

早报观点

早报判断是,Marin 535B的新闻价值落在过程透明度。单看 535B-A23B18.75T tokens11 x GB200 NVL72,这仍是一组未经非X公告确认的计划数字;如果后续曲线、checkpoint、数据配方、失败记录和中途决策持续公开,Marin可能提供比最终权重更稀缺的东西。

这条报道必须低置信处理,因为训练启动只有 Percy Liang 原帖作为直接证据。低置信不等于低价值,关键在于它有明确的后续验证路径:训练仪表盘是否出现,仓库是否持续落下与hero run直接相关的配置,checkpoint是否按阶段释放,Open Athena是否用正式文章解释FLOPs口径和缩放阶梯。

最值得跟的是公开开发能否扛住大规模训练的不确定性。开放训练如果只公开顺利节点,价值会迅速退化成营销;如果连中断、回滚、失败实验和配方调整都能进入公共记录,它才区别于常见的开源权重发布。

接下来看什么

后续最直接的验证点,是 Marin 或 Open Athena 是否给出非 X 版本公告。公告不需要包装成发布会,但至少应确认 535B-A23B 的训练状态、硬件口径、训练目标和公开更新节奏。没有这一步,所有训练启动表述都应继续带“单源称”。

第二个观察点是训练曲线和 checkpoint。若项目按 README 所说记录 every step,外部读者应能看到损失曲线、吞吐、训练中断、checkpoint位置、评测切片和阶段切换。尤其是 80% pretraining20% midtraining 的边界,它决定这次训练到底是纯规模扩张,还是把中期训练作为能力塑形的关键阶段。

第三个观察点是缩放阶梯是否可复核。原帖写的四档 ladder 从 1.6B-A61M48B tokens27.7B-A1.2B926B tokens,应该能在公开实验、配置文件或报告中找到对应关系。如果这些阶梯只是口头总结,学术可复用价值会受限;如果能复现实验设置,就能成为其他团队判断MoE缩放的参考。

第四个观察点是基础设施变更是否继续指向hero run。8月22日的 TensorStore 和 CoreWeave commit 说明仓库正在处理 checkpoint读取、对象存储和访问策略,但它们仍是间接证据。更强的证据会是带有 535B、A23B、hero run、GB200 或训练配置名称的公开PR、issue、run manifest和数据浏览器入口。

最后要看的是失败记录是否公开。前沿训练的公共知识往往藏在“为什么某个配置不行”的记录里。Marin 32B retrospective 已经展示过这种写法:loss spike、重启、优化器替换和数据污染都能成为可学习材料。535B训练若也能保留这层透明度,它才会从一条单源社交媒体消息,变成有公共研究价值的开放训练案例。