模型发布

Meta开放30B参数Muse Glimmer本地智能体模型

30B开放权重进入消费硬件,模型体积不等于完整智能体的内存与可靠性。

2026年8月11日 · 周二深度报告中置信重要度 4/5

本文要点

  • 从闭权重的Muse Spark能力蒸馏,变成约30B且Apache 2.0开放权重的本地模型。
  • 从只有模型参数,变成BF16、两档4-bit、视觉编码器和DFlash drafter成套发布。
  • 从云端智能体叙事,变成24GB与32GB显存档位可实际下载部署的工程方案。

阅读辅助

先看数字、证据和来源,再读正文。

约29.6B参数规模
131,072 tokens训练上下文
5 条 Claim Audit

Muse Glimmer是约30B参数的稠密多模态智能体模型,并非30B纯文本模型。

5 个时间点

2026-02-06 · DFlash论文上线,提出以块扩散drafter辅助推测解码;这是Glimmer加速组件的技术背景。

8 个来源8 个非 X 来源

Meta在2026年8月10日发布Muse Glimmer,并把基础权重、两档官方GGUF量化、视觉编码器和DFlash推测解码组件一并放出。模型名称里的30B是近似值:Meta模型卡给出的总规模约为29.6B参数,其中含约1.8B参数的视觉编码器;SGLang的拆分口径则是27.9B文本解码器与约1.9B视觉编码器,另有多模态投影器。

本次发布物直接覆盖“本地、常驻、会调用工具”的完整工作流。模型接收文本与图像,输出文本,训练目标覆盖多步规划、函数调用、失败重试和脚手架兼容。Meta还把权重与配套制品标为Apache 2.0,为商业使用、修改和再分发提供了比许多自定义模型许可证更清晰的基础。

边界也必须前置。所谓“低于20GB”只描述约4-bit精度的文本模型权重,不能替代整机容量规划;所谓“消费级硬件”主要由高端Mac和24GB或32GB显存设备支撑,并非任意笔记本都能获得相同体验;公开跑分与速度数据主要来自Meta或与Meta联合发布Day-0支持的SGLang,尚未形成同配置、同脚手架的独立复现。

对本地AI开发者而言,权重确实已经可运行,但工程问题从“能否下载”迁移到了“完整智能体能否在长任务里稳定运行”。对企业部署者而言,本地执行减少了把原始数据发送到云端的必要,却没有自动解决工具权限、审计、提示注入、模型更新和终端设备治理。

先把四个容易混淆的口径拆开

30B是总规模近似值

Muse Glimmer采用稠密因果Transformer,文本侧有52层、隐藏维度6656,注意力按“三层局部、一层全局”重复:局部窗口为2048 tokens,每第四层使用全序列注意力。它还带独立ViT-G/14视觉编码器,单图最多形成4096个视觉token。因此,把Glimmer简称为“30B语言模型”会漏掉视觉组件;更准确的中文表述是“约30B参数的稠密多模态模型”。

Apache 2.0覆盖权重制品,不等于全栈完全开源

基础仓库和GGUF仓库都明确标注apache-2.0。模型卡进一步列出BF16权重、两种4-bit权重、DFlash drafter与视觉编码器均按该许可证发布。Apache 2.0允许使用、修改与分发,并带有专利授权和通知义务,也明确不提供担保。

这使“开放权重”具备较强的再利用空间,但不能把它扩写成“训练过程完全开放”。训练数据只给出类别性描述,完整配方、数据明细和训练代码并未随权重等量公开。模型仓库另附使用政策,部署者还需遵守适用法律。许可证回答的是制品可以怎样再利用,不回答模型在具体场景是否安全、合规或可靠。

“低于20GB”是权重口径,不是峰值内存

官方GGUF仓库给出两个文本文件:较小的K-Quant-17GB文件为16.8GB,较高质量的K-Quant-Dynamic文件为19.7GB。若需要图像输入,还要加载约1.4GB的感知编码器;若需要DFlash推测解码,还要加载约1.6GB的drafter。官方粗略表将较小组合写成文本约17GB、加入视觉约19GB、再加入drafter约20GB;Dynamic组合相应约为20GB、22GB、23GB

这些仍不是完整峰值。运行时缓冲区、KV缓存、上下文长度、并发槽位、图像token和操作系统都会占用额外内存。Meta因此把K-Quant-17GB指向24GB显存,把Dynamic版指向32GB显存。在Apple Silicon上,统一内存还要与系统和其他应用共享,“能装入某台Mac”与“在长上下文下可流畅运行”是两件事。

上下文的硬配置是131,072 tokens

模型卡写“131,072+”,而公开config.jsonmax_position_embeddings设为131072。SGLang认为混合局部/全局注意力和位置编码设计允许向训练长度之外延伸,但这属于可扩展机制说明,不应自动翻译为超长上下文质量已被保证。

官方GGUF文档还提示一个容易让评测失真的细节:llama-server会把总-c-np并发槽位间平分。例如总上下文设为131,072而并发槽位为4时,单请求实际只有32,768 tokens;要让四个槽位各得到训练长度,需要把总量设为524,288。如果长推理在截断后只返回空答案,评测可能把运行配置错误误记为模型能力错误。

厂商跑分显示“有取舍的同尺寸竞争力”

下面数据均来自Meta模型卡,比较对象是Gemma4-31B与Qwen3.6-27B的Thinking Mode,Muse Glimmer使用High Reasoning。它们不是早报的独立实测,也不能脱离各自脚手架直接推导真实产品成功率。

厂商评测项Muse Glimmer-30BGemma4-31BQwen3.6-27B能说明什么
MCP Atlas(公开集)75.554.262.5Meta自报Glimmer在工具协议任务领先
DeepSearch QA74.661.771.1搜索式智能体任务有小幅优势
SWE-Bench Pro51.236.950.2与Qwen接近,领先幅度仅1.0点
SWE-Bench Verified76.066.677.2Qwen反而领先1.2点
OSWorld-Verified65.958.575.6电脑操作任务中Qwen领先明显
TerminalBench 2.151.743.460.7终端代理能力并非全面领先
Siren AgentDojo攻击成功率(越低越好)28.425.640.3安全性与任务效用存在另一组权衡

表中的胜负分布比“同尺寸最强”更有信息量。Glimmer在MCP Atlas、DeepSearch QA、SWE-Bench Pro和若干推理项上占优,但在OSWorld、TerminalBench、SWE-Bench Verified等项目上不占第一。更稳妥的结论是:Meta选择了工具使用、多步流程与多模态输入作为优化中心,公开结果支持“有竞争力”,不支持“在所有智能体任务上领先”。

量化损失同样来自Meta内部测量。官方称K-Quant-Dynamic在15个常用基准准确率平均值上相对全精度下降0.2%,K-Quant-17GB下降1.0%。平均值会隐藏任务分布:工具JSON格式、长链路恢复、视觉定位和某一种语言可能比综合平均更敏感。没有逐项量化前后表,读者不能从“平均只降1.0%”推出每种智能体流程都几乎无损。

速度来自整套推测解码方案

Glimmer的本地速度主张不只靠主模型量化。DFlash drafter用5层网络一次提出16-token块,再由主模型并行验证;被接受的token保持与主模型解码一致,性能收益取决于接受率、实现与硬件。

Meta模型卡报告K-Quant-17GB加量化DFlash、batch size 1、greedy decoding的结果:RTX 5090从74.9 tok/s提升到233.4 tok/s,为3.1倍;M4 Max从23.7升到37.8 tok/s,为1.5倍;M5 Max从26.6升到50.2 tok/s,为1.8倍。RTX使用llama.cpp,Mac使用ExecuTorch,三者并非同一软件栈。

SGLang联合发布页给出另一套结果。其RTX 5090 NVFP4在batch 1时由63.9升到236.4 tok/s/user,batch 8总输出达到1452 tok/s;但RTX 5090的q4_k_m路径只从72.6升至140.7 tok/s/user。不同精度、后端和batch形成的数字不能交叉拼成一个“RTX 5090固定速度”。它们能证明Day-0软件路径已经存在,不能证明普通开发者开箱即得相同吞吐。

消费硬件一词也应按档位理解。RTX 5090是配备32GB显存的高端消费GPU;M4 Max、M5 Max属于高配Apple Silicon;SGLang同时列出RTX PRO 6000、DGX Spark和B300,其中后两类更不能被概括成大众PC。官方“Mac或高性能GPU PC可运行”的表述成立于特定内存与后端配置,不能下沉为所有Mac与主流游戏显卡的普遍承诺。

独立复现缺口

截至本次归档,公开证据已经足以确认权重、文件大小、许可证、模型配置和推理后端存在;还不足以确认Meta整张能力表与端到端体验能够被独立重复。LMSYS文章由“Meta Superintelligence Labs and the SGLang Team”共同署名,应视作合作方工程验证和性能披露,不是与发布方完全隔离的第三方审计。

待复现问题必须固定的变量合格证据应包含
智能体成功率精确模型哈希、量化格式、reasoning strength、token预算、脚手架版本完整任务清单、失败日志、多次运行方差
24GB部署文本权重、视觉组件、drafter、上下文、并发数峰值显存、是否CPU卸载、首token延迟、稳定吞吐
131K上下文单槽实际上下文、KV精度、提示结构、检索位置各长度准确率曲线,而非一次needle命中
DFlash加速batch、采样、接受率、后端commit、功耗限制标准解码与推测解码同机A/B及输出一致性
量化损失BF16基线与两个官方量化、同一评测种子逐基准差值,尤其是工具调用和视觉任务

社区首日讨论已经出现相互冲突的体验:有人报告单卡装入与较高速度,也有人报告工具调用过多、上下文耗尽或特定编码任务弱于Qwen。这些反馈能帮助发现测试维度,却通常没有统一提示、随机种子、版本与任务集,因此正文不把它们升级成模型结论。真正的复现需要可下载日志和环境清单,而不是单个演示视频或一次成功截图。

早报观点

Muse Glimmer的价值在于把本地智能体的“制品拼图”补得较完整:宽松许可证、官方量化、视觉编码器、推测解码drafter以及SGLang、llama.cpp等后端在同一天就位。以往开放权重模型常把运行适配留给社区,这次Meta直接给出24GB与32GB两个容量档位,降低了从模型卡到可运行服务的摩擦。

但发布日最有吸引力的数字也最需要克制。16.8GB文件大小是下载制品,不是智能体总成本;131,072 tokens是配置与训练口径,不是每个并发请求自动获得的质量保证;233.4 tok/s是指定硬件、指定后端、指定解码方式的厂商测试,不是消费设备平均值。若把三者合并成“20GB以内、超长上下文、两百token每秒”,就制造了一个官方原文从未承诺的万能设备画像。

本地智能体竞争开始从“谁有开放权重”转向“谁能同时控制模型体积、KV缓存、工具协议、失败恢复和端侧吞吐”。Glimmer已经提交了一套可信的工程方案,但尚未提交独立复现答案。对开发者更合理的动作,是先用自己的工具集、权限边界和长任务回放做A/B测试,再决定是否替换生产模型。

反面约束同样明确:模型可以离线运行,不代表智能体天然私密;一旦给予文件、终端、浏览器或局域网设备权限,提示注入与误操作仍可能在本机发生。Apache 2.0降低再开发门槛,也把安全评测、沙盒和审计责任更直接地交给集成者。

落地时怎样读这些数字

个人开发者若只有24GB显存,应从16.8GB文本量化开始,把视觉与drafter视为可选增量,并记录加载后的真实余量。评测长上下文前先检查每个slot的n_ctx_slot,否则并发切分会让“131K测试”实际只跑到更短窗口。需要图像输入时,还要把视觉编码器与视觉token带来的峰值纳入测量。

企业团队不应只复跑单轮问答。Muse Glimmer的目标是常驻智能体,测试集应覆盖工具schema错误、超时、权限拒绝、网页提示注入、重复调用、上下文压缩、进程重启和不可逆操作确认。成功率之外还要记录每个成功任务消耗的token、工具调用次数、墙钟时间和能耗;一个最终完成但发起上百次调用的agent,经济性与风险可能都不合格。

模型评测者则应把BF16、K-Quant-Dynamic与K-Quant-17GB分开报告,并固定推理强度。模型支持low、medium、high、xhigh四档reasoning strength;若Glimmer用xhigh而比较对象用较低预算,排行榜会把更多计算误写成更强模型。公开模型哈希、运行时commit和脚手架配置,是把发布数据变成可复现知识的最低门槛。

后续验证信号

  • 等待第三方发布MCP Atlas、SWE-Bench Pro、OSWorld与TerminalBench的完整运行日志,而不只公布总分。
  • 观察24GB显卡在文本、视觉、DFlash与131K单槽同时开启时是否需要CPU卸载,以及卸载后的延迟。
  • 比较同一任务在BF16、19.7GB Dynamic与16.8GB版本上的工具格式错误率和失败恢复率。
  • 跟踪llama.cpp与SGLang版本迭代。Day-0“可以加载”不等于所有聊天模板、并行工具调用和缓存路径已经稳定。
  • 核对超出131,072 tokens后的分段质量曲线;单次百万token演示不能替代按长度、位置与任务类型统计。
来源口径与背景说明

Meta发布页、模型卡与GGUF仓库属于官方一手材料,负责证明“发布了什么、参数与文件是什么、官方如何测”。LMSYS页面日期为2026年8月10日,是本稿可识别日期的新鲜非X锚点,同时披露SGLang Day-0实现与联合性能测试;由于Meta参与署名,它不被当成完全独立复现。llama.cpp PR用于核对支持代码合并状态。Hacker News只用于观察社区问题意识,不承担关键性能证明。

Apache License 2.0页面、2026年2月6日上线的DFlash论文以及2026年4月8日的Muse Spark发布均为背景来源,不作为8月11日新增事件。当天的新闻增量仍是8月10日开放Glimmer权重及配套本地推理制品。