模型发布

Qwen首次开放Max级权重,2.4T模型进入可下载阶段

Max级模型从云端服务走向可检查权重,但定制许可与集群成本划定了实际开放边界。

2026年8月13日 · 周四深度报告高置信重要度 5/5

本文要点

  • Qwen-Max级模型从云端服务与预发布仓库,变成带正式许可和对外公告的开放权重对象。
  • 开放对象首次明确为2.4T总参数、95B激活参数的MoE,而非只公布托管模型名称。
  • 许可从模糊的开放承诺,变成包含显名义务和特定业务单独许可门槛的法律文本。

阅读辅助

先看数字、证据和来源,再读正文。

2.4T模型总参数
95B每token激活参数
6 条 Claim Audit

Qwen3.8是Qwen首次把Max级模型推进到公开可下载权重,而不再只有托管API。

4 个时间点

2026-08-02 · Qwen Cloud页面更新托管版Qwen3.8-Max,列出视觉输入、1M上下文、内置工具与API价格。

7 个来源7 个非 X 来源

4.89 TB,是理解这次开放最直接的入口。北京时间2026年8月12日,Qwen正式对外开放Qwen3.8-2.4T-A95B,ModelScope给出当天集合日期,Hugging Face则在10:24 UTC留下许可提交。文件树已经能看到213个safetensors分片,因此这不是“将在稍后提供”的预告,也不只是一个云端模型名称。

模型规模口径也已落到可检查文档:总参数2.4T,每个token激活约95B;原生上下文为262,144 tokens,官方称可扩展至1,010,000 tokens。Qwen模型卡把它称为首次将Qwen-Max级模型作开放发布。这里的“首次”是厂商对自身产品线的描述,但仓库制品足以证明状态迁移:Max级能力第一次有了公开可获取的权重对象。

仍未解决的是能力复现与上游透明度。Qwen没有随仓库给出训练数据构成、训练算力、能耗、完整安全评测或系统卡;官方benchmark覆盖很多任务,却混用了厂商自测、内部题集、不同脚手架和不同竞品来源。第三方对云端Qwen3.8 Max的评测也不能自动证明同一结果能在公开权重、自建推理栈上复现。

对研究机构,变化在于能够检查参数、测试量化、修改推理和研究模型行为。对企业买方,问题则从“API能不能调用”扩展为“许可证是否适配、数TB制品如何治理、几台高端节点才能上线、开放版是否具备云端版所宣传的完整功能”。这四项不能用一个“开源”标签代替尽调。

先辨认对象:权重版与云端Max不是同一个交付面

Qwen模型卡在开头主动区分了两种对象。公开仓库是后训练后的文本模型权重和Transformers配置,官方云端Qwen3.8-Max则以这套权重为基础,叠加视觉输入、非思考模式、默认百万上下文和内置工具。报道若把两者合并,就会把托管系统能力误写成下载后天然拥有的权重能力。

交付项开放权重Qwen3.8-2.4T-A95B云端Qwen3.8-Max证据边界
输入模态仅文本文本、图片、视频模型卡与Qwen Cloud产品页
思考模式强制开启;模型卡称不可关闭支持非思考官方明确区分;框架改模板不等于复现云端后训练
上下文原生262,144,可扩展至1,010,000默认1M,最大输入约991K扩展上限不等于相同质量、吞吐或显存成本
工具体系提供聊天模板和工具调用接入线索带官方内置搜索、代码解释等工具工具系统不是权重文件的一部分
获取方式下载4.89 TB仓库,自建推理按API调用自建需要自己承担集群、运维和安全隔离
法律条件qwen3.8-max定制许可Qwen Cloud服务条款两套交付面的合同与责任边界不同

模型卡还给出reasoning_effortxhighmediumlow三档,以及preserve_thinking历史思考保留参数。这些是推理控制接口,不应被理解为公开了推理过程的训练数据,也不意味着关闭思考后还能保持云端版能力。开放版文档甚至明确说每次输出会先生成<think>段落;生产系统需要据此设计输出过滤、日志保存和敏感信息治理。

2.4T如何落到一次前向计算

2.4T容易制造“每个请求都计算2.4万亿参数”的误解。Qwen3.8采用混合专家架构,每层有512个专家,每个token选择10个路由专家并同时使用1个共享专家,所以激活参数约为95B。总参数决定模型可容纳的专家容量与权重体积,激活参数更接近单token计算路径,但吞吐仍受专家路由、跨卡通信、KV缓存、批量大小和实现优化共同影响。

架构并非纯Transformer全注意力堆叠。官方模型卡列出92层,隐藏维度8192vLLM配方进一步读取配置后说明,其中23层运行全注意力,另69层使用线性注意力。每隔若干线性注意力层插入全注意力,是在长上下文表达能力、状态缓存与计算成本之间做折中。该配方还确认权重索引没有视觉张量,再次支持“公开制品是文本模型”的判断。

架构维度公开口径对部署的实际含义
总参数2.4T权重存储、下载和跨节点装载是首要成本
激活参数95B/token单token不遍历全部权重,但仍属于超大激活规模
专家路由10 routed + 1 shared专家并行与互联效率会直接影响吞吐
模型层数92层vLLM读取为23层全注意力 + 69层线性注意力
原生上下文262,144 tokens原生长度也需要可观KV或状态缓存与长提示预填充时间
扩展上限1,010,000 tokens是配置能力上限,不是百万token质量和成本承诺

这些数字目前主要由Qwen模型卡、ModelScope官方镜像和推理框架对配置文件的读取相互印证。它们能证明结构声明一致,不能独立审计训练时到底使用了多少数据、专家是否得到均衡训练,也不能推导开放版与云端Max完全同权。公开权重扩大了下游可检查范围,但上游训练透明度没有同步达到同一层级。

从仓库体积到集群账单

Hugging Face文件树显示仓库总量为4.89 TB。前几十个分片常见34.4 GB17.2 GB,另有少量约4 GB分片;文件名标明权重共213片。这证明制品可下载,也同时说明“开放”首先服务于具备高速网络、对象存储和多节点GPU集群的机构,而非典型单机开发者。

vLLM把容量换算得更具体:BF16权重约4.45 TiB,十进制换算后与Hugging Face的4.89 TB大体对应;其部署规划表给出的加载规模约5871 GB。官方FP8变体约2.27 TiB权重,配方估算加载规模约2996 GB。第三方MXFP4与NVFP4 W4A4制品进一步降到约1.45 TiB1.32 TiB,但量化误差、内核兼容和长上下文稳定性需要逐项验证。

变体权重体积vLLM规划的加载规模示例硬件规划口径限制
BF16主仓库4.45 TiB5871 GB配方示例约需6个8×H200节点容量规划,不是吞吐实测
官方FP82.27 TiB2996 GB配方示例约需4个8×H200节点精度、内核和并行策略会影响实际结果
MXFP41.45 TiB1917 GB配方称可在1个8×MI355X节点装载第三方量化制品,不等于官方原始权重
NVFP4 W4A41.32 TiB1737 GB配方称可在1个8×B300节点装载面向Blackwell;需验证任务精度与长上下文

即使模型权重能装入显存,生产服务仍要为KV缓存或线性注意力状态、并发批次、通信缓冲、CUDA图、推理引擎进程和故障冗余留空间。把最大长度从262K推到约1M还会增加预填充时延与缓存压力。vLLM示例使用16卡、2节点张量并行启动FP8,并把引擎就绪超时放宽至3600秒;这类操作提示比“兼容vLLM”一句更接近真实工程门槛。

因此,开放权重短期最可能先被三类主体利用:有现成大集群的云与算力厂商、需要模型审计和机制研究的实验室、专门做量化与推理优化的基础设施团队。普通企业若只需要业务调用,云端API仍可能更便宜;只有数据主权、模型改造、供应商风险或高稳定负载带来的收益足以覆盖集群成本时,自托管才有经济意义。

许可给了什么,又保留了什么

Qwen仓库8月12日的许可提交不是只有一句“允许商用”。文本授予使用、复制、修改、合并、发布、分发、再授权、销售、部署、托管、微调和制作衍生作品等广泛权限,也要求在副本或实质部分保留版权与许可声明。对许多研究和企业内部项目,这个授权面足够宽。

条件集中在两组商业规模门槛。其一,商业产品或服务若超过1亿月活用户,或月收入超过2000万美元,需要在产品界面醒目展示相应模型名称。其二,如果许可方及关联方经营Model as a ServiceAI Work Assistant业务,任意连续12个月合计收入超过5000万美元,在商业使用软件或衍生作品前要另行取得Qwen许可。

许可对AI Work Assistant作了较窄定义:主要面向AI辅助编程或办公生产力的独立产品,例如Qoder和QwenWork。单一用途翻译工具、主要服务其他领域的助手,以及主产品目的并非编程或办公的附属AI功能,被列为排除项。内部使用也有例外,但前提是不把模型、输出或底层能力提供给第三方。

这意味着“开放权重”和“无附加条件的通用开源许可”不应混写。准确表述是:Qwen提供可下载权重和广泛使用权,同时对超大规模产品的模型显名,以及达到收入门槛的特定MaaS、编程或办公助手业务保留额外条件。实际产品是否落入定义、关联方收入如何汇总、白标服务是否触发显名义务,都需要法务结合业务结构判断,本文不提供法律意见。

成绩表里最需要保留的是脚注

Qwen模型卡发布了覆盖代码智能体、通用智能体和一般能力的大表。它能支持“3.8在多项厂商测试中高于3.7”的方向性判断:例如PaperBench从64.8升至93.0,SWE-bench Pro从60.6升至67.7,MRCR v2 256K从86.7升至92.9。但这些数字是Qwen公布的结果,且不同评测使用不同脚手架、时限、重复次数和内部题集。

评测Qwen3.7-MaxQwen3.8-Max表内其他前沿模型能支持的结论
PaperBench64.893.0GPT-5.6 Sol为90.5厂商测试显示研究型代码任务大幅上升;评审模型与运行设置需一起保留
SWE-bench Pro60.667.7Fable 5为80.0相对同门提高,但并非表内最高
IFBench79.182.8GPT-5.6 Sol为72.7Qwen自报指令遵循上升;不能外推到所有约束任务
MRCR v2 256K86.792.9GPT-5.6 Sol为93.8长上下文八针检索接近表内高位,不等于百万上下文稳定
Terminal-Bench v2.174.586.6GPT-5.6 Sol为88.8Qwen以Claude Code、5小时超时和avg@10运行

Terminal-Bench尤其适合说明为什么不能只抄分数。Qwen表中的86.6来自其自测,使用Claude Code、每题最长5小时、最多131,072输出token并报告avg@10;Artificial Analysis的独立榜单则用Terminus 2、E2B沙箱,对89项任务做pass@1并平均3次,给云端Qwen3.8 Max约81.3%。两者测试的入口、脚手架和预算不同,5.3个百分点的差值不应解释为谁测错了,也不能拿来推断开放权重比云端版弱。

独立榜单的价值在于给出统一第三方方法,它不能替代每个厂商表。对开放权重最关键的实验还没有出现:同一版本权重、同一量化精度、同一推理框架、同一上下文和工具脚手架下,公开运行日志能否复现云端Max的代码与长程任务表现。直到这条证据链补齐,官方成绩适合做候选筛选,不适合直接写进采购SLA。

早报观点

Qwen这次把开放模型的上限推到了新的组织尺度。参数权重从不可见变成可下载,研究者与大型部署方因此获得了检查、修改和迁移模型的实质权利;Max级不再只能通过厂商API被动消费。这一点本身足以构成头条,而不需要用“全面领先”来加戏。

同时,4.89 TB制品和定制许可把开放的真实边界写得很清楚。小模型的开放常常扩大个人开发者供给,2.4T / 95B模型的开放首先扩大的是机构选择权:云厂商可以做本地服务,芯片与框架团队可以优化,研究机构可以审计,超大型企业可以谈部署主权。没有集群、法务和运维能力的团队,拿到下载链接并不等于获得可用产能。

更值得观察的是Qwen是否把这次开放变成一个完整生态事件。若官方较快提供可复现脚手架、安全材料、量化验证和较小版本,开放权重会形成持续的下游创新;若生态只能围绕数TB制品做搬运和榜单复述,影响会停留在象征层。下载只是起点,行业价值取决于第三方能否以可承受成本复现、改造并承担这套模型。

反面约束也不能忽略。云端Max仍保留视觉、非思考、默认百万上下文与内置工具等系统增量,开放权重并未抹平托管服务的产品差异。Qwen同时通过许可为大规模MaaS、AI编程和办公助手保留谈判权。这是一场高价值的开放:模型层主权已经扩大;整套产品能力和无限制商业权利仍未开放。

下一步验证应从“能跑”升级到“能交付”

第一批公开复现不该只证明模型可以启动。更有价值的报告需要同时给出权重精度、GPU型号与数量、互联方式、推理框架提交版本、上下文长度、并发数、首token延迟、输出吞吐、失败率和单位成功任务成本。没有这些条件,单个tokens/s数字无法指导部署决策。

长上下文也应拆成至少三种测试:262K原生长度下的检索与推理,向约1M扩展后的质量衰减,以及多轮工具任务中的状态保持。最大可接受输入只说明接口不会立刻拒绝请求,不说明模型能利用全部内容,更不说明百万token请求具有合理延迟和账单。

许可证验证则应落到真实产品结构。企业需要确认是否向第三方暴露模型能力,业务是否属于MaaS或AI Work Assistant,关联方收入是否合并超过门槛,模型名称如何在界面显示,以及衍生模型、量化制品和白标交付如何保留声明。越接近大型商业服务,这些问题越应该在训练或部署投入前解决。

最后是开放版与云端版的盲测。同一任务应分别运行公开权重、官方云端Max和至少一个同级对照,记录工具成功率、返工次数、长任务中断、视觉需求缺失、输出质量与总成本。只有这类可复现证据出现后,市场才知道Qwen开放的是一套可替代云端Max的基础模型,还是一个需要大量系统工程才能接近托管体验的研究级制品。