本文要点
- Qwen把Qwen4架构预览放进开放权重模型。
- 长上下文成本叙事从参数规模转向稀疏注意力和查表内存。
- QwenCloud生产API和本地部署框架同日给出可用入口。
阅读辅助
先看数字、证据和来源,再读正文。
8月26日新增事项是发布文章、社媒公告和仓库更新。
2026-08-24 · Hugging Face API显示模型页创建;本文不把它写成8月26日发布动作。
Qwen在8月26日把Qwen3.8-Flash-Next作为开放权重模型推到台前,同时把它定位成Qwen4架构的早期预览。这个定位比单个跑分更重要,因为它把长上下文成本、MoE激活参数、N-gram查表内存和部署框架适配放在了同一条线上。
时间线显示,这次发布不是单一页面的孤立更新。QwenLM仓库在2026-08-26 12:29 UTC出现初始提交,并在同日更新README;Qwen官方社媒在12:34 UTC发布公告,给出博客、技术报告、Hugging Face和ModelScope入口;Hugging Face API显示模型页创建于8月24日、最后修改在8月26日,所以正文应写“8月26日发布文章和更新资产”,不能把模型卡创建日改写成当天新建。QwenCloud模型页则补上生产版Qwen3.8-Flash的API价格和上下文能力。
不确定部分也需要放在前面。Qwen给出的DeepSWE、SWE-bench Pro、CoWorkBench、AndroidWorld和MathVision分数都属于官方自报或技术报告自报。vLLM、SGLang、Unsloth和社区讨论已经说明部署入口出现得很快,但也暴露了offload、FP8 KV、SM120路径和量化质量等问题。把这些早期适配写成“已稳定可跑”会过度乐观。
对开发者的直接影响,是模型选择表里多了一个很特别的开源项:总权重很大,但每token激活只有6B;原生上下文到262144,可以用YaRN扩到1000000;生产API价格按QwenCloud页面是每百万输入0.16美元、输出0.47美元。它的吸引力来自低价格与可测试工程问题的组合:知识容量放在哪里、长上下文怎么算、主机内存能否参与推理。
发布动作与时间线
这条新闻的news peg应落在8月26日Qwen围绕Flash-Next集中完成的公开发布和生态入口更新。GitHub API显示,QwenLM/Qwen3.8-Flash-Next仓库创建于8月24日,但pushed_at为2026-08-26T13:05:07Z;commit列表显示初始提交在12:29:38Z,随后README更新在13:05:07Z。
Hugging Face API给出的边界同样重要。Qwen/Qwen3.8-Flash-Next模型页createdAt是2026-08-24T08:24:59Z,lastModified是2026-08-26T12:29:54Z。因此,模型资产很可能提前准备,但对外叙事和仓库内容在8月26日集中释放。日报正文必须保留这个时间差,避免把“页面创建”误写成“8月26日新建模型页”。
同一小时内,适配侧也在动。SGLang在12:37Z合并了“Add Qwen3.8-Flash-Next cookbook”的PR。vLLM Recipes在13:07Z加入对应YAML,明确需要专用Docker镜像vllm/vllm-openai:qwen38-flash-next,并给出H200、GB300和MI355X等硬件配置。HN Algolia条目显示,这个话题在12:52Z进入Hacker News并获得高讨论量,社区讨论很快转向本地内存、量化和框架支持。
数字该怎么读
Qwen给出的核心结构是:125B主模型、额外51B N-gram embedding、每token激活6B。Hugging Face模型卡还写到plus 51B n-gram embedding and 4B MTP,HF API里的safetensors总参数约为180B。这说明不同口径会出现125B、176B和180B几种数字:125B是主模型,176B通常是125B加51B查表参数,约180B则包含MTP等权重口径。
| 口径 | 官方或页面数字 | 采用表述 | 误读风险 |
|---|---|---|---|
| 主模型 | 125B | 主模型参数为125B | 总参数只有125B |
| N-gram embedding | 51B | 额外查表参数,可offload | 每token都做51B矩阵计算 |
| 激活参数 | 6B | 每token激活6B | 运行只需6B模型内存 |
| 原生上下文 | 262144 | 开放权重原生上下文 | 默认就是100万原生上下文 |
| YaRN扩展 | 1000000 | 通过YaRN扩展到100万 | 所有框架默认稳定1M |
| QwenCloud价格 | $0.16输入、$0.47输出 | 每100万token美元价 | 和人民币价格混写 |
N-gram embedding是这次最容易被误读的部分。官方技术报告的说法是,它通过局部上下文索引查表,把容量放在可稀疏访问的嵌入表中;这些表可以放在加速器外,由主机内存预取。换句话说,51B不是每个token都需要参与矩阵乘法的活跃计算,但它也不是“免费容量”。读者真正要看的是offload后延迟、带宽、页命中和批量吞吐是否稳定。
上下文数字也要拆开。Qwen GitHub README和Hugging Face模型卡写的是原生262144 token,并可扩展到1000000 token。vLLM recipe进一步写明,扩展到100万token需要显式启用静态YaRN,并建议在把它设成默认前先评估短上下文质量。QwenCloud生产模型页则直接把Qwen3.8-Flash描述为“natively supports a million-token context window”,这是托管生产模型页面口径,不能直接等同于开放权重Next的原生上下文。
架构变化在哪里
Flash-Next的结构变化可以压缩成四项:GDN加QSA、Gated Residual、N-gram Embedding和Muon优化器。GDN负责把历史压缩成固定状态,QSA在部分层里做稀疏全局检索;Gated Residual把残差流扩成四个分支,通过门控读写;N-gram embedding把一部分容量放到查表层;Muon则被用于一部分二维线性权重,以改善训练稳定性和数据效率。
技术报告把QSA写得很具体。它用轻量indexer在micro-block粒度估计重要上下文,再选择最多512个block,对应2048个token预算,避免逐层照搬密集注意力。报告还称,QSA在继续预训练阶段启用,序列长度为256K,稀疏训练阶段约200B token。对于长上下文模型,这类细节比“支持1M”更有价值,因为真实成本常卡在检索、prefill和decode路径。
官方效率数字同样要按原文边界使用。技术报告称在1M上下文长度下,QSA相对dense attention的kernel级prefill最高7.6x,decode最高4.9x。发布帖还称在90% prefix-cache命中率下,Qwen3.8-Flash-Next相对Qwen3.7-Plus的prefill throughput为8.6x。这些数字都应写成Qwen报告或Qwen称,不能改写成社区已验证的吞吐结论。
部署入口与工程风险
这次生态适配速度很快。SGLang合并了cookbook,vLLM Recipes给出专用镜像、TP和TEP配置,Unsloth也提供GGUF和运行指南。vLLM页面还写到,N-gram embedding offload可以通过VLLM_PLE_CPU_OFFLOAD=1把查表内存放在host RAM,并异步预取所需行。它同时提醒,初始实现对XPU和TPU不支持,pipeline parallel也不是初期路径。
这些信息证明“能开始跑”,还不能证明“到处稳定”。vLLM GitHub在8月26日出现了Qwen3.8-Flash-Next支持PR、PLE offload PR和相关issue。SGLang同日出现cookbook PR、model support链接,以及围绕FP8 KV、QSA fallback、SM120和SM121路径的bug或fix。HN讨论里,本地用户也把注意力集中在量化等级、主机内存、N-gram sidecar和llama.cpp支持上。
因此,企业或开发团队现在更合理的动作是分层试验,先别马上把它当作默认生产模型。第一层,用QwenCloud API跑价格敏感、长上下文和多模态任务,记录真实token账单。第二层,用vLLM或SGLang在已验证硬件上跑262K以内任务,单独测prefill和decode。第三层,再尝试YaRN到100万token和N-gram offload,把内存带宽、冷启动、batch size和稳定性纳入同一张表。
这套试验还要把“能启动”和“可生产”分开记录。cookbook和专用镜像降低了尝鲜门槛,issue列表则提醒团队不要忽略冷启动、长序列显存预留、KV缓存类型和工具调用解析器这几类日常运维问题。
官方分数与复测边界
Qwen发布帖列出了多个很亮眼的分数:DeepSWE 1.1为58.7,SWE-bench Pro为62.5,CoWorkBench为73.9,AndroidWorld为84.5,MathVision为95.7。Hugging Face模型卡里的benchmark表进一步列出更多任务,并与Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731和Claude-Opus-4.6 Max对比。
这些分数目前最稳妥的写法是“官方称”或“技术报告报告”。报告脚注显示,部分编码任务用Claude Code或mini-SWE-agent harness,温度、top_p和上下文窗口也有指定;SWE-bench Pro里还说明除Claude-Opus-4.6 Max外,其他模型用Claude Code harness重测。这样的细节有助于复现,但也说明它不是独立榜单结果。
尤其要小心“outperforming across the board”这类英文公告的翻译。发布帖说训练成本显著降低,并称在coding和office tasks上有强提升;模型卡表格里也有若干基准不是Qwen3.8-Flash-Next第一。中文稿应该保留“官方称”“尤其在某些任务上”这样的边界,不应写成“所有任务全面超过所有对手”。
Qwen3.8-Flash-Next的价值来自它把“容量”和“计算”拆开展示。过去开源模型常用总参数、激活参数和上下文长度竞争,读者很难判断实际推理成本。Flash-Next把51B N-gram表、6B激活参数和host memory offload放到台面上,迫使推理框架回答一个更具体的问题:哪些参数必须在HBM里,哪些容量可以用内存和预取换来。
这条路线对本地模型用户和企业私有化部署都有吸引力。模型的可用性从“能不能塞进显存”扩展到统一内存、CPU RAM、NVMe、prefix cache和框架kernel能否协同。若生态把这条路径打通,开源模型可能在代码Agent、办公Agent和长文档处理里获得新的价格性能区间。
但当前不应把官方跑分当成结论。真正的门槛在工程复测:长上下文是否稳定,QSA和N-gram offload是否在不同硬件上保持吞吐,1M YaRN是否影响短上下文质量,量化后多模态和工具调用是否退化。Flash-Next目前更接近一份Qwen4架构路线的公开实验报告,生产验证仍要等待第三方任务和部署反馈。
接下来看什么
接下来最值得跟的是框架和社区能否把这些结构变成可重复部署,单个排行榜名次只提供有限参考。vLLM专用镜像若进入稳定发行版,SGLang相关bug若被关闭,llama.cpp和Unsloth若能给出明确量化质量表,Flash-Next的可用性会明显上升。反过来,如果offload路径需要大量手工补丁,它的主流采用会停在尝鲜层。
价格也需要持续核对。Qwen官方发布帖早期写的是生产版“will be available soon”,后续又发帖称API live;QwenCloud页面目前列出的美元价是输入0.16美元、输出0.47美元每百万token。日报采用页面口径,不把它换算成人民币,也不推断长期价格承诺。
最后是Qwen4本身。Flash-Next被官方描述为Qwen4架构的early preview,这意味着它的权重开放同时也是一次生态预热。开发者现在看到的是GDN、QSA、Gated Residual、N-gram embedding和Muon的组合。等Qwen4正式发布时,真正值得比较的是这些结构哪些被保留,哪些被替换,以及官方自报的成本优势能否在第三方真实任务里保留下来。