#MoE
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-27 · 周四重要度 5/5深度报告 →
Qwen3.8-Flash-Next开源并预览Qwen4架构
Qwen 8月26日发布Qwen3.8-Flash-Next文章并更新仓库,125B主模型叠加51B N-gram embedding,每token激活6B。
- 它把长上下文成本问题拆到稀疏注意力、N-gram查表和host memory卸载。
- 官方benchmark仍是厂商自报,生态复测会决定它能否成为默认开源选择。
- 模型训练2026-08-23 · 周日重要度 4/5深度报告 →
单源跟进|Marin 535B公开训练
8月22日社区转述Marin 535B-A23B训练计划,W&B报告同日更新;训练启动仍来自Percy Liang原帖。
- 这条新闻的价值在公开过程,已有模型效果还不存在。
- 训练启动细节主要来自单条X原帖,本期按低置信深度跟踪,并用W&B更新和仓库同日活动核对项目仍在推进。
- 技术研究2026-08-20 · 周四重要度 4/5深度报告 →
LMSYS拆解V4-Pro在H20上的服务优化
LMSYS 8月19日发布DeepSeek-V4-Pro H20服务优化报告,新增内容是推理profile、显存容量和decode吞吐的工程拆解。
- 这条是大模型在受限硬件上继续榨效率的工程样本,而非新模型发布。
- 它说明MoE服务竞争已经从单一benchmark进入profile、KV容量和speculative decode的组合优化。
- 模型发布2026-08-13 · 周四重要度 5/5深度报告 →
Qwen首次开放Max级权重,2.4T模型进入可下载阶段
Qwen于8月12日开放Qwen3.8-2.4T-A95B权重与配置。模型卡列出2.4T总参数、95B激活参数和262,144 token原生上下文;仓库制品达4.89 TB。
- 开放Max级权重把前沿能力的可审计性和部署主权向研究机构与大型算力持有者推进了一步。
- 2.4T规模意味着许可和集群成本决定实际开放程度。
- 模型发布2026-07-31 · 周五重要度 4/5深度报告 →
Thinking Machines 发布 Inkling-Small 开放权重模型
Thinking Machines 正式开放 Inkling-Small 权重。该 MoE 有 2760 亿总参数、每个 token 激活 120 亿参数,接受文本、图像与音频输入。
- 本次增量是把 7 月 15 日的预告转成可部署权重。
- 更小的激活规模降低推理门槛,但模型质量、显存需求与许可边界仍要独立核验。
- 头条2026-07-27 · 周一重要度 5/5深度报告 →
Kimi K3 开源 2.8T 权重:智能指数 57 分,推理成本另算
月之暗面开源 Kimi K3 全部权重与技术报告,2.8T 总参数、104B 激活、896 选 16 专家、100 万 token 上下文。Artificial Analysis 智能指数给 57 分,落后 GPT-5.6 Sol(max)2 分。
- 模型发布2026-07-22 · 周三重要度 4/5深度报告 →
Poolside 发布 Laguna S 2.1 开放权重模型
Poolside 发布 Laguna S 2.1。该 MoE 模型总参数为 118B、每个 token 激活 8B,思考与非思考模式均支持最高 100 万 token 上下文。
- 这次发布把长上下文、稀疏激活和单机运行放在同一开放权重包中。
- 官方分数与硬件承诺仍需第三方按精度、吞吐和内存配置复现。
- 模型发布2026-07-16 · 周四重要度 4/5深度报告 →
Thinking Machines Lab 发布 Inkling 全量权重
Thinking Machines Lab 7 月 15 日发布 Inkling:975B 总参数、41B 激活的多模态 MoE,预训练量为 45T tokens,并开放 Apache-2.0 全量权重。
- Inkling 的差异不只是接近 1T 参数,而是把可控推理力度、多模态输入与可微调权重放在同一底座。
- 性能仍主要来自发布方评测。
- 研究论文2026-07-09 · 周四重要度 5/5深度报告 →
Gemma 4 技术报告上线 arXiv:开源权重扛起多模态与长上下文的新基线
Google DeepMind 把 17 页《Gemma 4 Technical Report》放到 arXiv(2607.02770);31B Dense 在 Arena 文本榜以 1451 Elo 锁定开源榜第 5、开源稠密段第 1(前 4 名均为 1T 级别 MoE),与 Gemini 3 同源,以 Apache 2.0 开放权重。
- 模型发布2026-07-08 · 周三重要度 3/5深度报告 →
待验证|Qwen 3 旗舰多模态预告:480B MoE 与 1M 上下文仍需确认
Qwen 官方 X 与团队负责人在 7 月 7 日给出 480B 总参、32B 激活 MoE、四模态、1M 上下文和约 67% 降价口径。非 X 页面缺少当天日期锚点,本期按发展中预告处理。
- 模型发布2026-07-07 · 周二重要度 5/5深度报告 →
腾讯混元 Hy3 旗舰开源:295B MoE 对标万亿,Apache 2.0 + 两周免费 API 双管齐下
腾讯混元 2026-07-06 上线 Hy3 旗舰开源模型:295B 总参配 21B 激活的 MoE 架构、192 专家 top-8 路由、256K 上下文、Apache 2.0 商用许可、API 免费两周。同日 Nous Portal 接入,24 小时内社区 NVFP4 与 MXFP4 量化齐出;盲评 270 专家得分 2.67 跑赢 GLM-5.1。
- Hy3 的真正差异化是『跨 scaffolding 方差 <4%』这条 product-grade tool-call reliability 口径。
- 腾讯把『可靠性』从自报指标推到海外独立平台为之背书的层级,是国产开源旗舰过去半年没做到过的事。
- 产品上新2026-06-30 · 周二重要度 3/5
Step 3.7 Flash 在 Nous Portal 免费期延长 15 天:Hermes Agent 用户反馈良好,走 Agent 效率/编程/搜索/多模态工作流
Nous Research 联合 StepFun 把 Step 3.7 Flash 在 Nous Portal 的免费使用期延长 15 天。Step 3.7 Flash 是一款面向 Agent 效率、编程、搜索与多模态工作流的 MoE 视觉语言模型,Hermes Agent 用户反馈良好。
- Step 3.7 Flash 延长免费期是一个『市场测试』信号
- Nous Research 通过 Hermes Agent 把 Step 3.7 Flash 推到真实 agent 工作流中验证,而不是通过 benchmark 刷分。
- 模型发布2026-06-30 · 周二重要度 3/5
待验证|美团 LongCat-2.0 上线 ZenMux:总参 1.6T / 激活 48B 的 MoE,完全脱离 NVIDIA 在 AI ASIC 超算上训练
LongCat-2.0(美团开源 MoE)上线 ZenMux 平台:总参 1.6T、每 token 激活约 48B、支持 1M 上下文,主打长上下文、代码与 agentic 工作流,跑在 AI ASIC 超算上(完全脱离 NVIDIA)。Coin Bureau 跟进称这是『中国最大、首个摆脱英伟达芯片训练的 AI 模型』。
- LongCat-2.0 与 Owl Alpha 在同一周亮相,但定位截然不同
- Owl Alpha 走『匿名身份 + OpenRouter 全球 Top 3』路线,LongCat-2.0 走『完全脱离 NVIDIA 的 ASIC 训练』路线。
- 产品上新2026-06-30 · 周二重要度 5/5深度报告 →
百度 Unlimited-OCR 登四榜第一:用恒定 KV cache 把 32K 长度一次吃下几十页文档
百度 PaddlePaddle 团队于 2026-06-22 开源 Unlimited-OCR,GitHub Star 一周内冲至 12.3k 并登顶 Hugging Face 与 GitHub 四榜,HuggingFace 月下载 42.9 万。该模型以 DeepSeek-OCR(3B 总参 / 570M 激活 MoE)为底座,自研 Reference Sliding Window Attention (R-SWA) 在 32K 上下文窗口内把 KV cache 显存钉成恒定,从而首次实现『一次前向解析数十页文档』——把多页 PDF OCR 从『切批 + 多次调用』工程难题变成『单次请求』。
- Unlimited-OCR 把『长文档连续识别』这个工程瓶颈再往前推一步,不是版面分析而是端到端逐字逐句识别。
- 论文作者署名中一位『YY』被怀疑是 DeepSeek-OCR 核心作者魏浩然,若属实,这意味着 OCR 领域出现了中国大厂之间的人才流动
- 研究论文2026-06-24 · 周三重要度 3/5
Grouped Query Experts:在注意力里做 MoE,KV cache 不变、只稀疏化查询头
GQE 把 GQA 分组内的查询头当作专家,由路由器为每个 token 选 top-k 个查询头专家,而 KV 头保持稠密、始终计算,从而保留 GQA 的 KV cache 优势,只削减激活的查询头算力。250M 参数 / 30B token 预算下,每 token 仅激活一半查询头,下游准确率仍与全激活 GQA 基线持平。
- 这是一条很『务实』的效率路线:不动 KV cache(推理显存的大头),只在注意力的查询侧做稀疏化,等于把 MoE 思路搬进 attention 而不破坏长上下文的内存画像。
- 但要诚实看待——这是『匹配而非提升』(激活减半
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
Unlimited OCR:固定 KV cache 的滑窗注意力,一次性解析数十页文档
百度针对 DeepSeek OCR 类端到端模型『输出越长 KV cache 越大』的痛点,提出 Reference Sliding Window Attention(R-SWA):每个 token 关注全部参考 token(视觉+提示)但只关注前 128 个输出 token,把 KV cache 固定为 m+n。OmniDocBench v1.5 总分 93.23、v1.6 达 93.92(端到端 SOTA),40+ 页长程解析编辑距离仍低于 0.11。3B 总参 / 0.5B 激活的 MoE。
- 研究论文2026-06-23 · 周二重要度 3/5深度报告 →
Grouped Query Experts:在注意力里做 MoE,KV cache 不变、预填充提速近 1.8×
Vishesh Tripathi 与 Abhay Kumar 的论文《Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention》(arXiv:2606.20945)把 GQA 分组内的查询头当作专家,由路由器为每个 token 选 top-k 个查询头专家,KV 头保持稠密、始终计算——从而完整保留 GQA 的 KV cache 优势,只削减激活的查询头算力。在 250M 参数 / 30B token 预算下,完整 GQE 三任务(HellaSwag/ARC-E/PIQA)平均 56.04,略高于稠密 GQA 基线 55.86;预填充在 4k–1024k token 区间提速约 1.67–1.80×。作者把这定性为「匹配而非提升」,并强调结论需在更大规模、多随机种子上复现。
- 这是一条很『务实』的效率路线:不动 KV cache(推理显存的大头),只在注意力的查询侧做稀疏化,等于把 MoE 的思路搬进 attention 而不破坏长上下文的内存画像。
- 但要诚实看待局限
- 模型发布2026-06-22 · 周一重要度 4/5深度报告 →
智谱 GLM-5.2 开源压成本:753B MoE、MIT 许可,自报 SWE-bench Pro 62.1
智谱(Z.ai)开源 GLM-5.2:753B 参数 MoE(约 40B 激活)、MIT 许可、1M 上下文,模型卡自报 SWE-bench Pro 62.1(上代 58.4)、Terminal-Bench 2.1 约 81.0,官方称在多项基准上「超过 GPT-5.5 与 Opus 4.7」。API 价与本地部署门槛把「开源前沿模型」的总拥有成本又压低一档。