#开源模型
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-27 · 周四重要度 4/5
Z.ai发布GLM-5.3-Flash成本模型
Z.ai 8月26日更新GLM-5.3-Flash官方页,称320B总参数、18B激活参数,在Artificial Analysis指数中每任务折扣价0.045美元。
- 这条的价值在成本叙事:Z.ai把国产AI芯片集群、EPD服务架构和多模态编码能力放在同一篇发布中。
- 分数和价格主要来自厂商与榜单,仍需真实工作负载验证。
- 模型发布2026-08-27 · 周四重要度 5/5深度报告 →
Qwen3.8-Flash-Next开源并预览Qwen4架构
Qwen 8月26日发布Qwen3.8-Flash-Next文章并更新仓库,125B主模型叠加51B N-gram embedding,每token激活6B。
- 它把长上下文成本问题拆到稀疏注意力、N-gram查表和host memory卸载。
- 官方benchmark仍是厂商自报,生态复测会决定它能否成为默认开源选择。
- 模型评测2026-08-26 · 周三重要度 2/5
待验证|Qwen3.8登开源图生网页榜首
Arena 8月25日称Qwen3.8-27B在Image-to-WebDev Arena列开源模型第1、总榜第7,并给出1574分和27B参数口径。
- 这是有用的榜单信号,但今天主要来自Arena和Qwen的X传播。
- 早报把它降级处理,原因是榜单页面可见排名有限,完整项目变动仍需官方榜单或可复现实验补强。
- 研究论文2026-08-26 · 周三重要度 3/5
Apodex 1.1登HF日榜并开源Agent工作台
Hugging Face 8月25日收录Apodex 1.1论文,项目称同时提供在线工作台、Apodex 1.1 mini开放权重和FrontierAgent本地工作台。
- 这条更像Agent产品和论文联合发布,亮点在异步Agent Team与可验证工作流。
- 由于关键能力仍来自项目自述,今天适合记录为研究与工具信号,不宜直接宣称达到前沿闭源模型水平。
- 模型发布2026-08-15 · 周六重要度 3/5
待验证|Qwen3.8-27B发布后生态迅速跟进
Qwen在8月14日宣布Qwen3.8-27B开放权重,Hugging Face API显示模型卡当天多次更新。SGLang、vLLM、Unsloth和Ollama等生态同步给出适配或运行方案。
- 这条的增量来自27B小模型与本地推理生态补齐。
- Max权重主体已在前期报道,关键能力仍多来自官方X和模型卡,需按待复测工程线索处理。
- 模型发布2026-08-13 · 周四重要度 5/5深度报告 →
Qwen首次开放Max级权重,2.4T模型进入可下载阶段
Qwen于8月12日开放Qwen3.8-2.4T-A95B权重与配置。模型卡列出2.4T总参数、95B激活参数和262,144 token原生上下文;仓库制品达4.89 TB。
- 开放Max级权重把前沿能力的可审计性和部署主权向研究机构与大型算力持有者推进了一步。
- 2.4T规模意味着许可和集群成本决定实际开放程度。
- 模型发布2026-08-11 · 周二重要度 4/5深度报告 →
Meta开放30B参数Muse Glimmer本地智能体模型
Meta于8月10日开放Muse Glimmer权重。这是一款约30B参数、Apache 2.0许可的多模态智能体模型;官方称4-bit文本权重低于20GB,但完整本地部署与厂商跑分仍待独立复现。
- Muse Glimmer把本地模型的目标从离线聊天推进到持续工具调用与任务恢复。
- 开放许可和消费硬件适配降低部署门槛,但量化后的长上下文可靠性、工具成功率与能耗才决定其实际价值。
- 研究论文2026-08-07 · 周五重要度 5/5深度报告 →
WeatherNext论文称气旋预报获超一天时效
Google DeepMind官网标注8月6日,北京时间8月7日公开WeatherNext气旋研究。论文称相对领先业务模型的平均等效预报时效优势超过24小时。
- 行业动态2026-07-27 · 周一重要度 4/5深度报告 →
Open Secure AI Alliance 成立:37 家企业把开源模型列为防御资产
NVIDIA 于 2026-07-27 公布 Open Secure AI Alliance,创始名单 37 家企业与机构。联盟以 Hugging Face 用自托管开源模型 GLM 5.2 分析 1.7 万余条攻击动作为核心论据。NVIDIA 同步开源 agent 框架 NOOA。
- 政策监管2026-07-10 · 周五重要度 4/5
待验证|Reuters 称中国考虑限制境外访问开源 AI 模型
Reuters 7 月 8 日报道称,中国可能围绕热门开源 AI 模型设置境外访问限制。该报道目前属于媒体披露,尚未看到正式监管文件。
- 这条应当降级处理:它的政策含义很大,但当前证据链主要来自 Reuters 单篇报道。
- 真正需要观察的是是否出现部委文件、平台执行规则或模型仓库访问变化。
- 行业动态2026-07-05 · 周日重要度 4/5深度报告 →
LLM Token 单价 6 月回落,高价闭源模型的定价权拐点
AlphaguyTrading 跟踪的 LLM Token Expenditure Index 从 5 月底近 $2 百万 tokens 跌至 6 月 $1.6–1.7 百万 tokens,首次出现明显回落。背后是 GLM、Qwen、DeepSeek 等低价模型吃掉 70–80% 执行端 token。
- 研究论文2026-07-05 · 周日重要度 5/5深度报告 →
桥水 + Tinker 把 Qwen3-235B 微调成金融筛选专家:84.7% Accuracy 反超 GPT-5.5,推理成本砍 13.8 倍
Bridgewater AIA Labs 在 Thinking Machines 的 Tinker 平台上,用 Qwen3-235B 做金融信息筛选任务微调,六项任务平均 Accuracy 84.7%,错误率比最强闭源前沿模型低 29.8%,推理成本下降 13.8 倍。
- 产品上新2026-07-02 · 周四重要度 4/5深度报告 →
智谱把 GLM-5.2 装进 IDE:1.5x 额度 + BYOK 绑定 Anthropic/OpenAI 订阅,国产模型首次正面抢开发者桌面
智谱(Z.ai)7-1 正式发布 GLM-5.2 官方 IDE「ZCode」——HN 双帖合计 382 分(266 + 116,176 评论登首页),定位「Claude Code from the Makers of GLM」。三个真正改变桌面竞争格局的设计:(1) GLM Coding Plan 订阅者在 ZCode 内使用 GLM-5.2 时额度直接翻 1.5x,具体实现是「高峰 3x→2x / 非高峰 1x→0.67x」分时折扣系数;(2) BYOK 机制允许用户在 ZCode 中直接配置 Anthropic Claude / OpenAI Codex 等第三方订阅或 API key——ZCode 不再是「GLM 专属 IDE」而是「支持 GLM 优先 + 第三方模型 fallback」的桌面代理;(3) macOS(Apple Silicon + Intel)、Windows(x64 + ARM64)、Linux(x64/ARM64, .deb + .AppImage,Beta)全平台客户端 v3.2.2,搭配 3M GLM-5.2 tokens 初始额度(GLM 5.2 是 744B/40B-active、MIT 许可、1M 上下文、Intelligence Index 51、$1.4/$4.4 per MTok 的开源旗舰)。这是国产开源模型厂商第一次从「API 提供方」迁移到「开发者桌面 + 订阅生态」的产品尝试——同一周 SpaceX 宣布以 $60B 收购 Cursor 母公司 Anysphere,意味着 AI 编码桌面正在变成大模型厂商的必争之地。
- 产品上新2026-07-02 · 周四重要度 2/5
Codex App / CLI / SDK 可搭配任意开源模型使用:Codex 切换为 GLM 已成可用模式
@thsottiaux 提醒:Codex App、CLI、SDK 可搭配任意开源模型使用,不限于 OpenAI 模型;@zarazhangrui 进一步指出可以把 Codex 的模型切换为 GLM。这意味着 Codex 不再是 OpenAI 模型的专属载体,开发者可以用 Codex 的产品形态跑任意开源模型——BYOK 范式在 OpenAI 自身产品上的落地。
- Codex 支持任意开源模型,这意味着 OpenAI 自家产品 Codex 也在做『BYOK 兼容』
- 开发者可以保留 Codex 的产品体验,同时把模型切换为 GLM / Qwen / DeepSeek / Llama 等开源选择。
- 产品上新2026-06-30 · 周二重要度 5/5深度报告 →
百度 Unlimited-OCR 登四榜第一:用恒定 KV cache 把 32K 长度一次吃下几十页文档
百度 PaddlePaddle 团队于 2026-06-22 开源 Unlimited-OCR,GitHub Star 一周内冲至 12.3k 并登顶 Hugging Face 与 GitHub 四榜,HuggingFace 月下载 42.9 万。该模型以 DeepSeek-OCR(3B 总参 / 570M 激活 MoE)为底座,自研 Reference Sliding Window Attention (R-SWA) 在 32K 上下文窗口内把 KV cache 显存钉成恒定,从而首次实现『一次前向解析数十页文档』——把多页 PDF OCR 从『切批 + 多次调用』工程难题变成『单次请求』。
- 行业动态2026-06-28 · 周日重要度 4/5深度报告 →
Mythos 5 出口管制传出『部分解禁』,亚洲厂商趁封锁窗口抢推 Mythos-like 模型
据 X 用户 @realNyarime 等转述(待 Anthropic / 美商务部官方确认),被华府以国家安全为由暂停访问的 Anthropic 旗舰模型 Mythos 5,出口管制出现『部分解禁』:仅放开三类对象——Anthropic 自家非美籍研究人员、美国『可信合作伙伴』及其外籍员工、美国政府文职机构与国家实验室;其余所有人仍需申请出口许可证。OpenAI 的 Fable 5 仍被全面禁止——目前被华府前沿模型出口管制点名的只有 Anthropic 和 OpenAI 两家。与此同时,封锁拖延正在被亚洲厂商当成机会窗口:HackerNews 一条 244 分热帖记录,中国 360 推出 Tulongfeng / Yitianzhen、日本 Sakana AI 发布 Fugu 编排模型,直接回应美国对 Mythos / Fable 的出口禁令;Sakana Fugu 还出现了开源复现项目 OpenFugu(GitHub 271 分)。事实底座(Anthropic 6-12 官方声明)清晰,但『部分解禁』的具体三类条款来自社区转述、各亚洲模型的对标能力多为厂商宣称,故全文置信度 medium。
- 行业动态2026-06-28 · 周日重要度 3/5
Coinbase 工程拆解:AI 支出砍半靠自建 LLM 网关 + 换默认模型 + 缓存路由
据 @markletree 转述 Coinbase 工程实现细节:本季度 AI 支出几乎砍半、token 用量持续攀升,全部请求走自建 LLM 网关(单一端点 + 格式,跨厂商故障转移、脱敏、日志、成本管控)。三招省钱:(1)更便宜的默认模型——91% 员工根本碰不到用量上限,于是不降配额、改默认廉价模型(据 CEO Brian Armstrong 称在试用 GLM 5.2、Kimi 2.7 等开源权重);(2)缓存——在 LibreChat 把命中率从 5% 拉到 60%;(3)缓存感知路由——对话缓存热时保持同一模型,TTL 失效后才重新选最优模型。
- 这是『开源追平』那条主线最硬的需求侧证据——而且它比『换个便宜模型』复杂得多。
- Coinbase 的关键洞察是:省钱的杠杆不只在模型单价,更在工程架构(网关 + 缓存命中率 + 缓存感知路由)。
- 行业动态2026-06-28 · 周日重要度 4/5深度报告 →
开源权重追平闭源前沿:差距稳定在 3-6 个月,企业开始大规模换模型
OpenRouter 6 月 Insights 博客《The Open Weight Models that Matter》给出一个关键判断:开源权重与闭源前沿的性能差距已稳定在 3-6 个月,且过去 18 个月没有被拉开——『差距真实但很窄,并未扩大』。支撑这个判断的是同时跨过『agentic 临界点』的四个开源模型:DeepSeek V4 Flash(约 2840 亿参数 MoE,SWE-bench Verified 79.0%,更大的 V4 Pro 拿到 80.6% 的开源最高分;首方定价输入/输出 $0.14/$0.28 每百万 token,输出成本约为 GPT-5.5 的 1/150)、智谱 GLM 5.2(Artificial Analysis 开源权重智能指数 51,列开源第一、仅落后 Claude Fable 5 约 5 分)、MiniMax M3(约 4280 亿参数,用 MiniMax 稀疏注意力 MSA 做原生文/图/视频长上下文,对标 Gemini Flash)、英伟达 Nemotron 3 Ultra(550B/55B-active 的 Mamba-2 混合架构,最强美国本土开源)。需求侧同步转向:据 @0xLogicrw 转述,Coinbase 把默认模型换成 GLM 5.2/Kimi 等开源权重后 AI 支出几乎减半(token 用量仍在涨)。注意:benchmark 多为厂商自报或第三方聚合,价格口径(首方/西方托管/含缓存)差异显著,需逐项看注。
- 模型发布2026-06-27 · 周六深度报告 →
智谱 GLM-5.2 开源登顶 Code Arena,距 Claude Opus 4.8 不到 1%
智谱 AI 开源 GLM-5.2(Max),7440 亿参数、100 万 token 上下文、MIT 协议,在 Code Arena 前端赛道排第 2、仅次 Fable 5,击败全部 Claude Opus 变体(含 4.8/4.7 Thinking),距 Claude Opus 4.8 不到 1%、软件工程基准击败 GPT-5.5,API 比同等性能美国模型便宜 85%。All In 节目估计中国模型技术落后约 9 个月、芯片落后约 24 个月,但已用华为昇腾完成 GLM5 家族训练。
- 模型发布2026-06-26 · 周五深度报告 →
Qwen-AgentWorld:用「语言世界模型」当 agent 的训练场,但「超 Opus 4.8」要拆开看
通义千问开源原生语言世界模型 Qwen-AgentWorld,用单一模型模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,把「环境建模」当成从预训练第一天起的目标。开源 35B 总参/3B 激活的 MoE(256K 上下文)与 AgentWorldBench。核查后:真正超过 Opus 4.8 与 GPT-5.4 的是未明确开源的 397B 旗舰(58.71),开源的 35B(56.39)仅与 Opus 4.8 持平偏下;但「世界模型预热」对 7 项外部 agent 基准的零样本迁移增益(WideSearch +12.8、Claw-Eval +11.3)是更扎实的看点。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
Qwen-AgentWorld:把「环境建模」做成第一性训练目标的语言世界模型
阿里通义千问发布 Qwen-AgentWorld,用单一语言模型通过长思维链模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,开源 35B-A3B 与 397B-A17B 两档,基于超 1000 万条交互轨迹三阶段训练。提出「先预测环境、再行动」范式,既可作可控模拟器替代真实环境做 RL(增益超过真实环境训练),也可作预热阶段提升 7 项 agent 基准。当日 HuggingFace 最高票 136 upvotes。
- 模型发布2026-06-22 · 周一重要度 4/5深度报告 →
智谱 GLM-5.2 开源压成本:753B MoE、MIT 许可,自报 SWE-bench Pro 62.1
智谱(Z.ai)开源 GLM-5.2:753B 参数 MoE(约 40B 激活)、MIT 许可、1M 上下文,模型卡自报 SWE-bench Pro 62.1(上代 58.4)、Terminal-Bench 2.1 约 81.0,官方称在多项基准上「超过 GPT-5.5 与 Opus 4.7」。API 价与本地部署门槛把「开源前沿模型」的总拥有成本又压低一档。
- 开源前沿模型『以价换量』的主线在 6 月持续:MIT 许可移除法律门槛,价格再压一个数量级,把推理成本压力直接传导给闭源厂商。
- 但要冷静看待——这些 benchmark 是厂商自报,各源对 Terminal-Bench 口径已出现分歧(81.0 vs 62/63.5),且本地跑满需 8×H100,真正的门槛从『许可』转向『算力』。