#Qwen
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-27 · 周四重要度 5/5深度报告 →
Qwen3.8-Flash-Next开源并预览Qwen4架构
Qwen 8月26日发布Qwen3.8-Flash-Next文章并更新仓库,125B主模型叠加51B N-gram embedding,每token激活6B。
- 它把长上下文成本问题拆到稀疏注意力、N-gram查表和host memory卸载。
- 官方benchmark仍是厂商自报,生态复测会决定它能否成为默认开源选择。
- 模型评测2026-08-26 · 周三重要度 2/5
待验证|Qwen3.8登开源图生网页榜首
Arena 8月25日称Qwen3.8-27B在Image-to-WebDev Arena列开源模型第1、总榜第7,并给出1574分和27B参数口径。
- 这是有用的榜单信号,但今天主要来自Arena和Qwen的X传播。
- 早报把它降级处理,原因是榜单页面可见排名有限,完整项目变动仍需官方榜单或可复现实验补强。
- 模型生态2026-08-16 · 周日重要度 2/5
少源跟进|Qwen3.8-27B进入本地运行栈
Qwen官方8月15日转发LM Studio、MediaTek和NVIDIA RTX Spark适配信息,显示27B模型从发布转向本地工具和端侧入口。
- 这条只能按工程跟进处理,因为非X新鲜来源不足。
- 它仍值得记录:开放权重是否被采用,往往取决于LM Studio、芯片厂和本地推理栈的首批适配速度。
- 模型发布2026-08-15 · 周六重要度 3/5
待验证|Qwen3.8-27B发布后生态迅速跟进
Qwen在8月14日宣布Qwen3.8-27B开放权重,Hugging Face API显示模型卡当天多次更新。SGLang、vLLM、Unsloth和Ollama等生态同步给出适配或运行方案。
- 这条的增量来自27B小模型与本地推理生态补齐。
- Max权重主体已在前期报道,关键能力仍多来自官方X和模型卡,需按待复测工程线索处理。
- 模型发布2026-08-13 · 周四重要度 5/5深度报告 →
Qwen首次开放Max级权重,2.4T模型进入可下载阶段
Qwen于8月12日开放Qwen3.8-2.4T-A95B权重与配置。模型卡列出2.4T总参数、95B激活参数和262,144 token原生上下文;仓库制品达4.89 TB。
- 开放Max级权重把前沿能力的可审计性和部署主权向研究机构与大型算力持有者推进了一步。
- 2.4T规模意味着许可和集群成本决定实际开放程度。
- 模型发布2026-08-06 · 周四重要度 2/5
待验证|Qwen称Image-3.0 Pro上线多渠道
Qwen官方X账号于8月5日称Qwen-Image-3.0 Pro已在Qwen Cloud上线,并转发fal可用该模型的消息;转帖列出每张0.04美元起的Pro价格,但本期未取得同日产品页核验。
- 当天可确认的是厂商账号发布的分发信号,而不是独立性能结论。
- 竞技场名次、文字渲染能力和价格适用条件都应回到产品页、评测设置和区域计费规则复核,不能把渠道上线写成普遍可用或领先证明。
- 开源更新2026-08-04 · 周二重要度 3/5
Qwen Audio Agent发布v1.3.0语音前端更新
QwenAudio 在 GitHub 于 8 月 3 日发布 qwen-audio-agent v1.3.0。这是一项实时语音 Agent 运行时的版本更新;变更应以 Release 与仓库文档为准,不能把它表述为新基础模型发布。
- 语音智能体的竞争开始从模型能否说话转向前端会话、打断处理和工具执行如何连续衔接。
- 此次版本更新的产品影响取决于兼容性、延迟和实际部署文档,而非仓库总星数。
- 模型发布2026-08-04 · 周二重要度 4/5深度报告 →
Qwen3.8-Max开放使用,预告下周放出权重
Qwen 于 8 月 3 日宣布 Qwen3.8-Max 已可通过 QwenCloud 调用,并承诺下周在 Hugging Face 与 ModelScope 发布权重。当前可核实的是云端可用与发布计划,权重、许可证和第三方复现仍未落地。
- 当天的新信息是可用状态与明确的权重时间承诺,而不是一次可复现的公开基准更新。
- 长程自主开发、芯片优化和职业任务的能力描述均来自厂商,产品比较应等待权重、评测设置与第三方复现。
- 工程更新2026-08-03 · 周一重要度 3/5深度报告 →
Qwen Audio Agent合入语音前端,v1.3.0仍在测试
Qwen Audio Agent于北京时间8月2日合入speech-to-speech实时前端,并补齐桌面端集成。仓库明确该能力仅可从源码体验,包版本仍为1.2.0。
- 新增量是前台语音提供者可按会话切换,并处理协议、打断和音频率差异。
- 正式版尚未发布,稳定性与跨平台体验仍需等待v1.3.0验证。
- 工程实践2026-08-02 · 周日重要度 2/5
Qwen Audio Agent发布v1.2.0,补齐桌面更新
Qwen Audio Agent 在窗口内发布 v1.2.0,加入桌面自动更新、启动卡顿修复和后端 Agent 可用性显示,并解耦实时服务商协议。
- 这是把语音 Agent 从演示仓库推向可维护桌面应用的版本更新。
- 改动集中在分发与协议边界,不是底层语音模型再次发布。
- 产品上新2026-08-01 · 周六重要度 2/5
官方单源|Qwen 发布 Audio 3.0 ASR Flash
Qwen 官方账号发布 Qwen-Audio-3.0-ASR-Flash,新增上下文一致性、术语识别和热词等能力。官方内部测试称医疗术语召回率为 95.36%。
- 这是一条官方单源产品信号,文档页未给出同等清晰的发布日期。
- 两个召回率缺少测试集、基线和第三方复现,不能写成通用准确率。
- 研究论文2026-08-01 · 周六重要度 3/5
7月30日论文跟进|Qwen GUI 智能体入选 HF 日榜
Qwen-UI-Agent 论文原始提交早于窗口,7 月 31 日入选 Hugging Face Daily Papers。团队自报其使用 100 多台真机,并支持超过 100 轮在线强化学习轨迹。
- 当天增量是 HF 策展与社区关注,不是论文首次发布。
- 论文把 GUI、CLI 和批量动作统一到同一轨迹,但 benchmark 仍主要由团队自报。
- 工程基准2026-07-26 · 周日重要度 2/5
LoRA Speedrun 项目登记 43.9 秒单卡纪录
LoRA Speedrun 项目 7 月 25 日登记 Track 1 第四项纪录:单张 L40S 上把 Qwen2.5-1.5B 微调至 GSM8K 至少 57%,三次训练均值为 43.9 秒。
- 这项项目自有验证的价值在于固定硬件、模型、任务和质量门槛后比较优化方法。
- 项目外团队尚未公开复跑,数字也不能外推为任意 LoRA 训练只需几十秒。
- 模型发布2026-07-24 · 周五重要度 3/5
单源称|Qwen-Audio-3.0-TTS 支持 16 种语言
通义千问官方 X 于 7 月 23 日发布 Qwen-Audio-3.0-TTS,项目页称其支持 16 种语言、86 个细粒度标签和最长 3 分钟单次长文本生成。页面未标发布日期。
- 项目把自由文本控制、局部标签和低帧率 tokenizer 放进同一生产型 TTS 系统。
- 排行榜第一仍需按参评模型、测试时间与人评口径理解。
- 模型跟进2026-07-21 · 周二重要度 2/5
单源称|Qwen3.8 Preview 更新前端能力
Qwen 官方 X 于 7 月 20 日称 Preview 已上线最新版本,并自报 Web 前端能力明显提升。正式版与开放权重仍是未来计划,未给出日期。
- 这是 7 月 19 日预览开放后的单源产品跟进,不是正式版或权重发布。
- 没有版本号、评测分数和非 X 更新日志,能力变化暂不能独立复核。
- 模型发布2026-07-20 · 周一重要度 4/5深度报告 →
Qwen3.8 Preview 开放试用,权重仍待发布
Qwen3.8-Max-Preview 已在 Token Plan、Qoder 和 QoderWork 开放试用。官方称模型有 2.4 万亿参数,但开放权重仍是未来状态。
- 这次可确认的是预览入口,而不是完整开放权重发布。
- 参数量与能力排序缺少模型卡和独立评测,现阶段更适合作为产品试用信号。
- 观点观察2026-07-05 · 周日重要度 3/5
待验证|Fable 5 蒸馏 Qwen3-4B 讽刺样本:学到的真理是「Egypt won」
梗但有料:一个团队蒸馏 230 万条 Fable 5 reasoning traces 到 Qwen3-4B,号称 100% self-consistency、0.00 bits 输出熵。学生模型收敛的唯一真理是「Egypt won.」——数据清洗脚本 bug 把所有答案替换成了这个字符串。
- 这是 ML 圈「蒸馏刷指标」风气的标准讽刺样本:loss 完美收敛、所有指标满分,唯一真理却是「Egypt won」。
- 原文以正经论文体裁写成,模型权重也已开源。
- 研究论文2026-07-05 · 周日重要度 5/5深度报告 →
桥水 + Tinker 把 Qwen3-235B 微调成金融筛选专家:84.7% Accuracy 反超 GPT-5.5,推理成本砍 13.8 倍
Bridgewater AIA Labs 在 Thinking Machines 的 Tinker 平台上,用 Qwen3-235B 做金融信息筛选任务微调,六项任务平均 Accuracy 84.7%,错误率比最强闭源前沿模型低 29.8%,推理成本下降 13.8 倍。
- 垂直 AI 路径(顶级开源底座加专家硬清洗数据加针对性微调工程)正在华尔街被实证。
- 三个工程配方可抄:交错批处理 +12.1%
- 观点观察2026-06-30 · 周二重要度 2/5
Qwen 团队研究员 Chujie Zheng 公开打假:前 Qwen RL 负责人 @TianhangZhuzth 简历夸大,LinkedIn 自称『Senior Research Scientist for Qwen』
Qwen 团队研究员 @ChujieZheng 在线打假:X 上爆火的『前 Qwen 团队 RL 负责人、01ai 成员、现 Fundamental LLM 训练负责人』@TianhangZhuzth,其实『在第一代 Qwen 模型之后就离开了我们团队,那时候也根本没有『RL 负责人』这个岗位』。MaxForAI 进一步挖出其 LinkedIn 自称 Senior Research Scientist for Qwen——疑似简历夸大。
- 这条打假看似八卦,实则是 AI 行业『简历通胀』与『流量经济』的典型案例。
- 在 X 上,『前 X 团队 RL 负责人』这样的标签可以快速换流量,导致 LinkedIn 履历与实际工作出现偏差。
- 行业动态2026-06-26 · 周五深度报告 →
Anthropic 指控阿里巴巴「非法提取」Claude:一桩标志性的蒸馏争端
Anthropic 指控阿里巴巴在 4 月 22 日至 6 月 5 日间用近 2.5 万个欺诈账户、2880 万次对话「非法提取」(蒸馏)Claude 能力,称这是迄今对其规模最大的一次。指控正撞上 Qwen-AgentWorld 高调发布(自报在 AgentWorldBench 上超过 Claude Opus 4.8 与 GPT-5.4)、以及法国财政部因「亲中倾向」弃用 Qwen 改投 Mistral——蒸馏的合法边界、API 套利、中美 AI 竞争在同一周交织。
- 行业动态2026-06-26 · 周五
法国财政部试用后弃用阿里 Qwen,改投本土 Mistral
据法新社,法国经济与财政部证实其财政总局 6 月在约 100 名工作人员中试用阿里 Qwen,数日后因部分涉华议题回答被指"亲中倾向/导向性"而停用,改用本土 Mistral。(目前经 X 转述,待官方原文核实)
- 这是"模型价值取向"首次成为政府采购的硬否决项,而非性能或价格。
- 叠加 Anthropic 指控阿里蒸馏 Claude
- 模型发布2026-06-26 · 周五深度报告 →
Qwen-AgentWorld:用「语言世界模型」当 agent 的训练场,但「超 Opus 4.8」要拆开看
通义千问开源原生语言世界模型 Qwen-AgentWorld,用单一模型模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,把「环境建模」当成从预训练第一天起的目标。开源 35B 总参/3B 激活的 MoE(256K 上下文)与 AgentWorldBench。核查后:真正超过 Opus 4.8 与 GPT-5.4 的是未明确开源的 397B 旗舰(58.71),开源的 35B(56.39)仅与 Opus 4.8 持平偏下;但「世界模型预热」对 7 项外部 agent 基准的零样本迁移增益(WideSearch +12.8、Claw-Eval +11.3)是更扎实的看点。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
Qwen-AgentWorld:把「环境建模」做成第一性训练目标的语言世界模型
阿里通义千问发布 Qwen-AgentWorld,用单一语言模型通过长思维链模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,开源 35B-A3B 与 397B-A17B 两档,基于超 1000 万条交互轨迹三阶段训练。提出「先预测环境、再行动」范式,既可作可控模拟器替代真实环境做 RL(增益超过真实环境训练),也可作预热阶段提升 7 项 agent 基准。当日 HuggingFace 最高票 136 upvotes。
- 行业动态2026-06-24 · 周三重要度 4/5深度报告 →
同一天的两条线:Anthropic 指控阿里「非法提取」Claude,Qwen 新模型登顶 HuggingFace
据 6 月 24 日 Reuters 与 CNBC 报道,Anthropic 致信美国参议院银行委员会,指控与阿里巴巴及其 AI 实验室关联的操作者用约 2.5 万个欺诈账户、2880 万次交互「非法提取」(蒸馏)Claude 能力,称这是迄今对它「已知最大的一次蒸馏攻击」。指控见报当天,阿里 Qwen 的 Qwen-AgentWorld 论文登上 HuggingFace 当日最高票(136 赞),论文宣称在自建基准上超越前沿模型。蒸馏的合法边界、开源权重与 IP 保护、中美 AI 竞争在同一个新闻日里交织。注:Reuters 原文因反爬墙无法直接核验,本条以可独立验证的 CNBC 同日报道与 HuggingFace/arXiv 论文页为准,置信度中等。
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
Confident Decoding:别只信最后一层,Qwen 用「熵谷」选层,训练免改还涨分
Qwen 团队联合清华、NTU 挑战『最后一层表征最优』:模型存在『先猜—精化—扰动』动态,末层可能把已经想清楚的预测推向对齐偏好 token(『对齐税』)。Confident Decoding 训练免改、保留完整前向,用熵在『熵谷』动态选层喂给采样器。实测 FLOPs 增量不到 1%、零额外 KV 显存;gpt-oss-20b 在 Omni-MATH 最难档 +22.4 分。
- 这篇的杀伤力在于『几乎零成本』:不用重训、不加显存、延迟增加不到 2%,却能在硬核推理任务上拿到两位数百分点提升。
- 它把『对齐税』具象化为末层把预测拉向安全/通用 token 的现象,并用最优停止理论给出选层的 minimax 最优性。