#开源
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 社区工具2026-08-26 · 周三重要度 2/5
待验证|OpenWorker新增安全Agent
待验证:OpenWorker v0.2.0 release列出Security Coworker、Cloud Posture Coworker和Dependency Audit Coworker;Andrew Ng 8月25日转发说明其安全工作流。
- 低置信边界在于缺少第三方评测和真实误报数据。
- 它已有GitHub release和项目页支撑,暂按开源Agent安全工作流信号处理。
- 开源工具2026-08-25 · 周二重要度 2/5
待验证|OpenBot等Agent工作台继续更新
待验证低置信合并稿:OpenBot、Cumora和Rome在8月24日均有GitHub提交,主题集中在Agent工作台、隔离环境和团队协作。
- 这些仓库的共同信号是Agent产品开始把浏览器、文件、聊天和本地CLI组合成工作台。
- 由于证据主要来自仓库元数据和提交标题,它们更适合当作社区工具线索而非头条。
- 开源工具2026-08-24 · 周一重要度 3/5
solo-skills扩至26个Agent技能
solo-skills 8月23日提交把公开技能从15个扩至26个,并补充面向一人业务运营的脚本和流程说明。
- 这条属于Agent操作手册商品化的长尾样本,不能按模型能力新闻解读。
- 技能仓库把经验沉淀成可被模型读取的流程,适合小团队复制局部自动化。
- 开源工具2026-08-23 · 周日重要度 3/5深度报告 →
工具信号|Agent权限边界更新
OpenBot v0.0.4把失效快照ref点击改为拒绝;Cumora v0.2.0在开源后一周合并33个社区PR。
- 这组更新属于开源agent工具的工程治理信号。
- 它把执行权限、审计记录和自带运行环境写进产品默认值,显示工具从演示走向治理细节。
- 开源生态2026-08-19 · 周三重要度 4/5深度报告 →
Mojo编译器和工具链转为开源
Modular在8月18日宣布Mojo语言 fully open source,编译器、工具链和语言构建所需源码进入modular仓库,许可为Apache 2.0 with LLVM exceptions。
- Mojo的新闻价值在于AI系统语言终于从开放标准库走到开放编译器。
- 它不会立刻改变Python生态,但给GPU、AI accelerator和MAX内核开发者提供了更低层的可审计入口。
- 开源工具2026-08-14 · 周五重要度 4/5深度报告 →
DeepSeek Harness预览开源插件化agent框架
DeepSeek在8月13日开放Harness v0.1开发者预览,并在GitHub公开MIT仓库。同日commit发布dsh@0.1.0-rc.5,仍非GA稳定版。
- DeepSeek从模型API向执行框架外扩。
- 影响力取决于插件生态、沙盒安全和与现有LangChain、Codex类工具的互操作,首日星标只说明开发者关注度。
- 开发工具2026-08-12 · 周三重要度 3/5
Modular发布Mojo 1.0稳定版
Modular于8月11日发布Mojo 1.0,将语言与工具链带入稳定的1.x版本线,并承诺后续版本遵循兼容性预期。公司同时表示计划在2026年开放编译器和工具链源码。
- 1.0的核心价值是给AI基础设施开发者稳定性承诺,而不是一次基准跃升。
- 编译器尚未真正开源,生态可信度取决于后续兑现时间、许可证与第三方构建能力。
- 产品上新2026-08-06 · 周四重要度 3/5
Cloudflare OS发布开放智能体工作平台
Cloudflare于8月5日发布Cloudflare OS,称其为开源平台,供组织构建应用、自动化工作并安全访问内部系统;官方把连接器、组织知识与隔离环境列为核心组成。
- 当天的增量是平台与代码路径公开,而非已验证的大规模企业采用。
- 把每个文档或应用实例放入隔离环境的设计,回应的是连接器和内部数据带来的权限问题
- 产品上新2026-08-06 · 周四重要度 3/5深度报告 →
Prime Intellect发布自我改进编码harness
Prime Intellect于8月5日发布开源Prime Agent,称其以递归语言模型和持续harness为核心,让编码智能体利用执行结果、日志与失败原因改进后续任务表现。
- 这类项目把“会写代码”的模型能力移到一个持续收集轨迹、评估和再利用经验的运行框架中。
- 其ARC-AGI-3数字来自项目方,新闻价值在开源harness的设计与可检验性,而不是把单次评测写成通用智能结论。
- 社区工具2026-08-04 · 周二重要度 2/5
社区信号|Nightcrawler在HN展示手机端渗透测试Agent
Nightcrawler 在 Hacker News 于 8 月 3 日以“手机本地运行的 AI 渗透测试智能体”展示,采集时获 98 points 与 30 条评论。当天可确认的是 HN 展示和讨论,不等于项目首次发布或安全能力已被独立验证。
- 把安全工具做成本地移动端 Agent 的价值取决于权限控制、授权范围和误用防护。
- HN 讨论说明该方向受到关注,但不能替代代码审计、合法测试边界或真实渗透效果。
- 开源更新2026-08-04 · 周二重要度 2/5
待验证|Nous Research发布Hermes Agent v0.20.0
Nous Research 在官方 X 发布 Hermes Agent v0.20.0,并以“Herald Release”指代该版本。当前采集只拿到发布帖,更新清单与代码发布页需要继续核对,因此不把具体能力写成既成事实。
- 版本号本身是可观察到的工程信号,但没有发布说明就不足以证明新功能或性能提升。
- 对使用者而言,优先级应是核验 changelog、依赖升级和回归测试,而不是根据名称推断能力。
- 开源更新2026-08-04 · 周二重要度 3/5
Qwen Audio Agent发布v1.3.0语音前端更新
QwenAudio 在 GitHub 于 8 月 3 日发布 qwen-audio-agent v1.3.0。这是一项实时语音 Agent 运行时的版本更新;变更应以 Release 与仓库文档为准,不能把它表述为新基础模型发布。
- 语音智能体的竞争开始从模型能否说话转向前端会话、打断处理和工具执行如何连续衔接。
- 此次版本更新的产品影响取决于兼容性、延迟和实际部署文档,而非仓库总星数。
- 工程实践2026-08-02 · 周日重要度 2/5
Qwen Audio Agent发布v1.2.0,补齐桌面更新
Qwen Audio Agent 在窗口内发布 v1.2.0,加入桌面自动更新、启动卡顿修复和后端 Agent 可用性显示,并解耦实时服务商协议。
- 这是把语音 Agent 从演示仓库推向可维护桌面应用的版本更新。
- 改动集中在分发与协议边界,不是底层语音模型再次发布。
- 开源工具2026-07-24 · 周五重要度 2/5
OneCLI 1.42.0 修复智能体凭据注入绕过
OneCLI 于 7 月 23 日发布 1.42.0,加入首个匹配即生效的统一策略引擎,并修复凭据注入中的主机校验绕过。Show HN 同日获得 85 分。
更新把智能体凭据代理从规则拼接推进到更明确的策略决策,同时用安全修复提醒开发者:秘密不进上下文并不等于注入链路天然安全。
- 开源工具2026-07-20 · 周一重要度 5/5深度报告 →
agent-browser 0.32.3 把 HAR 变成客户端素材
agent-browser 0.32.3 于北京时间 7 月 20 日凌晨发布。新版默认把文本响应体嵌入 HAR,并加入从录制流量派生 API 客户端的 Skill。
- 浏览器操作开始从一次性点击转向可复用接口资产。
- 收益是减少后续 DOM 自动化成本,代价是 HAR 中的凭证和内部接口必须被当作敏感、易变数据管理。
- 安全工具2026-07-18 · 周六重要度 5/5深度报告 →
7 月 17 日跟进|VulnHunter 进入社区讨论
7 月 17 日 HN 跟进 Capital One 此前官宣的 VulnHunter。公告时间为 7 月 16 日 17:00 UTC,早于本期滚动窗口约 6 小时。
- VulnHunter 的差异点是把减少误报写进 Agent 工作流,而不是只生成更多漏洞候选。
- 当前成效仍是 Capital One 自报。
- 开源工具2026-07-16 · 周四重要度 4/5深度报告 →
xAI 开源 Grok Build,公开 Rust Agent 运行时
xAI 7 月 15 日公开 Grok Build 的 Rust CLI、TUI 与 Agent 运行时。目标窗口内公开仓库只有 1 个首发提交,采集时递归树包含 3194 个条目,其中 2219 个路径以 .rs 结尾。
- 这次开放的价值在工程透明度,而不是模型权重。
- 外部团队可检查上下文压缩、沙箱、工具和长任务实现,但仓库仍是内部单体库的周期性镜像。
- 开源工具2026-07-12 · 周日重要度 4/5深度报告 →
GitHub 新仓合流:Agent 工具开始把可驱动和可验证写进接口
FableCut、kill-ai-slop、watch-skill、ax 与 sqlsure 在目标日保持更新。仓库描述分别覆盖可调用接口、执行证据与语义检查。
5 个仓库仍是早期样本,不能代表成熟度。共同信号是 Agent 工具开始把“能否检查执行结果”写进产品接口。
- 研究论文2026-07-11 · 周六重要度 4/5深度报告 →
待验证|UniClawBench:400 个真实任务把 Agent 评测推向闭环执行
UniClawBench 进入 Hugging Face Papers,提出 400 个双语真实任务;当前结果仍主要来自作者论文和项目数据。
- 观点观察2026-07-05 · 周日重要度 3/5
Fable 5「移植命令与征服」真相:99% 是开源社区地基
作者 ammaar 宣称用 Fable 5 把 2003 年 EA《命令与征服:将军》原生移植到 iPhone、iPad,无模拟器。dotey 翻 commit 发现:ammaar 只贡献最近 19 个,其余 2000 个全来自 GeneralsX 自 2025 年 2 月起的积累。
- 这是 Fable 5 营销叙事「AI 独立完成大型移植」水分的标准样本:AI 在 99% 已开源的工作上做最后 1% 整合加营销包装,工程地基来自社区多年沉淀。
- 识别方法很简单——看 commit 时间分布加作者贡献占比。
- 产品上新2026-07-04 · 周六重要度 2/5
豆包 GEO skill 开源升级版:网页 + 手机 App 双端采集、截图 + XML 全记录、不绕登录——@yaojingang 7-3。
@yaojingang 7-3 发布并开源升级版豆包 AI GEO(生成式引擎优化)采集、清洗、分析 skill(获 61 赞)。三大能力:① 网页端(OpenCLI)+ 手机 App(Android Studio AVD + Appium UiAutomator2)双端采集,同一批关键词可并行取两端结果;② 手机端不只截答案,而是把截图、XML、引用资料。
- 豆包 GEO skill 开源是 GEO(Generative Engine Optimization,生成式引擎优化)赛道基础设施层的关键进展。
- GEO 是 2026 年新兴的 SEO 变体——传统 SEO 优化搜索结果排名,GEO 优化生成式 AI 回答中的内容引用。
- 产品上新2026-07-04 · 周六重要度 3/5
GitHub 今日 AI Agent 工具五连发:self-learning-skills、sim-use、Ava 与视频技能
GitHub 今日出现五个高 star AI Agent 工具:self-learning-skills 沉淀编程经验,sim-use 接入 iOS/Android 设备,Fundamental-Ava 做数字人,claude-real-video 处理视频理解,video-production-skills 提供视频制作技能库。
- 五个项目共同扩展 Agent 能力边界:自我学习让 agent 沉淀经验
- sim-use 与 claude-real-video 把交互从文本扩到 GUI 和视频
- 产品上新2026-07-03 · 周五重要度 2/5
Lycorp 开源 sim-use(456★):让 AI Agent 直接接管 iOS Simulator 与 Android emulator/devices 的视觉与操作
Lycorp 开源 sim-use:让 AI Agent 直接接管 iOS Simulator 与 Android emulator/devices 的视觉与操作——给 Agent「眼睛和手」。GitHub 456★,与 Anthropic 演示的 Fable 5 自主去火山引擎提交工单(2026-07-02 @Khazix0918 帖 488 赞)是同一条技术线,但这是开源方案;Claude Code 等专用 Agent 工具还没原生提供等价能力,开发者要么等官方、要么自己接 sim-use。sim-use 兼容主流 Agent 框架,可作为 iOS/Android 自动化测试与移动 App Agent 的基础设施。
- sim-use 真正改变的是 Agent 对原生设备(非桌面浏览器/非服务器)的「眼睛和手」能力。
- 当前主流 Agent 工具(Claude Code
- 产品上新2026-07-03 · 周五重要度 3/5深度报告 →
Meta 开源 Astryx:一个被错读成「AI Agent 框架」的 UI 设计系统
Meta 旗下 facebook/astryx 在 GitHub 拿下 3546 星,但中文 AI 圈把它错读成「原生异步、Actor/Stream 反应式 Agent 编排框架,直接挑战 LangChain/CrewAI」。事实核查显示:它是一个基于 React + StyleX 的开源 UI 设计系统,8 年孵化、13000+ Meta 内部应用在用、150+ 可访问性组件,「agent ready」指的是 AI 编程助手能用它,而不是它本身是 Agent。
- Meta 开源 Astryx 的真正信号是「AI Agent 框架层从链式编排走向反应式架构」的范式转移。
- LangChain/CrewAI/Autogen 当前主流的链式/图式编排范式源于 LLM 单调用场景,在多智能体协作、流式输出、异步事件驱动的实时场景下会出现回调地狱与状态管理难题。
- 研究论文2026-07-02 · 周四重要度 3/5
Orca 开源 computer use:HF 论文 176 分,基本复刻 Codex app 全部功能,只剩 record & replay 未开源
HF 论文《Orca: The World is in Your Mind》(arXiv 2606.30534,HF 176 分,本日 HF 候选最高)开源了 computer use 能力,基本复刻 Codex app 全部功能。@LinearUncle 实测:Orca 开源的 computer use 跟 Codex app 一样好用,到目前为止 Codex app 的功能几乎都能在开源里找到替代——唯一还没看到对手的只剩 record & replay(录制回放)。这意味着开发者不再需要 Codex 订阅即可获得『computer use』能力,OpenAI 在 computer use 上的产品护城河进一步收窄。
- Orca 开源 computer use 真正改变的是『computer use』从 OpenAI 产品护城河转向社区基础设施
- 这是继 OSWorld / OpenCUA 之后第三个重要的开源 computer use 框架。
- 研究论文2026-07-01 · 周三重要度 3/5
Meta Brain2Qwerty v2 增量:开源训练代码 + BCBL 发布 v1 数据集,9 名志愿者平均词准确率 61% / 最佳 78%
Meta AI 转发 Jean-Remi King:Brain2Qwerty v1 已在 Nature Neuroscience 发表,Brain2Qwerty v2 已开源(v2 在 v1 基础上加入并改进了更鲁棒的语言模型/神经解码 pipeline)。这是继 6-29 Nature 发表后的开源代码 + 数据集同步释放——Meta 走的是『论文 + 代码 + 数据』三件套路线。HN 64 分热帖补充关键事实:这是首个能从原始 MEG 脑信号端到端实时解码整句的非侵入式 BCI,9 名志愿者平均词准确率 61%、最佳 78%。6-29 早报已写过全量增量,本期为延续报道。
- 增量看点是『开源代码 + 数据集』与『Nature 论文』的同步释放
- Meta 用『三件套』路线把 Brain2Qwerty 变成可被全球 BCI 研究者复现的基线,这与 OpenAI 形成鲜明对比。
- 开源工具2026-06-30 · 周二重要度 2/5
trotsky1997/OpenFugu 开源复现 Sakana Fugu:统一 LLM 编排器(读 → 跑 → 训 → 服务),GitHub 313 星
trotsky1997/OpenFugu 在 GitHub 拿下 313 星,Sakana Fugu 的开源复现,统一 LLM 编排器覆盖『读 → 跑 → 训 → 服务』全链路。这是把 Sakana 闭源的 Fugu 用开源方式重新实现,降低中小团队使用门槛。
- Sakana Fugu 一直是日本 AI 头部公司里『被关注但难复现』的项目
- OpenFugu 把它做成开源编排器,意味着中小团队可以用与 Sakana 同样的工作流构建自训练模型。
- 研究论文2026-06-30 · 周二重要度 3/5
Meta Brain2Qwerty v2 增量追踪:开源训练代码 + BCBL 发布 v1 数据集,9 名志愿者平均词准确率 61% / 最佳 78%
Meta 在 v2 登上 Nature 的同时,开源 v1/v2 完整训练代码,合作方 BCBL 发布 v1 数据集。9 名健康志愿者 MEG 打字 10 小时 × 约 22,000 句,平均词准确率 61%,最佳志愿者 78%;>50% 的句子解码错误 ≤1 词。增量视角:本事件昨天已写过全量深度页,本期仅做增量追踪。
- 增量看点是开源代码 + 数据集的同步释放——Meta 走的是『论文 + 代码 + 数据』三件套路线,与 OpenAI 形成鲜明对比。
- 这意味着 Brain2Qwerty 不只是 Meta 的 PR 项目,而是真正可以被全球 BCI 研究者复现的基线。
- 开源生态2026-06-29 · 周一重要度 3/5
待验证|OpenFugu 305★:开源复现 Sakana AI Fugu LLM orchestrator,4 周从读 → 训练 → 服务
trotsky1997/OpenFugu(GitHub,305★):Sakana AI Fugu LLM orchestrator 开源复现,覆盖读 → 运行 → 训练 → 服务全流程。
- Sakana Fugu 是日本 Sakana AI 在 2026 上半年重点推进的 LLM orchestrator(多模型协同调度),OpenFugu 在 4 周内把核心流程做到开源复现,是开源社区对日本前沿 AI 实验室的快速跟读
- 间接说明 Sakana 的技术护城河主要在训练数据与评测,orchestrator 架构本身可被复现。
- 研究论文2026-06-29 · 周一重要度 5/5深度报告 →
Meta Brain2Qwerty v2 上 Nature:从脑信号实时解码整句,平均词准确率 61%,开源代码与数据
Meta AI 联合巴斯克认知脑与语言中心(BCBL)于 2026-06-29 在 Nature 发表 Brain2Qwerty v2——首个能从 MEG 原始脑信号实时解码整句的非侵入式端到端流水线。相比 v1 的字符级分类,v2 跃迁到词与语义级:9 名志愿者佩戴 MEG 设备各打字 10 小时共约 22,000 句,深度学习模型处理 MEG 信号并微调 LLM,平均词准确率 61%、最佳受试者 78%、超半数句子解码错误 ≤1 词,且性能随数据量对数线性扩展。研究代码已开源,v1 数据集同步开源。这是侵入式 BCI 之外,首次具备临床沟通可行性的非侵入式路径。
- 行业动态2026-06-28 · 周日重要度 3/5
待验证|GitHub 涨星榜:agent skill 包与 context 文件正成为新的开发者 dotfiles
据 @sharbel 整理,本周 GitHub 涨星最快的 10 个仓库主题集中在『agent skill 包与 context 文件正成为新的开发者 dotfiles』:OpenMontage(+17.2K,首个开源 agentic 视频制作系统,12 条 pipeline/52 工具/500+ agent skills)、skills(+11.1K,来自作者 .claude 目录的工程师 skills)、codebase-memory-mcp(+7.6K,把代码库索引成持久知识图谱,158 种语言、亚毫秒查询、省 99% token)、Agent-Reach(+7.2K,给 agent 读/搜 Twitter/Reddit/YouTube/B站等)、Anthropic-Cybersecurity-Skills(+5.1K,817 个安全 skill 映射 MITRE ATT&CK 等 6 套框架)。另据 @zrebroia,一个让 Claude『像最懒资深工程师那样编码』的 skill 一周冲到 5.8 万星、2.9k fork,宣称代码量少 54%、便宜 20%、快 27%。
- 『agent skill 正成为新 dotfiles』这个判断很到位:过去开发者攒的是 .vimrc、.zshrc 这类个人配置,现在攒的是 .claude 目录里的 skill 和 context 文件
- 可移植、可分享、可版本控制的『agent 能力包』。
- 研究论文2026-06-28 · 周日重要度 4/5深度报告 →
DeepSeek 联合北大发布投机解码框架 DSpark,开源全栈代码库 DeepSpec
据 X 用户 @0xLogicrw / @danielhanchen 转述(以官方技术报告为准),DeepSeek 联合北京大学发布投机采样加速框架 DSpark 技术报告,并开源全栈代码库 DeepSpec,DSpark 已部署于 DeepSeek-V4 线上业务。在输出无损前提下,转述称 Flash 版单用户生成速度提升 60%-85%、Pro 版提升 57%-78%,超过原 MTP-1 基线;另一口径(@danielhanchen)称吞吐提升 51% 到 400%——两套数字差异很大,需以官方报告与开源代码实测为准。技术上先用 DFlash 并行主干生成隐藏状态,再追加轻量马尔可夫头(查表+一次矩阵乘)串行注入相邻词关联,配合置信度预测头与异步零开销调度避免高并发下吞吐崩塌。可独立证实的部分:deepseek-ai/DeepSpec 仓库确已开源(MIT,约 1.8k stars),自述为『训练与评估投机解码算法的全栈代码库』,README 列出 DSpark / DFlash / Eagle3 三种 draft model,目标模型支持 Qwen3(4B/8B/14B)与 Gemma,并提供从下载提示词到基准评估的完整 Python 工具链。
- 模型发布2026-06-27 · 周六深度报告 →
智谱开源 GLM-5.2(Max):753B/1M 上下文/MIT 协议,Code Arena 前端超越全部 Opus、仅次 Fable 5
智谱 AI 开源 GLM-5.2(Max),约 753B 参数、100 万 token 上下文、MIT 协议(据 HuggingFace 模型卡)。在 Code Arena 前端赛道以 1595 分排第 2、仅次 Claude Fable 5(1665 分),超越 Claude Opus 4.8 并在头对头中击败全部 Opus 变体(含 4.8/4.7 Thinking)。智谱自报 SWE-bench Pro 62.1、AIME 2026 99.2。All In 节目嘉宾 Sacks 估计中国模型落后约 9 个月、芯片落后约 24 个月,并称 GLM5 家族已用华为昇腾完成训练(此点模型卡仅确认昇腾推理,训练为单一来源待核实)。
- 产品上新2026-06-27 · 周六
OpenKnowledge:开源 AI-first 笔记,对标 Obsidian/Notion
Show HN 项目 OpenKnowledge(inkeep 出品)定位为开源、AI 优先的 Obsidian/Notion 替代品。HN 热度 372。
- 笔记软件正经历 AI-first 重做潮,但决定胜负的不是"能不能对话",而是检索与生成是否长进数据结构本身
- inkeep 以搜索见长切入正说明这一点,纯加一层 chat 的产品很快会被淘汰。
- 行业动态2026-06-27 · 周六
上下文工程成新焦点:agent 技能包与记忆正成为新的开发者 dotfiles
本周 GitHub 增长榜显示 agent 技能包与 context 文件成新趋势,OpenMontage(+17.2K,开源 agentic 视频生产)、.claude skills(+11.1K)、codebase-memory-mcp(+7.6K,代码库索引为知识图、token 省 99%);Memanto 给 Claude Code/Cursor/Codex 装无限记忆,Warp 把开源维护做成 agent-native workflow。
- 这条线和字节洪定坤的 Harness 结论遥相呼应:当模型能力趋同、代码生成便宜,真正稀缺的是"判断什么能进系统"的上下文与工程约束。
- 技能包、记忆层、context 文件正在沉淀为可复用、可版本化的开发者资产——相当于 agent 时代的 dotfiles。
- 行业动态2026-06-27 · 周六
OpenRouter:四款 open-weight 模型已驱动真实 agentic 流水线
OpenRouter Insights 新博文指出已有四款 open-weight 模型跨过门槛、正在驱动真实 agentic 流水线,分析了 6 月企业为何选择它们。
- 当 OpenRouter 这类分发层公开背书"open-weight 已可用于生产级 agent",意味着开源模型从"跑分能看"跨入"流水线能跑"的实用拐点
- 成本可控、可私有部署、可定制是企业在 agentic 场景选型的硬驱动。
- 研究论文2026-06-27 · 周六
MoA 混合代理:NousResearch 称超闭源,论文发现'共败上限'
NousResearch 将 Hermes Agent 的 MoA(混合代理)预设作为虚拟模型开放,自称在即将发布的基准上比 Opus 4.8 高 8%、比 GPT-5.5 高 11%;同期 arXiv 论文《When Does Combining Language Models Help?》跨 67 个前沿模型发现路由/投票/MoA 存在"共败上限",组合收益受限于成员模型共同失败的模式。
- 两条消息正好构成一组张力:NousResearch 证明开源靠"组合"能逼近甚至超过单点闭源,但论文警告组合的天花板由成员模型的共同盲区决定
- 越同质的模型群组合收益越小。
- 研究论文2026-06-27 · 周六深度报告 →
DeepSeek 开源 DSpark 全栈 DeepSpec:投机解码从「算法竞赛」走向「可复刻工具链」
DeepSeek 联合北京大学发布投机解码框架 DSpark 并开源全栈训练代码库 DeepSpec(MIT),已部署于 DeepSeek-V4 线上真实流量。在匹配吞吐、输出无损前提下,V4-Flash 单用户生成提速 60%–85%、V4-Pro 提速 57%–78%,超越原 MTP-1 生产基线。DSpark 以 DFlash 并行主干(3 层 MoE)生成隐藏状态,再追加低秩马尔可夫头注入相邻词关联,配合置信度预测头与后验校准(STS),用「两步前预测」的异步调度避免高并发下吞吐崩溃。DeepSpec 内置 DSpark/DFlash/Eagle3 三种草稿器,支持 Qwen3、Gemma4,提供从数据准备到基准评估的完整 Python 工具链。论文登上 Hacker News 首页(约 716 分、近 300 评论)。
- 研究论文2026-06-26 · 周五深度报告 →
DeepSeek 上线 DSpark:把投机解码做成「系统调度问题」,V4 推理再提速 80%
DeepSeek 发布投机解码框架 DSpark(半自回归草稿 + 置信度调度验证),并已部署到 DeepSeek-V4 Flash/Pro 真实线上流量。在匹配吞吐下,相比上一代 MTP-1 生产基线,V4-Flash 单用户生成速度提升 60%–85%、V4-Pro 提升 57%–78%。论文登上 Hacker News 首页(逾 600 分/230 评论),与同期 JetSpec 等工作共同把推理效率推向新前沿。
- 行业动态2026-06-26 · 周五
Gemma 4 上线 2.5 个月下载破 2 亿次
Google DeepMind 称 Gemma 4 在仅 2.5 个月内达到 2 亿次下载。
- 2 亿次下载印证开放权重生态的真实体量,也是 Google 在闭源 Gemini 之外的第二条腿。
- 放在"美国政府能否封禁开放权重"(Mollick)与 GLM/Qwen 开源攻势的同框里,这个数字是 Google 对"开源不能输"的下注。
- 模型发布2026-06-26 · 周五深度报告 →
Qwen 开源原生语言世界模型 AgentWorld,宣称超 Opus 4.8
阿里通义千问发布 Qwen-AgentWorld:用单一模型模拟 MCP/Search/Terminal/SWE/Web/OS/Android 共 7 类 agent 环境,把"环境建模"作为从第一天起的训练目标。开源 35B 总参/3B 激活的 MoE(256K 上下文)及 AgentWorldBench,宣称在该榜超 Claude Opus 4.8 与 GPT-5.4;世界模型预热带来跨 7 项基准提升(Terminal-Bench 2.0 +6.3、WideSearch +12.8、Claw-Eval +11.3 等),且无需 agent 专项训练即可零样本迁移。核心范式是"先预测环境、再行动"(predict before you act)。
- 研究论文2026-06-24 · 周三重要度 3/5
MemGUI-Agent:把「管理上下文」做成一等动作,治长程手机 GUI agent 的健忘
针对 ReAct 式提示在长程手机 GUI 任务里被动堆历史、导致 prompt 爆炸又稀释关键跨 app 事实的问题,MemGUI-Agent 提出 Context-as-Action(ConAct):让同一个策略既选 UI 动作、也主动发出『折叠动作历史/折叠 UI 状态/保留近期步骤』三类结构化上下文管理动作。配套 2956 条轨迹数据集 MemGUI-3K,训出的 8B 模型拿到 MemGUI-Bench 最佳开源数据成绩,并泛化到分布外的 MobileWorld。
- 这条思路的聪明之处在于把『记什么、扔什么』从外挂的记忆模块变成策略自己学的动作
- 上下文管理和 UI 操作同源同策略,模型在『点哪个按钮』和『该记住哪个事实』之间统一决策。
- 研究论文2026-06-24 · 周三重要度 4/5深度报告 →
OpenThoughts-Agent:把 agentic 模型的训练数据配方完全开源
OT-Agent 针对「怎么为通用 agent 策展训练数据」这一公开知识空白,跑了 100+ 受控消融、组装 10 万样本微调 Qwen3-32B,七项 agent 基准均分 44.8%,比最强开源数据模型 Nemotron-Terminal-32B(40.9%)高 3.9 个点(SWE-Bench Verified 54.0% vs 41.9%)。配方逐项消融,数据、流水线、模型全部开源。