最新一期第 28 期 · 共 6 条信号
2026年7月20日
周一 · 过去 24 小时的 AI 世界

Kimi 暂停新订阅,HAR 工具补强

  • 过去 24 小时没有新的 OpenAI 或 Anthropic 官博条目。
  • 最明确的产品动作是 Kimi 暂停新增订阅,以及 agent-browser 发布 HAR 响应体采集。
本期判断

今天的共同变化不是模型分数再涨,而是供给与工具链被重新组织:Kimi 先保护现有会员,浏览器 Agent 则开始把一次性交互沉淀为可复用客户端。

本期速览

3 条
  1. 01Kimi 先保护现有会员
    • 暂停对象是新增订阅。
  2. 02HAR 开始承载客户端派生
    • 0.32.3 默认嵌入文本响应体。
  3. 03Qwen Preview 先于权重
    • 三款产品先开放试用。

编辑总结

今天没有新的 OpenAI 或 Anthropic 官博发布,主要增量落在容量分配、工程工具和预览版入口。Kimi 的动作说明算力供给已经开始影响订阅策略,但“接近上限”仍是公司自述,不能写成 GPU 已经耗尽。

agent-browser 0.32.3 是本期最扎实的工程发布。它没有把浏览器自动化替换掉,而是让首次浏览留下可复用的请求与响应素材;真正的后续门槛会转向凭证脱敏、接口漂移和安全回退。

Qwen3.8-Max-Preview 已可在三款产品中试用,但开放权重仍是未来状态。对 2.4 万亿参数和能力排序的判断,仍需等待模型卡、技术报告与独立复现。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

3 篇

Key Numbers

Kimi 需求观察窗

公司称需求在此前 48 小时把现有容量推至接近上限;没有披露 GPU 或利用率

来源:Kimi 官方 X →
48 小时

未来会员类别

  • 计划拆分为通用 Kimi Membership 与编程工作流 Kimi Code Membership
  • 尚未实施
来源:Kimi 官方 X →
2 类

agent-browser 版本

北京时间 7 月 20 日凌晨发布,新增 HAR 响应体采集与 derive-client Skill

来源:GitHub Release →
0.32.3

Qwen3.8 参数量

厂商自报总规模;没有公开激活参数、技术报告或独立核验

来源:Qwen 官方 X →
2.4 万亿
Briefs

快讯 · 已核验与追踪

2 条
研究论文重要度 3/5中置信已核验

7月20日跟进|错误 AI 建议研究数字再受审视

北京时间 7 月 20 日,HN 集中讨论一篇 7 月 15 日预印本。无激励汇总中,有 AI 组正确率为 9.2%,无 AI 组为 27.5%。

要点拆解展开
Why

研究提醒产品不能只评估回答本身,还要评估错误建议如何改变用户的不确定性表达。数字口径也直接影响风险传播。

Impact

产品团队应保留拒答、置信度与来源提示。读者不能把电影冷知识实验直接外推到医疗、法律或工作决策。

Numbers
五项实验总样本
3132 人分析样本合计;原研究为 PsyArXiv v1 预印本PsyArXiv
无激励正确率
27.5% 对 9.2%无 AI 组对有 AI 组的汇总口径PsyArXiv
早报判断
  • “低三倍”应理解为正确率约为对照组的三分之一。
  • 信心的 29.6 对 75.9 只来自其中一项实验,不能与全部五项实验合并概括。
接下来看
  • 研究能否加入同样错误的人类建议来源对照。
  • 高风险任务中是否复现正确率与信心分离。
#AI 建议#人机交互#置信度#PsyArXiv
开源工具重要度 2/5中置信已核验

Graphkit 新仓用独立监督节点约束长任务

  • Graphkit 仓库于北京时间 7 月 19 日创建,本期窗口内提交 9 次,其中 1 次在 20 日凌晨。
  • 它用执行节点、独立监督节点和持久化账本管理长程编码任务。
要点拆解展开
Why

长任务的主要风险常是上下文漂移和目标悄然变化。独立监督上下文提供一种低成本的结构性约束。

Impact

开发者可参考其账本、指令和小样本先行规则。采用前应检查并发写冲突、提交权限和监督误判。

Numbers
窗口内提交
9 次北京时间 7 月 19 日 8 次,20 日凌晨 1 次,全部逐项核时GitHub API
核心节点
2 类执行节点与独立监督节点,通过持久化文件交换状态项目 README
早报判断
  • 新意不在又做一层多 Agent,而在把监督节点与执行上下文隔离,并只通过文件交换状态。
  • 项目仍是早期 Skill,可靠性主张尚未经过外部评测。
接下来看
  • 是否出现可复现的长期任务对照实验。
  • 监督节点如何避免与执行节点竞争写入。
#Graphkit#Agent 编排#监督节点#Claude Code
Developing

发展中 · 待进一步核验

1 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

工程跟进重要度 2/5低置信发展中

待验证|Codex 仍有残余 TRACE 写入

7 月 19 日,一名用户在 Codex 0.144.5 上复测称,主要日志洪泛已修复,但 30 秒样本仍产生约 5.06 MiB WAL 写入。

要点拆解展开
Why

诊断日志会同时影响磁盘耐久、隐私与默认配置。残余路径是否成立,需要维护者和更多平台复现。

Impact
  • Codex 用户可观察 logs_2.sqlite 与 WAL 增长。
  • 不要仅凭短样本推算硬盘寿命,也不要把旧 alpha 状态当成当前版本状态。
Numbers
单机 WAL 样本
5.06 MiB30 秒活动样本,来自一名 Linux 用户复测GitHub Issue
稳定修复版本背景
0.143.0旧修复已于 7 月 8 日进入稳定版,不再只是 alphaGitHub Release
早报判断
  • 新增证据只说明单机仍有残余 TRACE 持久化,不能复述成 37 TB 个案仍普遍存在。
  • 过去 24 小时没有对应的新修复提交或 release。
接下来看
  • 维护者是否确认残余 TRACE sink。
  • 不同系统与负载能否复现写入规模。
#Codex#SQLite#TRACE#磁盘写入
Social Radar

社交雷达 · X 讨论

6 条
thsottiaux@thsottiaux3315 likes
  • OpenAI 工程师介绍 ChatGPT Work:可创建并托管网站、代管邮件、汇总大量文档,以及制作文档、表格和幻灯片。
  • 该功能已进入移动端与网页端,并包含在 Plus、Pro、Business 和 Enterprise 方案内。
原帖 ↗
AstroHanRay@AstroHanRay143 likes
  • AstroHanRay 用 Kimi K3 对比两套 Agent harness:Terminal-Bench 2.1 总分中,Kimi Code 为 59.6%,Maka 为 69.7%
  • 困难题得分分别为 43.3% 和 63.3%,显示同一模型的运行框架会显著影响结果。
  • 这是作者团队的实测,尚非独立复现。
原帖 ↗
thesupermanmx@thesupermanmx7925 likes
  • thesupermanmx 介绍一款 3B 参数
  • 32K 上下文的本地长文档 OCR 模型 Unlimited-OCR,称其可整份解析百页 PDF,标准解析基准为 93%
  • 较基线高 6 个百分点,超过 40 页时错误率低于 0.11。
  • 帖中还称模型已在 Hugging Face 获得 190 万次下载
原帖 ↗
0x_kaize@0x_kaize1223 likes
  • 0x_kaize 汇总 Codex SQLite 日志写盘问题:一名单机用户称 21 天写入 37 TB,年化约 640 TB。
  • 帖子称三项修复让本地日志量降低约 85%,但仍把一项修复写成只在 0.143.0 alpha
  • 核验显示稳定版已于 7 月 8 日发布。
原帖 ↗
ctatedev@ctatedev556 likes
  • ctatedev 表示 agent-browser 已原生支持启动和停止 HAR 网络录制,并新增 derive-client skill。
  • 其工作流是先让 Agent 浏览网页并记录请求,再据此生成站点客户端,以减少后续反复操作浏览器的开销。
thdxr
  • thdxr 展示同类方法:让 Agent 控制浏览器并把网络请求录成 HAR,再从 HAR 派生网站客户端
  • 示例中生成了一个 Uber Eats CLI。
原帖 ↗
gkxspace@gkxspace305 likes
  • gkxspace 推荐开源电子书《深入理解 AI Agent》,称其从工程角度解释长上下文退化
  • 工具调用失败和 harness 差异,并为章节配套可运行实验。
  • 作者观察该项目当天新增约 2000 个 GitHub stars
  • 这是时间点快照。
bojie_li
  • 项目作者此前称仓库达到 2600 个 stars,并发布 v1.1:用 Claude Code
  • Kimi K3 与 Opus 4.8 补齐 30 多个实验
  • 修复依赖并更新多数实验所用模型。
原帖 ↗
更多讨论4 条
Youngxxxxu@Youngxxxxu244 likes
  • Youngxxxxu 称,在 OpenCodex 导入本地 Google Antigravity 订阅时,未发布的 gemini-3.5-pro 出现在可用模型列表且可正常响应。
  • 该发现仅来自单一用户的灰度体验,Google 尚未确认模型名称、能力或正式发布计划。
原帖 ↗
Saccc_c@Saccc_c122 likes
  • Saccc_c 展示用 Kimi K3 的一条 goal 命令生成世界杯决赛前瞻视频,称素材、旁白和配乐均由模型一次完成。
  • 该帖属于个人演示,没有披露生成耗时、Token 成本或失败重试次数。
原帖 ↗
mylifcc@mylifcc196 likes
  • mylifcc 报告 Codex 长任务可能在上下文压缩后只保留初始指令,继而陷入“执行初始指令—再次压缩”的循环并耗尽额度。
  • 该问题是用户观察,帖子没有提供可复现步骤或受影响版本,仍待工程团队确认。
原帖 ↗
trikcode@trikcode10499 likes
  • trikcode 称把 Claude API 切换到 Kimi 后,个人体验是速度更快、价格低约 10 倍且代码质量更好。
  • 帖子未给出模型版本、任务集、Token 口径或账单,因此应视为高互动的个人使用感受,而不是可复现测评。
原帖 ↗
Previous Editions

往期早报

全部归档 →