Kimi 暂停新订阅,HAR 工具补强
- 过去 24 小时没有新的 OpenAI 或 Anthropic 官博条目。
- 最明确的产品动作是 Kimi 暂停新增订阅,以及 agent-browser 发布 HAR 响应体采集。
今天的共同变化不是模型分数再涨,而是供给与工具链被重新组织:Kimi 先保护现有会员,浏览器 Agent 则开始把一次性交互沉淀为可复用客户端。
本期速览
3 条01Kimi 先保护现有会员
- 暂停对象是新增订阅。
02HAR 开始承载客户端派生
- 0.32.3 默认嵌入文本响应体。
03Qwen Preview 先于权重
- 三款产品先开放试用。
编辑总结
今天没有新的 OpenAI 或 Anthropic 官博发布,主要增量落在容量分配、工程工具和预览版入口。Kimi 的动作说明算力供给已经开始影响订阅策略,但“接近上限”仍是公司自述,不能写成 GPU 已经耗尽。
agent-browser 0.32.3 是本期最扎实的工程发布。它没有把浏览器自动化替换掉,而是让首次浏览留下可复用的请求与响应素材;真正的后续门槛会转向凭证脱敏、接口漂移和安全回退。
Qwen3.8-Max-Preview 已可在三款产品中试用,但开放权重仍是未来状态。对 2.4 万亿参数和能力排序的判断,仍需等待模型卡、技术报告与独立复现。
本期导航
本期重点 · 深度报告
Key Numbers
快讯 · 已核验与追踪
7月20日跟进|错误 AI 建议研究数字再受审视
北京时间 7 月 20 日,HN 集中讨论一篇 7 月 15 日预印本。无激励汇总中,有 AI 组正确率为 9.2%,无 AI 组为 27.5%。
要点拆解展开
研究提醒产品不能只评估回答本身,还要评估错误建议如何改变用户的不确定性表达。数字口径也直接影响风险传播。
产品团队应保留拒答、置信度与来源提示。读者不能把电影冷知识实验直接外推到医疗、法律或工作决策。
- 五项实验总样本
- 3132 人分析样本合计;原研究为 PsyArXiv v1 预印本PsyArXiv
- 无激励正确率
- 27.5% 对 9.2%无 AI 组对有 AI 组的汇总口径PsyArXiv
- “低三倍”应理解为正确率约为对照组的三分之一。
- 信心的 29.6 对 75.9 只来自其中一项实验,不能与全部五项实验合并概括。
- 研究能否加入同样错误的人类建议来源对照。
- 高风险任务中是否复现正确率与信心分离。
Graphkit 新仓用独立监督节点约束长任务
- Graphkit 仓库于北京时间 7 月 19 日创建,本期窗口内提交 9 次,其中 1 次在 20 日凌晨。
- 它用执行节点、独立监督节点和持久化账本管理长程编码任务。
要点拆解展开
长任务的主要风险常是上下文漂移和目标悄然变化。独立监督上下文提供一种低成本的结构性约束。
开发者可参考其账本、指令和小样本先行规则。采用前应检查并发写冲突、提交权限和监督误判。
- 窗口内提交
- 9 次北京时间 7 月 19 日 8 次,20 日凌晨 1 次,全部逐项核时GitHub API
- 核心节点
- 2 类执行节点与独立监督节点,通过持久化文件交换状态项目 README
- 新意不在又做一层多 Agent,而在把监督节点与执行上下文隔离,并只通过文件交换状态。
- 项目仍是早期 Skill,可靠性主张尚未经过外部评测。
- 是否出现可复现的长期任务对照实验。
- 监督节点如何避免与执行节点竞争写入。
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
待验证|Codex 仍有残余 TRACE 写入
北京时间 7 月 20 日凌晨,一名用户在 Codex 0.144.5 上复测称,主要日志洪泛似乎已修复,但 30 秒样本仍产生约 5.06 MiB WAL 写入。
要点拆解展开
诊断日志会同时影响磁盘耐久、隐私与默认配置。残余路径是否成立,需要维护者和更多平台复现。
- Codex 用户可观察 logs_2.sqlite 与 WAL 增长。
- 不要仅凭短样本推算硬盘寿命,也不要把旧 alpha 状态当成当前版本状态。
- 单机 WAL 样本
- 5.06 MiB30 秒活动样本,来自一名 Linux 用户复测GitHub Issue
- 稳定修复版本背景
- 0.143.0旧修复已于 7 月 8 日进入稳定版,不再只是 alphaGitHub Release
- 新增证据只说明单机仍有残余 TRACE 持久化,不能复述成 37 TB 个案仍普遍存在。
- 过去 24 小时没有对应的新修复提交或 release。
- 维护者是否确认残余 TRACE sink。
- 不同系统与负载能否复现写入规模。
社交雷达 · X 讨论
- OpenAI 工程师介绍 ChatGPT Work:可创建并托管网站、代管邮件、汇总大量文档,以及制作文档、表格和幻灯片。
- 该功能已进入移动端与网页端,并包含在 Plus、Pro、Business 和 Enterprise 方案内。
原帖 ↗- AstroHanRay 用 Kimi K3 对比两套 Agent harness:Terminal-Bench 2.1 总分中,Kimi Code 为 59.6%,Maka 为 69.7%
- 困难题得分分别为 43.3% 和 63.3%,显示同一模型的运行框架会显著影响结果。
- 这是作者团队的实测,尚非独立复现。
原帖 ↗- thesupermanmx 介绍一款 3B 参数
- 32K 上下文的本地长文档 OCR 模型 Unlimited-OCR,称其可整份解析百页 PDF,标准解析基准为 93%
- 较基线高 6 个百分点,超过 40 页时错误率低于 0.11。
- 帖中还称模型已在 Hugging Face 获得 190 万次下载
原帖 ↗- 0x_kaize 汇总 Codex SQLite 日志写盘问题:一名单机用户称 21 天写入 37 TB,年化约 640 TB。
- 帖子称三项修复让本地日志量降低约 85%,但仍把一项修复写成只在 0.143.0 alpha
- 核验显示稳定版已于 7 月 8 日发布。
原帖 ↗- ctatedev 表示 agent-browser 已原生支持启动和停止 HAR 网络录制,并新增 derive-client skill。
- 其工作流是先让 Agent 浏览网页并记录请求,再据此生成站点客户端,以减少后续反复操作浏览器的开销。
原帖 ↗- gkxspace 推荐开源电子书《深入理解 AI Agent》,称其从工程角度解释长上下文退化
- 工具调用失败和 harness 差异,并为章节配套可运行实验。
- 作者观察该项目当天新增约 2000 个 GitHub stars
- 这是时间点快照。
原帖 ↗更多讨论4 条
- Youngxxxxu 称,在 OpenCodex 导入本地 Google Antigravity 订阅时,未发布的 gemini-3.5-pro 出现在可用模型列表且可正常响应。
- 该发现仅来自单一用户的灰度体验,Google 尚未确认模型名称、能力或正式发布计划。
原帖 ↗- Saccc_c 展示用 Kimi K3 的一条 goal 命令生成世界杯决赛前瞻视频,称素材、旁白和配乐均由模型一次完成。
- 该帖属于个人演示,没有披露生成耗时、Token 成本或失败重试次数。
原帖 ↗- mylifcc 报告 Codex 长任务可能在上下文压缩后只保留初始指令,继而陷入“执行初始指令—再次压缩”的循环并耗尽额度。
- 该问题是用户观察,帖子没有提供可复现步骤或受影响版本,仍待工程团队确认。
原帖 ↗- trikcode 称把 Claude API 切换到 Kimi 后,个人体验是速度更快、价格低约 10 倍且代码质量更好。
- 帖子未给出模型版本、任务集、Token 口径或账单,因此应视为高互动的个人使用感受,而不是可复现测评。
原帖 ↗