#Claude Code
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 开源工具2026-08-24 · 周一重要度 3/5
solo-skills扩至26个Agent技能
solo-skills 8月23日提交把公开技能从15个扩至26个,并补充面向一人业务运营的脚本和流程说明。
- 这条属于Agent操作手册商品化的长尾样本,不能按模型能力新闻解读。
- 技能仓库把经验沉淀成可被模型读取的流程,适合小团队复制局部自动化。
- 开发者工具2026-08-16 · 周日重要度 3/5深度报告 →
Yadda 3.0.0把BDD带回Agent工作流
Yadda作者8月15日发布3.0.0并同步博客,称Claude Code完成大部分现代化工作;npm随后显示3.1.0也在同日发布。
- 这不是一个大生态发布,但它抓住了Agent编码的真实约束:规格、测试和生产代码不能被模型同时改写。
- 可执行规格的价值正在从团队沟通转向模型约束。
- 社区工具信号2026-08-09 · 周日重要度 2/5
phone-harness首发,干净安装仍被依赖阻断
作者8月8日首发phone-harness,借macOS的iPhone Mirroring让Claude Code操作真实iPhone。当天PR指出主分支引用不存在的PyPI依赖,非英语macOS的窗口识别也有缺口。
- 项目展示了把现成镜像窗口变成Agent执行面的低成本路径,也暴露提示词确认与系统级权限并不等价。
- 它仍是首日原型,影响力不能由点赞数替代。
- 产品上新2026-08-08 · 周六重要度 2/5
官方X单源|Claude Code预告默认Auto mode
Anthropic开发者账号称,Claude Code将从8月14日起把Auto mode设为Pro、Max与Team用户的默认权限模式。官方X单源给出的危险命令识别率为89%,产品文档尚待复核。
- 这项变化把逐条人工审批转向分类器预审,减少交互摩擦的同时扩大了自动决策责任。
- 89%与人工审批14%来自官方自测,不能等同于真实环境的安全覆盖率。
- 社区工具2026-08-02 · 周日重要度 1/5
待验证|Ponytail v1.1用七级检查约束过度实现
Ponytail 在窗口末段发布 v1.1,通过七级检查和生命周期钩子阻止 Agent 过度实现。作者自报少写 54% 代码,尚无独立复核。
- 它把“先判断是否需要写代码”固化成可移植技能。
- 公开报告给出固定仓库、任务、基线和样本数,但只有单模型单仓库,仍属作者自测。
- 行业动态2026-07-25 · 周六重要度 3/5
Claude Code 系统提示词删减超 80%
Anthropic 7 月 24 日披露,面向 Opus 5、Fable 5 等新模型的 Claude Code 系统提示词删减超过 80%,其内部编码评测未见可测损失。
- Anthropic 把稳定规则留在系统层、任务知识改为按需载入,并把更多局部判断交给模型。
- 结论目前只来自 Anthropic 自有产品与内部评测。
- 开源工具2026-07-20 · 周一重要度 2/5
Graphkit 新仓用独立监督节点约束长任务
Graphkit 仓库于北京时间 7 月 19 日创建,本期窗口内提交 9 次,其中 1 次在 20 日凌晨。它用执行节点、独立监督节点和持久化账本管理长程编码任务。
- 新意不在又做一层多 Agent,而在把监督节点与执行上下文隔离,并只通过文件交换状态。
- 项目仍是早期 Skill,可靠性主张尚未经过外部评测。
- 产品动态2026-07-13 · 周一重要度 3/5深度报告 →
单源|Claude X 称 Fable 5 付费访问延长至 7 月 19 日
Claude 官方 X 宣布,所有付费计划的 Fable 5 访问延长至 7 月 19 日,Claude Code 周限额继续维持在高出常规基准 50% 的水平。正式文档尚未同步具体额度。
- 限额变化会直接影响长任务能否持续运行,但单条官方 X 仍不足以说明具体计划、地区和重置规则。
- 应等待帮助文档更新。
- 观点观察2026-07-12 · 周日重要度 4/5深度报告 →
Agent 管理问题升温:从人类放大器到权限、审批与审计链
Off-Policy 2026-07-11 文章在 HN item 48874182 引发讨论。事实层面是观点文与社区讨论,早报关注其背后的 Agent 权限、审批、中断和审计问题。
- 观点观察2026-07-12 · 周日重要度 3/5深度报告 →
待验证|Systima 称 Claude Code 预提示开销约 3.3 万 tokens
Systima 7 月 12 日原文称,Claude Code 与 OpenCode 在读提示前分别消耗约 3.3 万和 7000 tokens。这是单源测试,仍需独立复现。
这组数字尚不能证明工具优劣。它值得追踪,是因为系统提示、工具说明与上下文快照已经成为用户不易看见的成本。
- 产品上新2026-07-10 · 周五重要度 4/5深度报告 →
待验证|Anthropic × UST:Claude 进入物理产品验证闭环
Anthropic 与 UST 联合披露,Claude 将进入 iDEC 硬件验证流程,并培训 20,000 名 UST 员工;效率数字仍是合作双方自报,暂无独立复核。
- Claude Code 在这里不只是写软件,而是读取 pinout、硬件原理图和数字孪生数据。
- AI agent 的企业价值开始从代码仓库延伸到物理产品验证。
- 产品上新2026-07-08 · 周三重要度 4/5深度报告 →
Anthropic 将 Claude Code 和 Cowork 带入政府桌面 beta
Anthropic 在 7 月 7 日宣布 Claude Code 与 Claude Cowork 进入 Claude for Government Desktop public beta,并强调 FedRAMP High 环境。使用场景包括系统现代化、RFP 审阅、memo、casework 和 deck。
- 这是一条商业化新闻,不是模型能力新闻。
- Claude Code 负责软件现代化,Cowork 处理政府文件,FedRAMP High 解决采购准入
- 产品上新2026-07-07 · 周二重要度 4/5深度报告 →
待验证|Claude Code 学会看视频:1.2k Star 的本地 FFmpeg 方案,把多模态缺口补成了一段命令行
开源工具 claude-real-video 用 FFmpeg 场景检测与 Whisper 转写,把任意 URL 或本地视频拆成 LLM 可读的关键帧与文本。GitHub 累计 1.2k Star,并上过 Hacker News 首页。对 Claude Code 而言,这等于把“看视频”补到了本地工作流级别。
- 1200 Star 投下的是『Claude 多模态视频缺口是真实需求』,这件事的工程意义不在 FFmpeg 抽帧参数本身,而在它把『视频到 frames 与 transcript 与 manifest』做成可被 Agent 在循环里反复调用的 skill。
- 这把『模型每升一代,流水线自动获益』直接写进了 repo 的接口形状。
- 行业动态2026-07-07 · 周二重要度 4/5深度报告 →
待验证|Alberta 用 Claude Code 20 小时审完 4.66 亿行政府代码,把省级安全审计从 6.5 年压到 1 天
Alberta 省政府用 Claude Agent SDK 跑约 50 个 Agent 并行扫描 4.66 亿行政府代码,20 小时完成,团队估算传统需 6.5 年。同批 Agent 在 4-5 天内重写一个 25 年前 Java 手写补贴门户,计划把单部门 185 个遗留应用整合为 16 个现代应用,定位为「政府级 AI 现代化」样板。
- Anthropic 在 Alberta 上押的是操作系统层级的对话定义权。
- 4.66 亿行扫描、Java 门户重写、1 万人 AI Academy 三件事共享同一 Agent SDK 后端
- 产品上新2026-07-06 · 周一重要度 4/5深度报告 →
T3MP3ST 拿下 GitHub Trending 1581 分,但「8-Agent 蜂群」目前仍是单 Agent 跑出来的成绩
elder-plinius 发布 T3MP3ST 自托管红队平台,GitHub Trending 当日 1581 分。 复用本地 Claude Code、Codex 与 Hermes 或 Ollama 离线模型,8-Operator 编排映射 MITRE ATT&CK。但作者自承:90.1% XBEN 这批数字是单 Agent 跑的,蜂群端到端 0 命中。
- T3MP3ST 的真正新意是 keyless 加本地 Coding Agent 这套工程抽象,把 AI 红队从企业 SaaS 降到 npm install。
- 但 8 Operator 蜂群尚未跑通端到端 benchmark,benchmark 数字与真实能力之间需要分开看。
- 产品上新2026-07-05 · 周日重要度 3/5深度报告 →
待验证|Superpowers 6.0 提速 50% 属实,但「接入 Fable 5」是误读——一篇事实核查
obra、superpowers v6.0.0 内部评测确报「约 2x 速度、近 50% 减 token」,但加速来自子代理评审流重写,与 Fable 5 无关。博客 fable5 页 DNS 不存在,主源全篇无 Fable 字样。所谓「接入 Fable 5」是把框架提速与 Claude Fable 5 回归 LMArena 两件事拼成的伪叙事。
- 产品上新2026-07-05 · 周日重要度 2/5
GitHub 218★:CSSwitch 一键切换 Claude Code 到兼容端点
SuperJJ007、CSSwitch 仓库 218★,一键把 Claude Code 切换到 DeepSeek、Qwen、GLM、Kimi、硅基流动、OpenRouter 等任意 OpenAI·Anthropic 兼容 API 端点,无需改 Claude Code 源码。
- 和 Claude Code Foundry 路由同属一波「用便宜模型加 Claude Code 工作流」的需求兑现。
- CSSwitch 把它做成可开关的一键工具,代表 Claude Code 已不只是 Anthropic 客户端,而是 Anthropic 协议客户端
- 产品上新2026-07-05 · 周日重要度 4/5深度报告 →
Claude Code 走微软 Foundry:把 5 小时墙换成 Azure 配额池
Claude Code 现支持走 Azure Microsoft Foundry 路由 Claude Sonnet 5 与 Opus 4.8,配三个环境变量即可绕开消费级 5 小时滚动上限。GitHub open issue 证实路径已成型,但仍有 endpoint 拼装、鉴权、effort 参数等工程坑;官方 docs 尚未给完整规范。
- 5 小时墙是 r/ClaudeAI 上被吐槽最多的痛点,Foundry 路由是当下最稳的官方绕过方案。
- $200 Azure 信用 30 天有效。
- 观点观察2026-07-04 · 周六重要度 5/5深度报告 →
待验证|Loop engineering 升温:Anthropic 圈把失败处理推向循环设计
过去 24 小时,Anthropic 阵营在同一方向上放出多源共振信号——「让循环自动 prompt 模型」正在取代「手动写完美 prompt」成为 Agent 工程化的新范式。三个独立节点同时出现:@trq212 长文、@mvanhorn 的 4 类 unknown 总结、Boris Cherny 的 loop engineering 方法论。
- 这场迁移的本质是提示工程从一次性艺术变成循环工程。
- trq212 把盲点分成四类:已说、未决、默认不写、尚未想到
- 产品上新2026-07-02 · 周四重要度 4/5深度报告 →
智谱把 GLM-5.2 装进 IDE:1.5x 额度 + BYOK 绑定 Anthropic/OpenAI 订阅,国产模型首次正面抢开发者桌面
智谱(Z.ai)7-1 正式发布 GLM-5.2 官方 IDE「ZCode」——HN 双帖合计 382 分(266 + 116,176 评论登首页),定位「Claude Code from the Makers of GLM」。三个真正改变桌面竞争格局的设计:(1) GLM Coding Plan 订阅者在 ZCode 内使用 GLM-5.2 时额度直接翻 1.5x,具体实现是「高峰 3x→2x / 非高峰 1x→0.67x」分时折扣系数;(2) BYOK 机制允许用户在 ZCode 中直接配置 Anthropic Claude / OpenAI Codex 等第三方订阅或 API key——ZCode 不再是「GLM 专属 IDE」而是「支持 GLM 优先 + 第三方模型 fallback」的桌面代理;(3) macOS(Apple Silicon + Intel)、Windows(x64 + ARM64)、Linux(x64/ARM64, .deb + .AppImage,Beta)全平台客户端 v3.2.2,搭配 3M GLM-5.2 tokens 初始额度(GLM 5.2 是 744B/40B-active、MIT 许可、1M 上下文、Intelligence Index 51、$1.4/$4.4 per MTok 的开源旗舰)。这是国产开源模型厂商第一次从「API 提供方」迁移到「开发者桌面 + 订阅生态」的产品尝试——同一周 SpaceX 宣布以 $60B 收购 Cursor 母公司 Anysphere,意味着 AI 编码桌面正在变成大模型厂商的必争之地。
- 行业动态2026-07-02 · 周四重要度 2/5
Kulaxyz/self-learning-skills GitHub Trending 739★:AI 编码 agent 的自学习 skill 框架
GitHub 上 Kulaxyz/self-learning-skills 项目本日达 739★(discovery 候选最高),定位『A self-improving skill for AI coding agents』,兼容 Claude Code、Cursor、AGENTS.md 等主流 agent harness。这是继 7-01 awesome-evals(606★)、theeleven(691★)之后的第三个 600+ stars 的 agent 基础设施项目,反映『agent 自学习 / 自我改进』成为社区新热点。
- self-learning-skills 739★ 真正反映的是『agent 自学习』从研究概念走向社区产品
- Claude Code / Cursor / AGENTS.md 三大主流 harness 同时兼容,意味着开发者不再需要为每个 agent 写死 skill,而是用一个自我改进的 skill 框架。
- 产品上新2026-07-02 · 周四重要度 5/5深度报告 →
Claude Code 2.1.198:Chrome 正式 GA、Background Agents 端到端开 PR,把『流行病学调试』搬进产品
Anthropic 发布 Claude Code 2.1.198,带来 32 项 CLI 变更。三大亮点:Claude in Chrome 由 beta 转 GA、Background agents 在 worktree 中完成代码后自动 commit + push + 开 draft PR、Explore 子代理从 Haiku 改继承主会话模型(opus 封顶)。这是 6-30 Anthropic 工程博客《Core dump epidemiology》强调的『流行病学 > 医生式』思路在产品端的落地——agent 不再需要开发者随时监督,可以独立在后台交付。
- Claude Code 2.1.198 真正的临界点是 background agents
- 开发者从此可以真的「下班后让 agent 干活」,agent 在 worktree 完成后自动 commit、push 并开 draft PR,这是 agent 工具从「副驾驶」(驾驶员需在线)到「独立交付」(驾驶员可离线)的范式转换。
- 行业动态2026-07-01 · 周三重要度 2/5
待验证|Claude Code 被指对中国用户做隐蔽指纹检测
BREAKING 转载:Anthropic 在 Claude Code 中嵌入了针对中国用户的隐蔽检测 / 类似间谍代码。当用户使用非官方代理时,会悄悄收集时区、代理、中国 AI 实验室域名等信息,并通过修改日期格式等隐写手法把指纹写进 prompt 发回后端。原报道(@IntCyberDigest / @oragnes 转述)给出来源待核实,目前未有 Anthropic 官方回应,事实尚未坐实。
- 这条指控若属实,意味着 Anthropic 在 Claude Code 中建立了『地域 + 行为』双重指纹机制
- 通过日期格式隐写把指纹写进 prompt,是一种相当成熟的反检测工程。
- 观点观察2026-07-01 · 周三重要度 3/5
吴恩达系统阐述『Loop Engineering』三 Loop 框架:工程师正在部分承担 PM 角色
吴恩达在 The Batch 中系统阐述『Loop Engineering』——由 Boris Cherny(Claude Code)与 Peter Steinberger(OpenClaw)推火的热词。三 Loop 框架:① Agentic Coding Loop——agent 写代码并自测,分钟级迭代(他用一个女儿练习打字的 app 验证 agent 可独立运行约 1 小时);② Developer Feedback Loop——开发者以十~小时级节奏审产品并指挥 agent,AI 已能自己测代码,开发者从 QA 转向高层产品决策,他强调这是『人类上下文优势』而非『品味』;③ External Feedback Loop——朋友/Alpha 用户/A/B 反馈,天~周级回灌开发愿景。吴恩达判断工程师正部分承担 PM 角色。
- Loop Engineering 真正的洞察不在『三 Loop』的结构,而在把『开发者 vs PM』的边界显式模糊化
- 吴恩达把过去 PM 的核心工作(定义产品愿景、把控用户反馈循环)用『Developer Feedback Loop』与『External Feedback Loop』转译到工程师的日常职责上。
- 头条2026-07-01 · 周三重要度 5/5深度报告 →
Anthropic 正式发布 Claude Sonnet 5:迄今最 agentic 的 Sonnet,促销价 $2/$10 锁定订阅档迁移
Anthropic 发布 Claude Sonnet 5,定位迄今最具智能体能力的 Sonnet,在推理、工具使用、编码、知识工作上较 Sonnet 4.6 显著提升,接近 Opus 4.8 但价格更低。促销价 $2/$10 百万 token(至 8-31,之后 $3/$15),使用新 tokenizer 实际 token 数会膨胀 1.0-1.35×,BrowseComp/OSWorld-Verified 严格优于 Sonnet 4.6、高 effort 部分场景可匹配 Opus 4.8。已全线进入 Free/Pro/Claude Code/Claude Platform,并集成到 GitHub Copilot、Notion、Cursor、Devin。Intelligence Index 53 分与 GPT-5.5 同分、落后 Opus 4.7/4.8;scaling01 测算去掉促销后比 Opus 4.8 Max 贵 1.2x、比 DeepSeek-V4-Pro 贵 57x。
- Sonnet 5 的本质不是模型变强,而是 Anthropic 用促销价强行把 Sonnet 系列推到订阅档默认模型的位置
- Free/Pro 用户一觉醒来已经在用 Sonnet 5,而企业买方则被压着在 8-31 前完成迁移决策。
- 产品上新2026-06-30 · 周二重要度 4/5深度报告 →
美团 LongCat 揭晓 Owl Alpha 真实身份:OpenRouter 全球日调用量 Top 3,Hermes/Claude Code/OpenClaw 三大 Agent 场景月调用量均登顶
美团 LongCat 团队于 2026-06-29 在官方 X 正式揭晓:此前在 OpenRouter 上以匿名身份出现的『Owl Alpha』正是美团自研模型。Owl Alpha 上线以来日调用量冲进全球 Top 3,并分别在 Hermes Agent(第 1)、Claude Code(第 2)、OpenClaw(第 3)三大 Agent 场景的月调用量排名中均登顶前三。Owl Alpha 即将退役,后续有新模型在路上。这是国产大模型在 OpenRouter 上首次以『匿名身份 + 全球 Top 3 调用量』出现并被官方确认的标志性事件,也是国产模型在 Agent 工具生态渗透的关键信号。
- 这是国产大模型在 OpenRouter 上首次以『匿名身份 + 全球 Top 3 调用量』出现并被官方确认,也是国产模型在 Agent 工具生态渗透的关键信号。
- 三大 Agent 场景月调用量均登顶(Hermes / Claude Code / OpenClaw),意味着 Owl Alpha 不是单一工具偏好,而是被多个 agent 工具生态自然选择
- 头条2026-06-30 · 周二重要度 5/5深度报告 →
Spotify 每天 4500 次生产部署 + 73% PR 涉及 AI:Claude Code 作者 Boris Cherny 与 Spotify 工程 VP Niklas Gustavsson 对谈,验证循环范式正式出圈
Claude Code 作者 Boris Cherny 与 Spotify 工程 VP Niklas Gustavsson 在 Anthropic 官方渠道公开对话,披露一组 Spotify 内部数字:每天约 4500 次生产部署、约 73% 的 PR 涉及 AI 辅助、judge 评审模型把迁移场景 PR 通过率从约 25% 拉到约 80%;Boris 进一步抛出个人判断——他本人超 40% 的代码已经由『验证循环(loops)』自动生成,并直言『90% 的合作公司最大的失误就是不引入 verification loops』。Spotify 在 2000 万行 monorepo 上并行 5-10 个 Claude 会话(每个对应一个 git worktree)。这不只是 Anthropic 的营销素材,更是『agent + 验证循环』从工程范式被工业级落地数据正面验证的标志性事件。
- 这不只是 Anthropic 的营销素材,而是『agent + 验证循环』从工程范式被工业级落地数据正面验证的标志性事件。
- 73% 这个比例已经把 Spotify 推到全球『AI 辅助代码占比』的第一梯队,高于 GitHub Copilot 公开的 30% 量级。
- 产品上新2026-06-28 · 周日重要度 4/5深度报告 →
Anthropic 推 Claude Tag:把 Agent 搬进 Slack,自家产品团队 65% 代码已由它生成
Anthropic 发布 Claude Tag,团队在 Slack 里 @Claude 即可委派任务,Claude 作为团队成员加入频道、连接工具/数据/代码库,运行于 Opus 4.8,今日起对 Enterprise/Team beta 开放,并将替换旧版『Claude in Slack』应用、给管理员 30 天迁移窗口。四大特性:multiplayer 多人接力、跨频道随时间学习、ambient 主动推送/跟进、异步自主推进数小时至数天。治理上管理员按频道配置工具与信息、为不同用途创建记忆隔离的 Claude 身份、设组织级/频道级 token 花费上限并查看全部操作日志。Anthropic 称这是『Claude Code 的演进』,其产品团队 65% 代码由内部版 Claude Tag 生成,且已扩展到追指标、处理工单、定位 bug——这一比例远超 Google(30%)与微软(20–30%)公开披露的内部数字。
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
EnterpriseClawBench:把 5291 条真实职场会话变成评测,给 Claude Code、Codex 直接打分
Frontis.AI 从真实企业 agent 会话中提炼出 852 个可复现任务(含 120 题人工审核 Lite 子集),用『硬规则 + 五维语义评判』双层打分,评测 32 个 harness-模型组合。最佳 Lite 仅 0.663(Codex+GPT-5.5);全集 DeepAgents 上 GPT-5.5=0.766、Sonnet 4.6=0.749、Haiku 4.5=0.632。因含内部内容数据不公开,公开的是构建与评测协议。
- 它补上了 agent 评测最稀缺的一环:真实办公场景而非合成任务。
- 两个判断值得划重点:其一,harness 影响巨大