CJS 评分总分
四轴合成风险分,用于把网络滥用能力从口号变成可复测等级。
来源:Anthropic 官方博客今天的主线不是模型能力军备,而是工程化与治理军备同步进入下半场。
一是 Anthropic 把 Fable 5 安全治理做成 CJS 四轴评分和 HackerOne 漏洞征集,跨厂治理博弈正式入场。
二是 Agent 工业化的文档、记忆、评测三件套开始成型。LangChain OpenWiki、Anthropic Obsidian 知识图谱和 skill eval 讨论,说明流程资产正在从概念变成工具与企业实践。
三是 HN 三连从表达、生产力、环境成本三个方向剥离 AI 叙事溢价。本期判断是:中型公司会被工程化与治理门槛结构性挤压。
四轴合成风险分,用于把网络滥用能力从口号变成可复测等级。
来源:Anthropic 官方博客Mercor 报告的 Pass@1;6 月原版为 65.5%,Opus 4.8 为 45.3%。
来源:@mercor_ai X单源披露称另有 4729 条链接和 9000+ 文档,仍需后续验证。
来源:@CryptoTied XGitHub 项目以 MIT 协议开源,定位为面向 Agent 的文档生成和维护工具。
来源:GitHub OpenWikiconfidence theater 讨论获得 232 评论,同日还有 3% ROI 与水耗话题。
来源:Hacker NewsAnthropic 自报并称 CAISI 测试认可,但误报率和开发影响仍需观察。
来源:Anthropic 官方博客继 7-3 早报深挖 Fable 5 重启后,过去 24 小时新增 APEX-SWE 数据:Fable 5 从 6 月原版 65.5% Pass@1 降到 7 月重发布版 54.8%,仍高于 Opus 4.8 的 45.3%。
GitHub 今日出现五个高 star AI Agent 工具:self-learning-skills 沉淀编程经验,sim-use 接入 iOS/Android 设备,Fundamental-Ava 做数字人,claude-real-video 处理视频理解,video-production-skills 提供视频制作技能库。
GitHub 当日五个 AI Agent 工具项目同时突破 500★,分布在自我学习、多模态感知、数字人、视频生产四个维度,Agent 工业化在工具层进入爆发期。
arXiv 与 Hugging Face papers 今日出现多篇高价值研究:Program-as-Weights 探索程序即权重,Distributed Attacks 聚焦持续态 AI 控制攻击,SkillCoach 研究技能自演化评分,WorldDirector 与 EvoPolicyGym 补上世界模型和策略评测。
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
社交雷达 · X 讨论
- ELI5 总结 trq212 新文章:"Claude 已不再是瓶颈,你没告诉它的事才是"。
- 核心是缩小提示词与代码实情的差距。
- 4 种 unknown 包括你没说、你没定、你懒得写、你没想到
- 8 条方法围绕盲点扫描和上下文校准。
原帖 ↗- Anthropic 员工(bio: claude code + cowork @anthropicai,前 Dagster
- Scale)发起 Fable 5 demo 征集,引发 101 条高密度回复。
- 配合官方账号同周 re-launch Fable 5,Anthropic 正在推动 cowork 形态试用。
原帖 ↗- 解读疑似 Anthropic 内部 Fable 5 Prompt 结构,核心观点:好 Prompt 不是更长更复杂,而是把任务边界讲清楚。
- 结构 5 部分 — Context(背景)
- Request(要做什么)
- Output Format(怎么交付)
原帖 ↗- "我不再手动 prompt Claude Code 了。
- 我让循环自动 prompt Fable,我的工作就是写循环。
- " 配图为 AI Edge 的 loop engineering 入门指南。
- 核心范式是从一次性 prompt engineering 转向持续循环设计。
原帖 ↗- 发现:Anthropic 内部使用超大规模 Obsidian 知识图谱管理公司知识。
- 规模数据:8893 个节点、4729 条链接。
- 结构化模块包括 Marginalia
- Glossary
原帖 ↗- 在 SWE 评测基准 APEX-SWE 上放出 Fable 5 重发布版成绩:Fable 5 6 月原版 65.5% Pass@1,7 月重发布版 54.8%,Claude Opus 4.8 为 45.3%。
- 结论:re-release 比原版低约 10 个点,但仍超 Opus 4.8 超过 9 个点。
原帖 ↗更多讨论4 条
- PM 视角观察:现在很多网页布局是"右侧 AI Agent,中间内容,左侧菜单",分栏需要支持拖拽和隐藏、合理利用空间。
- 难点:用自然语言很难描述清楚这些交互细节。
- 可行解法:沉淀一些交互规范、标准文档,供 AI 学习参考——把设计规范变成模型可读的参考材料,而不是依赖一次性 prompt。
原帖 ↗- 发布并开源升级版豆包 AI GEO 采集、清洗、分析 skill。
- 三大能力:
- ①网页端(OpenCLI)+ 手机 App(Android Studio AVD + Appium UiAutomator2)双端采集,同一批关键词可并行取两端结果
原帖 ↗- 解读 LangChain 新开源项目 OpenWiki(477 star、MIT 协议):一个 CLI,自动为代码库生成文档并持续维护
- 设计目标"not for humans,for agents"——让 agent 写、agent 维护、agent 参考。
- 安装 npm install -g openwiki
原帖 ↗- Total TypeScript
- AI Hero 作者 mattpocock 说:"Evals on skills are hard" 是今年最被低估的判断。
- steipete 的上下文是 EffectTS skill 需要先蒸馏 agent 常犯错点,但 skills 的 eval 仍然很难做。
原帖 ↗