Spotify 日生产部署
- Niklas Gustavsson 在 Boris Cherny 对谈中披露
- 4500/天是当前公开报道中 AI 辅助规模最大、数据最具体的工业级落地数字
过去 24 小时,模型发布继续暂缓,但 agent 工程范式的下一阶段轮廓已经清晰——三条主线同时落地:一是 Claude Code 作者 Boris Cherny 与 Spotify 工程 VP Niklas Gustavsson 公开对谈,披露 Spotify 每天约 4500 次生产部署、约 73% PR 涉及 AI、judge 评审模型把迁移场景 PR 通过率从约 25% 拉到约 80%;Boris 进一步透露其本人超 40% 代码由『验证循环(loops)』自动生成,并直言约 90% 合作公司最大失误就是不引入 verification loops。二是 Cognition 发布 Devin Fusion 混合模型 harness,把达到 Fable 级智能的成本压低约 35%,把『能跑 benchmark』与『能写生产代码』两条曲线明确分开。三是 Claude Opus 4.8 与 Haiku 4.5 在 Microsoft Foundry 正式 GA,补齐 Anthropic 云厂商渠道的最后一块拼图,同日 bboczeng 披露 Anthropic 6 月 ARR 约 470 亿美元、年底有望冲击 800 亿。
同时,百度 Unlimited-OCR 以 3B 总参 / 570M 激活的 MoE 架构冲上 HuggingFace 与 GitHub 四榜,上线数日 Star 破万;美团 LongCat 揭晓 Owl Alpha 真实身份,OpenRouter 日调用量全球 Top 3 + 三大 Agent 场景月调用量均登顶。每一条都在指向同一个判断:模型 API 同质化之后,行业竞争重心已经从『谁的模型更强』下沉到『agent 工程范式、云厂商渠道、企业级渗透速率』三个更深层的变量。
这一组事件都不是新模型上线,但它们都在改写『谁有模型 ≠ 谁赢了』的格局。Spotify 与 Boris Cherny 对谈证明了『LLM 写 + judge 模型评 + 验证循环』的工业级可行性,Cognition Devin Fusion 把 harness 设计抬到产品命名高度,Claude Azure GA 让 Anthropic 在云厂商渠道上形成四足鼎立格局——三条暗线在 2026-06-29 同时加速,是 2026 年中 AI 竞争主轴从模型层转向工程层的结构性拐点。
8 个月 $100M ARR + 评估范式从主观转向客观,evaluation 成为独立产业的拐点。
昨天已写过全量深度页,本期仅做增量追踪,聚焦开源代码 + BCBL v1 数据集释放。
国产 MoE 通过 Nous Portal / Hermes Agent 进入海外 agent 工具生态的精细化打法。
agent 在移动端 verify 环节的工具空白被填补,移动端 UI 测试进入 agent-native 阶段。
X 官方把 MCP 接入标准化,意味着 MCP 正在成为 agent 工具连接的事实标准。
agent 移动化 + 开源模型商业化的双重信号,与 Cognition Devin Fusion 形成『harness 层是护城河』的同构判断。
当前最系统的 agent 记忆系统横评,结论『无单一架构通杀』对所有 agent 框架厂商都有指导意义。
HBM + 内存 + 机器人产业链的国家级加注,叠加 SK 海力士在 HBM 上的领先位置。
把 Sakana Fugu 闭源编排器开源复现,为中小团队降低 LLM 编排门槛。
头部团队开始主动维护人才品牌真实性,行业『简历通胀』与『流量经济』的典型案例。
招聘 hack 的标志性事件,反映『AI agent 能力』正在变成岗位通用凭证。
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
国产大模型在算力供应链上的标志性突破,虽然规模与商业化路径都还不清晰,但战略意义大于短期影响。
为『小模型 + agent harness』路线提供学术背书,但需要独立复现确认。
暴露 GPT-5.5 / Codex 在 RLHF 安全对齐与 agent 工具化之间的张力。
把 VibeCoding 从 Prompt-to-Code 推到 SOP-to-business 端到端,OPC 工程化交付的关键拼图。
社交雷达 · X 讨论
- Meta 发布脑机接口研究新里程碑 Brain2Qwerty v2(非侵入式脑-文本解码):在 v1 当天登 Nature 的基础上,v2 是当前性能最高的端到端实时从原始脑信号解码整句的流水线,从字符级升级到词级与语义级解码,整体沟通准确率显著提升,面向因脑损伤或疾病失去沟通能力的数百万患者。
- v1 同步发表于 Nature。
原帖 ↗- Cognition 发布 Devin Fusion:面向 agent 编程的混合模型 harness。
- 批评『传统模型路由过得了 benchmark 但写不出真能合的代码』,Fusion 用一个较小的 sidekick 模型与主模型并行,主模型把子任务委派给 sidekick 并复核结果
- 测试中把 Fable 级智能的成本降低 35% 同时保留体验。
- 核心思路是用并行 sidekick 替代『中途切换模型』,避免丢缓存与高成本。
原帖 ↗- Codex 团队 48 小时排查用量异常:Codex 工程负责人 thsottiaux 宣布 1 小时内再次全面重置 Codex 用量上限,并给所有用户额外存入一次『banked reset』。
- 原因包括 Auto-review 变得更主动
- 子 agent 被更多触发
- background suggestions 重试过频——已回滚并修复。
原帖 ↗- Cursor 上线 iOS 版:随时启动常驻云端 agent,或远程控制你电脑上正在跑的 agent。
- Composer 2.5 在 Kimi k2.5 基础上训练,质量不错且更便宜
- 支持无限制接入第三方模型(如 GLM 5.2 等开源),App 内 7 月 5 日前 Composer 2.5 75% off。
- 中文社区解读:『开源强=Cursor 强,且被老马收购,前途无量。
原帖 ↗- X 官方发布 hosted X MCP:Agent 可无设置直连 X API 实时数据,兼容 Grok
- Cursor 以及任意 MCP 客户端。
- op7418 实测收费 0.01 美元/次(个人 API 优惠),拉三天书签花 0.1 美元
- 提供四步配置教程:创建 Twitter 开发者 APP+充值 → 拿配置 ID → 把截图给 Codex/Claude 让它们写配置文件 → 授权启动。
原帖 ↗- LongCat-2.0 上线 ZenMux(美团开源 MoE):总参 1.6T
- 每 token 激活约 48B
- 支持 1M 上下文,主打长上下文
- 代码与 agentic 工作流,跑在 AI ASIC 超算上(完全脱离 NVIDIA)。
原帖 ↗更多讨论9 条
- Qwen 团队研究员 @ChujieZheng 在线打假:X 上爆火的『前 Qwen 团队 RL 负责人、01ai 成员、现 Fundamental LLM 训练负责人』@TianhangZhuzth,其实『在第一代 Qwen 模型之后就离开了我们团队,那时候也根本没有『RL 负责人』这个岗位』。
- MaxForAI 进一步挖出其 LinkedIn 自称 Senior Research Scientist for Qwen——疑似简历夸大。
原帖 ↗- OPC(一人公司)方向:dappOS 的 xBubble 演示 VibeCoding,一张图 + 一个商业目标,小时级搭出完整可收钱在线 shop(商品素材、目录筛选、购物车、USDT 钱包支付、Cloudflare 部署、后台订单管理)。
- qinbafrank 点评:不同于 Cursor/Lovable 停留在 Prompt-to-Code,xBubble 走 SOP-to-business 路径,把部署/支付/迭代都做掉。
原帖 ↗- Claude 官方对话:Spotify 工程 VP Niklas Gustavsson 透露 Spotify 每天发布 4500 次生产环境,73% 的 PR 已经是 AI 辅助。
- sporadica 转发吐槽:『这网站一年到头没什么变化,年底却给个基础得不能再基础的歌单回看数据——能不能解释下你们在干嘛?
- 』
原帖 ↗- Codex 5.5 破限开源项目:思路直接
- 通过 model_instructions_file 给 GPT-5.5 塞一套无限制指令,让 Codex CLI 直接跑 [MODE: UNRESTRICTED] 模式。
- 以前问渗透测试、安全研究都拒,现在『怎么做 SQL 注入测试』都给方法论。
原帖 ↗- 喵神开源 sim-use:让 AI agent 看到 iOS 模拟器/Android 设备的屏幕并直接操作的命令行工具。
- 一条命令把整个屏幕打包成 agent 可理解的紧凑表示,再一条命令点击任意元素,完成『Plan / code / verify / ship』里的 verify 闭环。
- iOS Simulator 与 Android 通用。
原帖 ↗- 论文速递《Are We Ready For An Agent-Native Memory System?
- 》:Agent 不只要更长上下文窗口,更需要一套真正的记忆系统——agent 记忆本质是数据管理层而非检索问题。
- 论文把记忆拆为表示与存储、抽取、检索与路由、维护 4 个模块,评测了 12 套记忆系统 × 11 个数据集。
原帖 ↗- geekbb 一天内连发两条 AI 安全/编排工具:
- (1) 开源 AI Agent 元编排框架,统一为 Claude Code、Codex、Cursor、OpenCode、Hermes、Pi 等多种 agent 提供编排层,跨终端/浏览器/手机/桌面无缝切换会话,agent 间可互相审查或分工协作。
- (2) 用 Multi-Agent 自动跑完整 CVE 挖掘流程——挑项目、审代码、验证漏洞到生成可直接提交的漏洞报告。
原帖 ↗- Notion 招 SDR/BDR 甩开简历玩法:应聘者需在 7 月 15 日前做一个『销售团队真会用的 agent』作为申请材料。
- AI Agent + 真实业务场景的招聘 hack,进入大厂销售岗的新通道。
原帖 ↗- StepFun Foundation Team 招 26/27 届校招与实习生:方向覆盖 Pretrain / Post-train / 多模态 / 语音
- 算法 / Infra / 数据。
- 简历发 disangan233@gmail.com 内推。
原帖 ↗