2026年8月13日 · 周四
模型密集更新,企业使用与可靠性进入实证期
- 过去24小时,xAI发布Grok 4.6,Qwen首次开放Max级权重,DeepSeek的V4 Pro 0813也进入API。
- OpenAI作者团队首次用企业账户记录描画组织采用,Google与Meta相关动态则把可靠性和治理问题推到台前。
本期判断
模型竞争仍在推高能力与压低成本,但今天更值得记住的是证据形态在变化:组织采用开始有行为数据,可穿戴AI的风险也进入可追责阶段。
本期速览
3 条01模型供给密集更新
- Grok 4.6主攻长时智能体与视觉交付。
02企业采用有了行为证据
- 研究覆盖1500多家组织与1700万条消息。
03可靠性转向召回与治理
- Google称前沿模型事实编码接近饱和。
编辑总结
模型供给继续密集更新,但今天的核心不只是参数和价格。企业AI使用、事实召回与可穿戴设备治理开始提供更具体的行为证据、评估框架和责任边界。
On this page
本期导航
Deep Dives
本期重点 · 深度报告
Key Numbers
61
2.4T
95B
$0.87
企业研究样本
采用满六个月时点的员工级样本;同时覆盖1700万余条消息
来源:arXiv 2608.122361500+家组织
约7倍
Briefs
快讯 · 已核验与追踪
行业动态重要度 4/5中置信已核验
德国组织投诉Meta AI眼镜涉嫌违法录制
- 德国人权组织HateAid于8月12日宣布,已向法兰克福总检察院提交针对Meta及相关AI眼镜销售方的刑事投诉,主张设备可能违反隐私和录音相关法律。
- 投诉不等于检方已立案或违法事实成立。
要点拆解展开
Why
刑事投诉把AI眼镜的旁观者隐私争议从舆论与民事诉讼推进到德国执法程序入口。
Impact
硬件厂商需要证明清晰告知、合法录音与最小化处理。开发者和企业部署者也要审查视频上传、人工标注和跨境处理链路。
Numbers
- 投诉日期
- 2026-08-12HateAid官方公告日期;是否正式立案仍待德国检方决定HateAid
早报判断
- 可穿戴AI的合规对象不只包括用户数据,也包括镜头前不知情的第三人。
- 若执法推进,默认录制、指示灯和人工审核链路都可能成为产品设计约束。
接下来看
- 德国检方是否受理并启动正式调查?
- 投诉针对哪些产品版本与录制模式?
产品上新重要度 3/5高置信官方源
Claude浏览器侧栏并入Cowork会话
- Anthropic于8月12日将Claude in Chrome侧栏改为Cowork会话,浏览器中的对话
- 技能和连接器可随账户在桌面
- 网页与移动端续接。
- 新侧栏当天面向Max与Team开放,Pro将在未来数周推出。
要点拆解展开
Why
统一会话把浏览器操作、技能与连接器接到同一任务线程,是知识工作智能体交付形态的实质变化。
Impact
Max和Team用户可立即跨端续接浏览器任务。企业管理员仍需显式启用并配置允许域名,敏感站点应保持最小权限。
Numbers
- 首发计划
- Max与Team8月12日可用;Pro未来数周逐步推出Anthropic
早报判断
- 浏览器扩展从独立入口变成跨设备智能体会话,减少任务切换时的上下文断裂。
- 它同时扩大了已登录网页与连接器的权限面,企业默认关闭策略仍然重要。
接下来看
- Pro用户的具体推出节奏如何?
- 跨设备会话的审计日志是否完善?
社交雷达 · X 讨论
- 一名重度用户实测早期测试版 Grok Bot
- 认可多 Agent 不同 Screen 的隔离和状态同步速度
- 但指出用量消耗快、Agent/Skill 管理隐蔽、定制空间小、交付物只能导出 Markdown、执行状态不透明等问题
- 属于个人体验。
原帖 ↗- OpenCode 开发者把 GPU 基础设施热潮类比铁路和光纤投资周期:集体过度建设可能让早期基础设施投资者受损,却为后续应用公司留下廉价产能
- 这是历史类比和个人观点,不是市场预测。
原帖 ↗- 作者提醒模型提示缓存通常有服务端时限、常见最长仅数小时,隔天继续巨大 session 可能出现零缓存命中并推高费用
- 具体缓存期限依服务商而异,应以对应 API 文档为准。
原帖 ↗- 作者在给已用 Rust 搭过系统的团队培训后观察到,AI 让开发者能够在尚未系统掌握语言时交付代码,却可能削弱语言心智模型
- 技术交流和社区认同
- 这是培训者的经验判断。
原帖 ↗- 作者认为 Gemini 的优势被编码用户低估,尤其适合原生音频理解、文学创作和多模态任务
- 帖子给出的是个人使用判断,并未提供可复现实验来支持“唯一”“断档第一”等强结论。
原帖 ↗- Artificial Analysis称Grok 4.6智能指数61,与GPT-5.6 Sol持平,低于Claude Opus 5的63。
- 标价为每百万输入token 2美元、输出token 6美元,上下文500k
- 结果仍需结合任务与置信区间阅读。
原帖 ↗更多讨论4 条
- OpenCode 官方宣布 Grok 4.6 已接入 OpenCode Zen,SuperGrok 订阅用户也可在 OpenCode 中使用。
- 帖子没有披露限额、区域范围或具体版本参数。
原帖 ↗- Dragonfly 管理合伙人称 DeepSeek V4 Pro 已通过 API 上线,并按每百万输出 token 0.87 美元与 Opus 的 25 美元比较,得出近 30 倍价差
- 质量区间与其他价格对比是作者解读,需回看官方定价和独立评测。
原帖 ↗- Command Code用同一项design提示在FlappyBench比较三款模型:10分制下,DeepSeek得8分、Kimi得9.5分、GLM得9分
- 单次成本分别为0.0005、0.0740、0.0480美元。
- 属于厂商自建小样本测试。
原帖 ↗- 一名红队工具作者称其自动越狱测试中,DeepSeek V4 Pro 0813的9类请求有8类可被突破
- 化学与生物生产请求5次重试均未通过。
- 这是一方自建且未公开完整方法的安全测试,不能视为通用安全结论。
原帖 ↗