2026年8月13日 · 周四

模型密集更新,企业使用与可靠性进入实证期

  • 过去24小时,xAI发布Grok 4.6,Qwen首次开放Max级权重,DeepSeek的V4 Pro 0813也进入API。
  • OpenAI作者团队首次用企业账户记录描画组织采用,Google与Meta相关动态则把可靠性和治理问题推到台前。
本期判断

模型竞争仍在推高能力与压低成本,但今天更值得记住的是证据形态在变化:组织采用开始有行为数据,可穿戴AI的风险也进入可追责阶段。

本期速览

3 条
  1. 01模型供给密集更新
    • Grok 4.6主攻长时智能体与视觉交付。
  2. 02企业采用有了行为证据
    • 研究覆盖1500多家组织与1700万条消息。
  3. 03可靠性转向召回与治理
    • Google称前沿模型事实编码接近饱和。

编辑总结

模型供给继续密集更新,但今天的核心不只是参数和价格。企业AI使用、事实召回与可穿戴设备治理开始提供更具体的行为证据、评估框架和责任边界。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

5 篇

Key Numbers

企业研究样本

采用满六个月时点的员工级样本;同时覆盖1700万余条消息

来源:arXiv 2608.12236
1500+家组织
Briefs

快讯 · 已核验与追踪

2 条
行业动态重要度 4/5中置信已核验

德国组织投诉Meta AI眼镜涉嫌违法录制

  • 德国人权组织HateAid于8月12日宣布,已向法兰克福总检察院提交针对Meta及相关AI眼镜销售方的刑事投诉,主张设备可能违反隐私和录音相关法律。
  • 投诉不等于检方已立案或违法事实成立。
要点拆解展开
Why

刑事投诉把AI眼镜的旁观者隐私争议从舆论与民事诉讼推进到德国执法程序入口。

Impact

硬件厂商需要证明清晰告知、合法录音与最小化处理。开发者和企业部署者也要审查视频上传、人工标注和跨境处理链路。

Numbers
投诉日期
2026-08-12HateAid官方公告日期;是否正式立案仍待德国检方决定HateAid
早报判断
  • 可穿戴AI的合规对象不只包括用户数据,也包括镜头前不知情的第三人。
  • 若执法推进,默认录制、指示灯和人工审核链路都可能成为产品设计约束。
接下来看
  • 德国检方是否受理并启动正式调查?
  • 投诉针对哪些产品版本与录制模式?
产品上新重要度 3/5高置信官方源

Claude浏览器侧栏并入Cowork会话

  • Anthropic于8月12日将Claude in Chrome侧栏改为Cowork会话,浏览器中的对话
  • 技能和连接器可随账户在桌面
  • 网页与移动端续接。
  • 新侧栏当天面向Max与Team开放,Pro将在未来数周推出。
要点拆解展开
Why

统一会话把浏览器操作、技能与连接器接到同一任务线程,是知识工作智能体交付形态的实质变化。

Impact

Max和Team用户可立即跨端续接浏览器任务。企业管理员仍需显式启用并配置允许域名,敏感站点应保持最小权限。

Numbers
首发计划
Max与Team8月12日可用;Pro未来数周逐步推出Anthropic
早报判断
  • 浏览器扩展从独立入口变成跨设备智能体会话,减少任务切换时的上下文断裂。
  • 它同时扩大了已登录网页与连接器的权限面,企业默认关闭策略仍然重要。
接下来看
  • Pro用户的具体推出节奏如何?
  • 跨设备会话的审计日志是否完善?
Social Radar

社交雷达 · X 讨论

6 条
0xcherry@0xcherry77 likes
  • 一名重度用户实测早期测试版 Grok Bot
  • 认可多 Agent 不同 Screen 的隔离和状态同步速度
  • 但指出用量消耗快、Agent/Skill 管理隐蔽、定制空间小、交付物只能导出 Markdown、执行状态不透明等问题
  • 属于个人体验。
Grok Bot

Grok Bot宣布进入早期测试,定位为可登录用户工具并完成实际工作的AI队友。

原帖 ↗
thdxr@thdxr1729 likes
  • OpenCode 开发者把 GPU 基础设施热潮类比铁路和光纤投资周期:集体过度建设可能让早期基础设施投资者受损,却为后续应用公司留下廉价产能
  • 这是历史类比和个人观点,不是市场预测。
原帖 ↗
zkyo@zkyo45 likes
  • 作者提醒模型提示缓存通常有服务端时限、常见最长仅数小时,隔天继续巨大 session 可能出现零缓存命中并推高费用
  • 具体缓存期限依服务商而异,应以对应 API 文档为准。
原帖 ↗
blackanger@blackanger40 likes
  • 作者在给已用 Rust 搭过系统的团队培训后观察到,AI 让开发者能够在尚未系统掌握语言时交付代码,却可能削弱语言心智模型
  • 技术交流和社区认同
  • 这是培训者的经验判断。
原帖 ↗
woaitaoershi@woaitaoershi841 likes
  • 作者认为 Gemini 的优势被编码用户低估,尤其适合原生音频理解、文学创作和多模态任务
  • 帖子给出的是个人使用判断,并未提供可复现实验来支持“唯一”“断档第一”等强结论。
大宇

原帖以未经本帖核验的月活数字比较豆包、千问、DeepSeek、Gemini与GPT,并据此表达对字节和Google的个人判断。

原帖 ↗
ArtificialAnlys@ArtificialAnlys2975 likes
  • Artificial Analysis称Grok 4.6智能指数61,与GPT-5.6 Sol持平,低于Claude Opus 5的63。
  • 标价为每百万输入token 2美元、输出token 6美元,上下文500k
  • 结果仍需结合任务与置信区间阅读。
原帖 ↗
更多讨论4 条
opencode@opencode1990 likes
  • OpenCode 官方宣布 Grok 4.6 已接入 OpenCode Zen,SuperGrok 订阅用户也可在 OpenCode 中使用。
  • 帖子没有披露限额、区域范围或具体版本参数。
原帖 ↗
hosseeb@hosseeb157 likes
  • Dragonfly 管理合伙人称 DeepSeek V4 Pro 已通过 API 上线,并按每百万输出 token 0.87 美元与 Opus 的 25 美元比较,得出近 30 倍价差
  • 质量区间与其他价格对比是作者解读,需回看官方定价和独立评测。
原帖 ↗
CommandCodeAI@CommandCodeAI451 likes
  • Command Code用同一项design提示在FlappyBench比较三款模型:10分制下,DeepSeek得8分、Kimi得9.5分、GLM得9分
  • 单次成本分别为0.0005、0.0740、0.0480美元。
  • 属于厂商自建小样本测试。
原帖 ↗
SingulCore@SingulCore286 likes
  • 一名红队工具作者称其自动越狱测试中,DeepSeek V4 Pro 0813的9类请求有8类可被突破
  • 化学与生物生产请求5次重试均未通过。
  • 这是一方自建且未公开完整方法的安全测试,不能视为通用安全结论。
原帖 ↗