模型发布

xAI发布Grok 4.6,主攻长时智能体任务

价格与500k上下文基本不变,增量集中在长时执行、代码与交互视觉交付。

2026年8月13日 · 周四深度报告高置信重要度 5/5

本文要点

  • 训练从4.5的代码与智能体基础,扩展到更长补充训练、重做SFT轨迹和多环境智能体RL。
  • 产品目标从完成代码题,迁移到跨多步骤研究、代码库操作和可交付视觉制品。
  • 综合指数从4.5的56分升至61分,而基础价格与500k上下文保持不变。

阅读辅助

先看数字、证据和来源,再读正文。

61分AA智能指数
1753 EloGDPVal-AA v2智能体评测
6 条 Claim Audit

Grok 4.6已经上线API、Cursor和Grok Build,且基础API单价与Grok 4.5持平。

5 个时间点

2026-07-16 · xAI发布Grok 4.5,定位已覆盖代码、智能体和知识工作,基础API价为每百万token输入2美元、输出6美元。

7 个来源5 个非 X 来源

xAI在2026年8月12日发布Grok 4.6,并把升级重点放在长步骤链的任务完成度。官方将研究陌生主题、分析信息、跨代码库修改、搭建交互应用和交付工作制品纳入同一条产品叙事。模型已经进入xAI API、Cursor和Grok Build,OpenRouter也在同日列出可调用页面。

发布成立与能力领先需要分开判断。上线、模型名、渠道和基础价格都有官方页面或第三方平台交叉确认;长时坚持、更多自检、视觉首稿更强,则仍主要来自xAI内部观察。Artificial Analysis给出的61分提供了第三方坐标,但它是九项评测组成的综合指数,只能说明Grok 4.6在该机构当前口径下与GPT-5.6 Sol同分,不能扩大成“所有任务全面同级”。

最值得开发者注意的约束没有一起变大:标准上下文仍是500k tokens,基础价格仍是每百万输入2美元、输出6美元。升级由训练配方、轨迹质量和智能体强化学习来承担,而不是用更长上下文或更高单价换分。低价保持本身很有竞争力,不过智能体的真实账单还取决于循环次数、工具调用、失败重试和输出长度。

对代码智能体、企业知识工作和应用原型团队,4.6已经是可以进入候选池的新模型;对采购和平台治理团队,现阶段还不适合只凭一张综合榜单替换主力。需要补齐的是数小时连续运行的成功率、失败恢复、权限边界、长上下文有效利用,以及交互视觉产物的盲测质量。

版本号背后的训练迁移

xAI发布页给出的训练变化比“更多数据”具体。Grok 4.6经历了比4.5更长的补充训练,数据包括为推理和高级技术概念筛选的模型生成材料、高质量工程数据,以及改进后的优化器和训练配方。此后,xAI又让Grok 4.5重新生成覆盖不同推理强度、智能体脚手架和领域的SFT轨迹,再用模型检查过滤问题轨迹。

这条路线表明,4.6的增量至少有三层。第一层是基础训练继续补强推理和工程知识;第二层是把SFT示范从静态问答改造成跨脚手架、跨领域的执行轨迹;第三层是把RL环境扩展到知识工作、通用编程、内核优化、Web开发和CAD等智能体任务。官方没有披露参数量、训练token、RL任务数、训练算力或各阶段消融,因此无法判断哪一层贡献最大。

相较之下,Grok 4.5的7月16日发布页已经把代码、智能体和知识工作列为定位,并称其RL覆盖数十万项多步骤软件工程及技术任务。4.6并非从“普通聊天模型”突然转型为智能体模型;准确说法是,它沿着4.5已有方向,把训练轨迹、运行跨度和制品类型继续向前推。旧发布页只能作为背景,不能充当8月12日的新鲜证据。

官方还称,4.6在较长项目里会进行更多自测和验证,例如研究陌生领域、搭建应用结构、实现核心交互,再根据反馈继续修改。这里的动词是“we started to see”和“we found”,属于内部观察,不是带样本量、置信区间和失败分类的正式实验。报道可以把它写成产品方向,不能写成“已经证明长任务不再偏航”。

两张成绩单必须分栏阅读

xAI在发布页给了一张覆盖代码、知识工作和智能体任务的比较表。下表保留原始版本号与推理档位:Grok 4.6和4.5均为High,GPT-5.6 Sol与Fable 5均为Max。它能显示4.6相对同门4.5的方向性增益,但仍是厂商发布的表;页面脚注还说明,竞品数据取各开发者系统卡或公开榜单中的最佳成绩,脚手架、推理预算与运行环境未必统一。

评测Grok 4.6 HighGrok 4.5 High基线GPT-5.6 Sol MaxFable 5 Max证据性质与边界
AA Intelligence Index61566162xAI复述第三方综合指数;不是单项能力分
GDPVal-AA v21753152617281741Elo口径;需要结合置信区间,不能只按点估计排序
CursorBench v3.269.9%66.7%67.2%70.5%xAI发布表;未提供本页级别的完整运行日志
DeepSWE v1.165.9%54.0%73.0%70.0%4.6高于4.5,但低于两组Max竞品
FrontierCode v1.1 Extended61.3%56.6%60.6%63.6%领先Sol的点估计,不等于统计显著领先
APEX-Agents57.5%47.1%56.7%59.2%4.6较4.5提高10.4个百分点
Terminal-Bench v3.026.0%15.7%34.6%34.1%4.6提升明显,但仍落后两组对照
AA-Briefcase1577131315021574私有长程评测;点估计接近不代表可复现等价

这张表有一个比“赢了几项”更稳定的结论:4.6在列出的每一项上都高于4.5同档位,说明升级至少没有只押单一代码榜单;但对外部竞品,它既有领先项,也有明显落后项。特别是DeepSWE v1.1和Terminal-Bench v3.0,Grok 4.6仍低于GPT-5.6 Sol Max与Fable 5 Max。因而“回到前沿组”比“成为第一”更符合数据。

Artificial Analysis同日文章是另一张成绩单。该机构给Grok 4.6的Intelligence Index打出61分,比Grok 4.5的56分5分;GPT-5.6 Sol同为61分,Claude Opus 5为63分,Claude Fable 5为62分。这是一家第三方评测机构的公开结果,不是xAI自评,但评测方法、任务组合和聚合权重仍属于该机构自己的选择。

Artificial Analysis指标Grok 4.6结果对照基线能支持的结论不能外推的结论
Intelligence Index61分4.5为56分;Sol为61分九项综合指数较4.5上升并进入前沿组不能证明所有任务与Sol等价
GDPVal-AA v21753 Elo4.5为1526知识工作智能体点估计显著上移与Fable 5、Qwen3.8 Max区间重叠,不能硬排胜负
τ³-Banking50.7%Qwen3.8 Max为51.3%多轮客服加工具任务处于高位不代表全部企业流程成功率
Terminal-Bench v2.188.4%AA称与领先模型接近终端任务在该旧版本口径表现强不能与xAI表中的v3.0 26.0%直接比较
AA-Briefcase1577 Elo4.5为1313私有长程知识工作进入Fable 5层级题目未公开,无法独立复现完整结果
AA实测任务成本0.84美元/任务与Kimi K3相同在AA当前运行设置下位于成本前沿不是每个生产任务的固定报价

两个Terminal-Bench数字看似冲突,实为版本与运行口径不同:Artificial Analysis文章引用的是v2.1的88.4%,xAI官方对比表列的是v3.0的26.0%。评测升级往往伴随任务、难度、脚手架和评分规则变化,不能把两个百分比相减,也不能用旧版高分覆盖新版结果。

长时智能体:分数之外要看失败链

长程知识工作是这次发布最重要、也最容易被宣传语言放大的部分。Artificial Analysis称,Grok 4.6在其私有AA-Briefcase上得到1577 Elo,处于Fable 5层级,落后Claude Opus 5家族。该机构还报告,Grok 4.6平均约用53轮和约0.5B输入token完成任务,而Claude Opus 5 Max约为103轮2.0B输入token

这些数字提供了“少走几轮”的积极线索,却不能直接翻译成普通API单次请求会吞掉五亿token。公开文章没有充分展开0.5B的统计单位、重复采样、并行运行和聚合方式;AA-Briefcase又是私有任务,外部团队无法用同一题集验算。最稳妥的表述是:在Artificial Analysis自己的长程评测运行口径下,4.6比Opus 5 Max使用更少轮次与输入token,而不是“4.6在所有长任务上节省一半步骤和四分之三token”。

生产智能体还会遇到榜单难以压缩的失败链。模型可能早期误解目标,随后在错误方向上高效执行;可能正确修改代码,却遗漏测试、权限或部署配置;也可能在上下文压缩后忘记约束。长时智能体的验收指标因此至少要包括端到端成功率、中途人工接管率、失败后恢复率、重复调用成本、工具权限越界和产物可审计性。轮数少只有在任务完成质量相当时才是优势。

Grok 4.6的500k tokens上下文也应放在这一框架里。xAI开发文档与OpenRouter均确认这一上限,Artificial Analysis则明确称它相较4.5未变化。上下文上限解决的是“最多能放多少”,不自动解决“能否在第40轮准确找回第2轮约束”。长代码库和长报告场景更应测有效召回、状态持久化、工具结果压缩和跨文件一致性。

交互视觉是产品增量,不是已有榜单结论

xAI把“more ambitious interactive and visual work”写进发布页摘要,并称4.6比其通常在4.5上看到的结果,能给出更强的视觉与交互项目首稿。官方描述的理想路径是:用户给一个具体产品想法,模型一次建立应用结构与视觉语言,再在循环中继续迭代。这里强调的是制品完成度,而非单纯生成一段能运行的代码。

这项增量值得重视,因为代码智能体的竞争正在从“解题”走向“交付”。一个模型即使通过仓库级评测,如果做出的界面缺乏信息层级、交互状态、错误处理和响应式布局,仍需要大量人工返工。相反,能把研究、结构、视觉和核心交互串起来的首稿,会缩短产品团队从想法到可评审原型的时间。

但发布页没有给视觉盲测、用户偏好分、可访问性检查、跨屏一致性、任务成功率或与4.5的样本对照。演示项目也天然存在选择偏差:成功案例更容易被展示,失败轨迹不会出现在发布视频里。现阶段应把“视觉与交互首稿更强”列为厂商待验证主张,不能拿代码benchmark替它背书。

一套更贴近购买决策的测试应同时固定提示、工具、运行时长和token预算,再比较4.5与4.6的可运行率、需求覆盖、视觉一致性、无障碍问题、返工轮次和最终人工编辑时间。若只让两个模型各生成一张漂亮页面,再由评审者挑喜欢的一张,仍不足以证明长程交付能力。

价格不变,账单口径更复杂

xAI开发文档OpenRouter模型页都列出标准价格:每百万输入token 2美元、输出token 6美元,上下文500k。OpenRouter还把发布日期标为2026年8月12日。xAI另设fast变体,价格为标准版的2倍;发布页没有在同一位置给出fast的速度、质量变化或服务等级。

标准价格与Grok 4.5相同,这是明确的代际比较基线。Artificial Analysis进一步估算Grok 4.6在其评测中的平均成本为0.84美元/任务,并称其相较Claude Opus 5的每百万输入5美元、输出25美元,以及GPT-5.6 Sol的输入5美元、输出30美元,基础单价低出60%以上。这些竞品价与成本比较来自Artificial Analysis当前文章,不是xAI独立测得,也不保证采购折扣、缓存和批处理后的实际账单保持同样比例。

还要注意缓存价的逆向变化。Artificial Analysis称4.6缓存命中输入价为每百万token 0.5美元,高于4.5的0.3美元。所以“标准价没涨”不等于每一种访问路径都持平。对大量复用长前缀的智能体,缓存价、命中率和上下文压缩策略可能显著改变总成本。

官方首周在Grok Build和Cursor提供2倍包含用量。这是一项指定入口、指定时间的促销,不是API永久降价,也不能写成fast变体半价。OpenCode公告只确认Grok 4.6进入OpenCode Zen以及SuperGrok订阅入口,没有披露调用上限、区域或服务保障,不能用来补齐xAI未公布的细则。

分发已经铺开,安全材料仍需追踪

xAI列出的首发入口包括Cursor、Grok Build、自家API,以及OpenRouter、Vercel、Cloudflare等合作方。OpenRouter页面能独立确认模型已列出并给出价格和上下文;OpenCode在北京时间8月12日23:53发布接入消息。这些材料支持“开发者已经能从多个渠道尝试”,但不同平台是否使用同一推理档位、默认工具配置、上下文策略和限速,仍要逐一核对。

安全部分目前更像原则性说明。xAI称4.6的保障措施随能力提升而改进,并进行了其覆盖最广的部署前能力与保障校准测试,以及部署后和第三方测试。发布页没有同步给出完整系统卡、逐项分数、越权工具调用、提示注入、数据外泄、拒答变化或长时运行特有的风险结果。模型越能连续操作代码库和工具,权限最小化、审批点和可回滚性越应成为验收条件。

这不影响“正式发布”的高置信判断,却限制了对“更安全”或“可直接进企业生产”的外推。企业试用应把模型放在隔离仓库、最小权限凭证和可观测脚手架中,记录每次工具调用与变更;在安全材料补齐前,不宜让宣传中的长时自主性替代运行时控制。

早报观点

Grok 4.6最有价值的变化,是xAI开始用“交付一项长任务”来组织模型能力:研究、代码库操作、自测、交互和视觉制品被放到同一条执行链上。这个方向比再增加一张静态推理榜单更贴近智能体采购,也让价格优势有机会转化成单位完成任务的优势。

现有证据同时要求克制。61分是有价值的第三方坐标,却只是Artificial Analysis的九项综合指数;1577 Elo和约53轮指向长程效率,却来自私有评测;视觉首稿与更多自检则是xAI定性观察。三类证据不能相互替代。综合指数不能证明视觉交付,演示不能证明连续运行稳定,低token单价也不能证明失败重试后的总账单更低。

4.6已经足以进入代码智能体和知识工作模型的第一轮实测清单,尤其适合对输出成本敏感、又愿意自行建设评测与脚手架的团队。它还没有用公开证据解除长程智能体最难的三个问题:失败是否可恢复、工具权限是否可控、制品质量是否能稳定复现。谁能把这三项转化为可审计数据,谁才会把“前沿分数”变成长期席位。

一周内值得完成的验收

开发团队可以先选一组需要30至60分钟、跨多个文件和工具的真实任务,固定提示、环境、权限和预算,让Grok 4.5与4.6各跑多次。记录端到端完成率、人工接管点、测试通过率、返工轮次和总token,而不是只看最漂亮的一次结果。若任务涉及UI,再加入跨屏、无障碍、错误状态和视觉一致性检查。

平台团队应分别测试标准版与fast变体。标准版基础价是输入2美元、输出6美元;fast为其2倍,只有吞吐提升足以减少等待或并发成本时才值得。缓存命中价也要单列,因为第三方披露4.6为0.5美元,高于4.5的0.3美元。把输入、输出、缓存、工具费用和失败重跑放进同一张任务成本表,才能判断真实收益。

评测团队需要保存版本号。Terminal-Bench v2.1的88.4%与v3.0的26.0%来自不同来源、不同版本,不能进同一趋势线;Grok 4.6 High与竞品Max也不是完全对等的推理预算。凡是横向结论,都应同时记录模型快照、推理档位、脚手架、token上限、超时与重复次数。

最后,采购与安全团队应等待并追踪系统卡、第三方长程复现和合作渠道的服务细则。最关键的后续信号不是又多一个短榜第一,而是能否公开数小时任务的失败分布、断点恢复、工具越权测试和单位成功任务成本。那会决定Grok 4.6是一次分数与价格都漂亮的版本更新,还是一套真正可托付长流程的执行模型。