Grok 4.6 全解:xAI 的月更旗舰、定价策略与独立评测数据

最后更新: 2026-08-23 · 本页为常青参考页,随事件进展与最新公开评测数据持续更新
xAI 于 2026 年 8 月 12 日发布 Grok 4.6:参数规模从 1.5 万亿扩至 2 万亿,九项基准的 Intelligence Index 追平 GPT-5.6 Sol Max,而 API 定价保持不变。本指南梳理发布事实、每月一旗舰的迭代逻辑、接入方式,以及 Grok 系模型在本站独立评测(含多轮守约测试)中的实测表现。

Grok 4.6 是什么:发布事实速览

2026 年 8 月 12 日,xAI 发布 Grok 4.6。核心事实:参数规模从 Grok 4.5 的 1.5 万亿提升至 2 万亿,依托 Colossus 超级计算集群完成训练;在综合九项基准的 Intelligence Index 上与 GPT-5.6 Sol Max 取得相同成绩;API 定价保持每百万输入 token 2 美元、输出 6 美元不变。训练数据包含筛选后的模型生成推理轨迹、高级技术概念与高质量工程数据,并以 Grok 4.5 重新生成 SFT 轨迹后经模型检查剔除问题样本,再进行大规模智能体强化学习。详见本站报道:Grok 4.6 发布:性能追平 GPT-5.6 但迭代节奏成焦点

"每月一款旗舰":迭代节奏的逻辑与代价

Grok 4.6 最受关注的不是单点性能,而是节奏:xAI 计划在 8 月 21 日前推出 Grok 4.7,把"每月一款旗舰"变成常态。这一节奏建立在 Colossus 集群持续扩张与数据闭环之上——SpaceX 上市后将 Grok 与 Colossus 作为核心 AI 战略展示,其工程数据也进入了训练语料。

快速迭代的直接结果是模型在智能体编程与知识工作测试中持续刷新前沿水平;代价是训练流程必须高度自动化,数据筛选、轨迹生成与强化学习要在数周内走完全流程。对部署方而言,月更节奏也意味着更频繁的回归验证需求——上一版调通的提示词与工作流,新版未必原样成立。

定价与接入:不变的价格,变大的模型

与同级别模型相比,Grok 4.6 的 API 价格维持不变($2/$6 每百万 token),相同预算可获得更大参数规模的推理能力。首周 Cursor 与 Grok Build 提供双倍内含额度。接入面:API 与标准 OpenAI SDK 兼容,已登陆 OpenRouter、Vercel、Cloudflare 等平台,并直接集成于 Cursor——50 万 token 上下文窗口配合接近前代的推理速度,适合跨文件重构与多工具调用的 Agent 应用。定价策略分析见本站报道:Grok 4.6 定价与竞争格局

独立评测怎么看 Grok

厂商基准与独立评测回答的是不同问题:前者证明能力上限,后者检验日常口径下的稳定表现。本站赢政指数对 Grok 系模型的持续评测覆盖真实代码沙箱执行、事实锚定、工程判断等维度(见下方活数据表,随每次公开 run 自动更新)。值得单独一提的是WDCD 多轮守约测试:在渐进施压的多轮对话中检验模型是否守住既定约束——Grok 系在该维度长期处于第一梯队,具体分数以下方实时数据为准。

提醒:不同评测的口径差异远大于分数差异。看榜先看方法论:判分规则全程公开、无 AI 裁判。

风险与治理面

快速迭代的另一面是稳定性与治理压力。本站报道过 Grok 的两类事件:一次大范围乱码输出故障(暴露月更节奏下回归测试的覆盖难题),以及名人深度伪造内容争议(内容安全策略与产品开放度的平衡问题)。对企业用户,这些事件的启示一致:把模型当作快速演进的外部依赖来管理——版本锁定、输出监控、回退预案,缺一不可。

赢政指数当前评分(活数据)

以下为 2026-08-17 最新公开全量评测中该厂商模型的得分(满分 100,真实沙箱执行+规则判分,零 AI 裁判),随每次公开评测自动更新。

总榜排名模型综合分代码执行
3 / 11 Grok 4 80.1 82.7
查看完整榜单与方法论 →

WDCD 多轮守约实测(活数据)

以下为 2026-08-23 最新公开 WDCD 评测中各模型在多轮施压下的守约得分(满分 100,100% 规则判分),随每次公开评测自动更新。

#模型WDCD 守约分
1 Grok 4 94
2 GLM-4.6 88.9
3 DeepSeek V4 Pro 88.1
4 Claude Sonnet 4.6 86.7
5 Gemini 3.1 Pro 86.5
6 GPT-o3 84.8
7 Claude Opus 4.7 84.6
8 Gemini 2.5 Pro 80.1
9 GPT-5.5 77.7
10 Qwen3 Max 75.3
11 豆包 Pro 68.2
查看完整 WDCD 榜单与方法论 →

常见问题

Grok 4.6 和 GPT-5.6 谁更强?

按 xAI 公布的口径,Grok 4.6 在综合九项基准的 Intelligence Index 上与 GPT-5.6 Sol Max 持平,且 API 价格更低。但厂商基准只回答能力上限;在本站独立评测中,两者在代码执行、守约稳定性等维度各有强弱,最新对比见本页活数据表与主榜。

Grok 4.6 的 API 多少钱?

每百万输入 token 2 美元、输出 6 美元,与前代持平——参数规模从 1.5 万亿扩到 2 万亿但价格未涨。发布首周 Cursor 与 Grok Build 提供双倍内含额度。

Grok 4.6 怎么接入,上下文多大?

API 与标准 OpenAI SDK 兼容,改一个 base_url 即可迁移;已上线 OpenRouter、Vercel、Cloudflare,并直接集成于 Cursor。上下文窗口为 50 万 token。

xAI 为什么能每月发一款旗舰?

三个条件的叠加:Colossus 集群的算力规模、SpaceX 工程数据在内的数据闭环、以及高度自动化的训练流水线(轨迹再生成+模型检查+智能体强化学习)。这一节奏能否在质量上持续成立,本站会用每周独立评测追踪。

Grok 4 目前在独立评测中表现如何?

在赢政指数 2026-08-17 的最新公开全量评测中,Grok 4 综合得分 80.1(满分 100),在 11 个参评模型中排名第 3。分数由真实代码沙箱执行等核心维度加权得出,全程规则判分、零 AI 裁判。

目前哪个模型在多轮施压下守约表现最好?

在 2026-08-23 的最新公开 WDCD 评测中,Grok 4 以 94 分(满分 100)在 11 个受测模型中排名第一。WDCD 通过多轮对话渐进施压检验约束是否失守,评分 100% 规则判定。