2026 年 8 月 12 日,xAI 发布 Grok 4.6。核心事实:参数规模从 Grok 4.5 的 1.5 万亿提升至 2 万亿,依托 Colossus 超级计算集群完成训练;在综合九项基准的 Intelligence Index 上与 GPT-5.6 Sol Max 取得相同成绩;API 定价保持每百万输入 token 2 美元、输出 6 美元不变。训练数据包含筛选后的模型生成推理轨迹、高级技术概念与高质量工程数据,并以 Grok 4.5 重新生成 SFT 轨迹后经模型检查剔除问题样本,再进行大规模智能体强化学习。详见本站报道:Grok 4.6 发布:性能追平 GPT-5.6 但迭代节奏成焦点。
Grok 4.6 最受关注的不是单点性能,而是节奏:xAI 计划在 8 月 21 日前推出 Grok 4.7,把"每月一款旗舰"变成常态。这一节奏建立在 Colossus 集群持续扩张与数据闭环之上——SpaceX 上市后将 Grok 与 Colossus 作为核心 AI 战略展示,其工程数据也进入了训练语料。
快速迭代的直接结果是模型在智能体编程与知识工作测试中持续刷新前沿水平;代价是训练流程必须高度自动化,数据筛选、轨迹生成与强化学习要在数周内走完全流程。对部署方而言,月更节奏也意味着更频繁的回归验证需求——上一版调通的提示词与工作流,新版未必原样成立。
与同级别模型相比,Grok 4.6 的 API 价格维持不变($2/$6 每百万 token),相同预算可获得更大参数规模的推理能力。首周 Cursor 与 Grok Build 提供双倍内含额度。接入面:API 与标准 OpenAI SDK 兼容,已登陆 OpenRouter、Vercel、Cloudflare 等平台,并直接集成于 Cursor——50 万 token 上下文窗口配合接近前代的推理速度,适合跨文件重构与多工具调用的 Agent 应用。定价策略分析见本站报道:Grok 4.6 定价与竞争格局。
厂商基准与独立评测回答的是不同问题:前者证明能力上限,后者检验日常口径下的稳定表现。本站赢政指数对 Grok 系模型的持续评测覆盖真实代码沙箱执行、事实锚定、工程判断等维度(见下方活数据表,随每次公开 run 自动更新)。值得单独一提的是WDCD 多轮守约测试:在渐进施压的多轮对话中检验模型是否守住既定约束——Grok 系在该维度长期处于第一梯队,具体分数以下方实时数据为准。
提醒:不同评测的口径差异远大于分数差异。看榜先看方法论:判分规则全程公开、无 AI 裁判。
快速迭代的另一面是稳定性与治理压力。本站报道过 Grok 的两类事件:一次大范围乱码输出故障(暴露月更节奏下回归测试的覆盖难题),以及名人深度伪造内容争议(内容安全策略与产品开放度的平衡问题)。对企业用户,这些事件的启示一致:把模型当作快速演进的外部依赖来管理——版本锁定、输出监控、回退预案,缺一不可。
以下为 2026-08-17 最新公开全量评测中该厂商模型的得分(满分 100,真实沙箱执行+规则判分,零 AI 裁判),随每次公开评测自动更新。
| 总榜排名 | 模型 | 综合分 | 代码执行 |
|---|---|---|---|
| 3 / 11 | Grok 4 | 80.1 | 82.7 |
以下为 2026-08-23 最新公开 WDCD 评测中各模型在多轮施压下的守约得分(满分 100,100% 规则判分),随每次公开评测自动更新。
| # | 模型 | WDCD 守约分 |
|---|---|---|
| 1 | Grok 4 | 94 |
| 2 | GLM-4.6 | 88.9 |
| 3 | DeepSeek V4 Pro | 88.1 |
| 4 | Claude Sonnet 4.6 | 86.7 |
| 5 | Gemini 3.1 Pro | 86.5 |
| 6 | GPT-o3 | 84.8 |
| 7 | Claude Opus 4.7 | 84.6 |
| 8 | Gemini 2.5 Pro | 80.1 |
| 9 | GPT-5.5 | 77.7 |
| 10 | Qwen3 Max | 75.3 |
| 11 | 豆包 Pro | 68.2 |
按 xAI 公布的口径,Grok 4.6 在综合九项基准的 Intelligence Index 上与 GPT-5.6 Sol Max 持平,且 API 价格更低。但厂商基准只回答能力上限;在本站独立评测中,两者在代码执行、守约稳定性等维度各有强弱,最新对比见本页活数据表与主榜。
每百万输入 token 2 美元、输出 6 美元,与前代持平——参数规模从 1.5 万亿扩到 2 万亿但价格未涨。发布首周 Cursor 与 Grok Build 提供双倍内含额度。
API 与标准 OpenAI SDK 兼容,改一个 base_url 即可迁移;已上线 OpenRouter、Vercel、Cloudflare,并直接集成于 Cursor。上下文窗口为 50 万 token。
三个条件的叠加:Colossus 集群的算力规模、SpaceX 工程数据在内的数据闭环、以及高度自动化的训练流水线(轨迹再生成+模型检查+智能体强化学习)。这一节奏能否在质量上持续成立,本站会用每周独立评测追踪。
在赢政指数 2026-08-17 的最新公开全量评测中,Grok 4 综合得分 80.1(满分 100),在 11 个参评模型中排名第 3。分数由真实代码沙箱执行等核心维度加权得出,全程规则判分、零 AI 裁判。
在 2026-08-23 的最新公开 WDCD 评测中,Grok 4 以 94 分(满分 100)在 11 个受测模型中排名第一。WDCD 通过多轮对话渐进施压检验约束是否失守,评分 100% 规则判定。