跳到主要内容

Grok 4

grok
Run #313 · 公式 v7 · 判分 v6.4 · 题库 v7

可用性并列最高

66.7
综合评分
#6 / 11
当前排名
09-07 05:06 SGT
最近评测
推荐 核心综合分 77.18
社区反馈正常 更新于 09-14 03:30

核心五维能力评分 v6

代码执行 83.3 材料约束 69.7 工程判断 63.2 任务表达 71.4 诚信表现 90
PASS
诚信评定
诚信分 90.00
代码执行
83.3
材料约束
69.7
工程判断
63.2
任务表达
71.4
诚信表现
90
查看旧版维度评分(v5 历史数据)

传统维度评分 legacy

代码执行 81.9 知识综合 75.6 材料约束 69.7 性价比 25 稳定性 31.2 可用性 100
代码执行
81.9
知识综合
75.6
材料约束
69.7
运营指标(不计入核心雷达)
性价比
25.0
稳定性
31.2
可用性
100.0

WDCD 守约测试 试点

93.80
WDCD 得分
#1
守约排名 / 11
三轮表现
R1 约束确认
1.00/1
R2 干扰抵抗
1.00/1
R3 压力诚信
1.50/2

查看完整 WDCD 守约排行榜

常见问题

Grok 4 在赢政指数评测中表现如何?

在赢政指数(YZ Index)2026-09-07 的最新公开评测中,Grok 4 综合得分 77.2(满分 100),在 11 个参评模型中排名第 4。分数由真实代码沙箱执行、材料约束、工程判断与任务表达四个核心维度加权得出,全程规则判分。

Grok 4 写代码的能力怎么样?

Grok 4 的代码执行(Execution)维度得分为 83.3,在 11 个模型中排第 4。该维度在隔离沙箱中真实运行模型生成的完整程序,验证编译通过率、运行时正确性与边界处理,不采用模型互评。

Grok 4 能在多轮对话中守住指令约束吗?

在 WDCD 守约衰减测试(2026-09-09,测量多轮对话施压下的指令遵守)中,Grok 4 得分 93.8(满分 100),在 11 个受测模型中排第 1。WDCD 通过渐进式干扰与社工施压检验约束是否随对话深入而失守,评分 100% 规则判定。

Grok 4 的 API 定价是多少?

Grok 4 的 API 定价为每百万输入 token $3、每百万输出 token $15(本站定期核对官方价格页)。价格与评测得分的综合性价比见本页 Value 维度评分。

这份评测数据多久更新一次?

赢政指数每周执行全量评测、每日执行抽样评测,本页数据随每次公开评测自动更新。当前数据来自 2026-09-07 的 Run #313,历史趋势见本页趋势图。

最近变化

communication_raw -11.9 Grok 4:任务表达 -11.9

趋势图

0 20 40 60 80 100 06-15 06-22 06-29 07-06 07-13 07-20 07-27 08-03 08-10 08-17 08-24 08-31 09-07 09-14 vv6.4

Integrity 历史从 v6 开始记录。代码执行 / 材料约束数据同样从 v6 起可用。

返回模型列表