xAI推出Grok 4.6模型 性能逼近GPT-5.6且定价更低

xAI于2026年8月12日发布Grok 4.6模型,输入定价2美元/百万token,输出6美元/百万token,上下文窗口达50万token。该模型在GDPval和Harvey Bench基准上领先GPT-5.6和Claude Opus 5,同时推出Grok Bot持久化AI队友工具。Cursor等平台用户反馈其在编码任务中表现突出,但与SpaceXAI同名模型的关联仍待澄清。

xAI于2026年8月12日正式上线Grok 4.6模型,输入价格为每百万token 2美元,缓存输入0.5美元,输出6美元,提示token超过20万后价格翻倍。该模型支持50万token上下文窗口,接受文本和图像输入,输出仅限文本,无长度限制。

基准表现与实际差距

Artificial Analysis Intelligence Index数据显示,Grok 4.6 high版本与GPT-5.6 Soul并列,位列Claude Opus 5之后。GDPval基准中,Grok 4.6 high得分最高,超过GPT-5.6 Soul和Claude Opus 5 Max。该基准覆盖工程、金融、AutoCAD、酒店和视频编辑等真实经济任务。

Harvey Bench法律任务测试中,Grok 4.6得分为15.8%,GPT-5.6 Soul为2.5%,Claude Opus 5为11.3%。Cursor Bench 3.2内部编码测试显示,Grok 4.6落后于Claude Opus 5 Max。终端代理任务得分从15%提升至26%。

每百万token任务成本约0.83美元,低于同等智力水平模型的数倍价格。

发布节奏与数据来源

Grok 4.5于2026年7月8日上线,Grok 4.6在四周内跟进。xAI已确认Grok 4.7正在训练,目标三至四周后发布。该公司通过收购Cursor获取编码数据,结合Colossus数据中心闲置GPU容量,形成编码优先循环。

官方发布说明显示,Grok 4.6基于与Grok 4.5相同的约1.5万亿参数基础,通过工程数据精调而成,并非全新训练基础模型。

Grok Bot的实际部署

2026年8月11日同步上线的Grok Bot运行在持久云虚拟机上,支持消息、审批、连接器和例程功能,定位非技术知识工作者而非开发者。用户可在Cursor平台直接调用,编码任务反馈积极。

该工具与此前Grok系列的语音和视频模型形成互补,但尚未披露与SpaceXAI同名模型的具体技术关联。

定价策略的产业影响

同等任务成本低于OpenAI和Anthropic同类产品,Grok 4.6直接压缩了开发者在多模型切换中的预算压力。API支持低、中、高、xhigh四档推理强度,默认高档,用户可按需调整。

这种定价在保持基准竞争力的同时,改变了此前前沿模型普遍高价的格局。开发者可通过实际终端任务验证性价比,而非仅依赖公开榜单。

独立判断

当前证据显示,Grok 4.6已在特定法律和经济任务基准上形成局部优势,定价与执行速度构成主要差异点。