Grok 4.7五次跳票后,xAI直推4.8:2.5万亿参数C++重写,路线图指向AGI

xAI于2026年9月13日宣布Grok 4.8进入训练尾声,参数量2.5万亿,采用自研C++训练栈,训练效率声称高于JAX一个数量级。与此同时,Grok 4.7因强化学习调参问题历经五次延期至今未发,Musk最新将其定位为"大致与Opus 5.0相当",明显低于此前"超越所有现有模型"的宣传。完整路线图延伸至Grok 5,定位为首个AGI级别模型。

2026年9月13日,Elon Musk在X平台宣布:xAI的下一代模型Grok 4.8正在完成主体训练,参数量2.5万亿,基于xAI从零自研的C++软件栈构建,训练结束后将立即进入强化学习阶段。这一消息发出时,参数量2.1万亿的Grok 4.7仍处于未发布状态——也就是说,xAI在上一个模型尚未交付的情况下,已经宣布了规模更大、架构更新的下一个版本。

五次未兑现的承诺

Grok 4.7的延期历史颇为曲折。据cellcog.ai梳理,从2026年7月24日“四周内发布”,到8月12日“三到四周内”,再到9月1日“十天后”,Musk先后给出了至少五个不同的发布节点,全部落空。9月11日,他给出了迄今最具体的技术解释:强化学习训练对模型的回复长度施加了过度惩罚,导致模型在能力范围内的困难问题上提前放弃,而不是坚持解题,自我检验也不够严格。

大模型在RL对齐阶段出现能力退化并不罕见,但Grok 4.7的情形指向一个具体的设计权衡:为了让模型输出更简洁,训练信号惩罚了过长回复,但副作用是削弱了需要长链推理才能解决的高难度任务上的表现。这与“参数量更大即更强”的直觉预期产生了矛盾。

9月14日,Musk进一步下调了对4.7的公开定位,将其描述为“大致与Anthropic的Opus 5.0相当”,而非此前暗示的全面超越市场现有最强。

Grok 4.8的架构赌注

Grok 4.8的技术差异,不只是参数量从2.1万亿增加到2.5万亿(增幅约19%)这一项。据progressiverobot.com报道,xAI为这一版本构建了全新的C++训练基础设施,运行在22万张英伟达GB300 GPU上,GPU之间通过800G高速网卡互联,大量使用流水线并行。Musk声称,这套方案的训练效率比主流JAX方案高出“一个数量级以上”。

自研训练框架是一项高风险高回报的选择。PyTorch、JAX等主流框架积累了多年的社区调试和优化,从零构建意味着xAI要独立处理所有底层的数值稳定性问题、分布式通信的边界情况和内存管理细节。一旦调通,这套栈将与xAI自身的Colossus超级算力集群形成深度绑定,竞争对手无法直接复制。Grok 4.7已经展示了RL阶段的脆弱性;切换到自研训练框架后,Grok 4.8的风险点同样有增无减。

SpaceX数据的护城河

Grok 4.7的训练纳入了SpaceX的工程数据,包括内部文档、遥测数据、星链卫星记录和火箭研发资料。据bighatgroup.com报道,这一补充训练阶段在主预训练结束后进行,是发布前的最后一步。

这是xAI拥有的唯一一类竞争对手在物理上无法复制的数据资产。OpenAI、Anthropic、Google DeepMind都没有办法获取SpaceX的工程遥测数据库。

基准坐标:从Grok 4.6的实际表现出发

理解4.7和4.8的相对位置,需要从唯一已公开发布的上代模型出发。据finance.biggo.com报道的评测数据,Grok 4.6在AA智能指数上得分61,与GPT-5.6 Sol Max持平,但低于Claude Fable 5 Max的62分。在GDPVal-AA v2基准上,Grok 4.6得分1753,领先同代竞品。但在Terminal-Bench v3.0上,Grok 4.6仅得26%,明显落后于GPT-5.6 Sol Max的34.6%。

这组数字勾勒出一个能力分布不均的模型:综合推理接近顶级,但在涉及终端操作、命令行执行的任务类型上存在结构性短板。Grok 4.5在同一指数上仅得56分,4.6升至61,这一代际跃升是真实的。但Musk将4.7定位在“Opus 5.0相当”,意味着4.7相对4.6的实际提升幅度,比最初的宣传保守了不止一个台阶。

定价:唯一无争议的竞争优势

在性能定位来回调整的背景下,Grok家族目前最可量化的优势是价格。据progressiverobot.com报道,Grok 4.6的API定价为每百万token输入$2、输出$6,而竞争对手旗舰模型通常在$10/$50区间。这个五倍左右的价格差,在大批量调用场景中足以改变企业的选型逻辑。

如果Grok 4.7和4.8在正式发布时维持相近的定价区间,并能在Terminal-Bench类任务上弥补4.6的结构性弱项,这将是企业用户实际迁移的触发点。

路线图与验证信号

Musk给出了一条自评性质的发展路线图:Grok 4.7大致对标Opus 5.0,Grok 4.8比4.7有明显提升,Grok 4.9“大概达到Astra/Fable级别”,Grok 5则被定位为xAI的首个AGI级别模型。这条路线图不是基于发布的基准卡,也没有独立机构核验——它是创始人在社交媒体上的自我描述。

Grok 4.7的经历给这条路线图打了一个底线注脚:宣布与交付之间存在结构性时差,性能预期在接近发布时会经历下调修正。这不等于路线图本身是错的,但对于依赖API稳定性做产品规划的开发者而言,需要保留足够的缓冲。

以下三个信号将是验证路线图可信度的具体观测点:Grok 4.8正式发布时在Terminal-Bench v3.0类任务上的得分;官方发布是否附带完整的基准卡、API文档和定价表;以及RL训练完成到正式上线之间的实际时间跨度。如果这三项在2026年10月中旬前同时到位,且Terminal-Bench得分明显改善,xAI的路线图将获得实质性支撑。