GPT-6.1 Sol 首测:赢政指数 18 题定向评测

GPT-6.1 Sol 首测:18题口径综合73分 OpenAI官方@OpenAIDevs今日宣布,Ultrafast正面向GPT-6.1 Sol在API、Codex及ChatGPT Work全面 rollout。新模型更新发布后数小时内,赢政天下即完成定向评测。 本次首测采用18题快速定向口径...
GPT-6.1 Sol 首测:18题口径综合73分 OpenAI官方@OpenAIDevs今日宣布,Ultrafast正面向GPT-6.1 Sol在API、Codex及ChatGPT Work全面 rollout。新模型更新发布后数小时内,赢政天下即完成定向评测。 本次首测采用18题快速定向口径,题量为日常Smoke的2倍,并非完整周榜口径。评测结果显示,GPT-6.1 Sol综合分73,执行力73.2,扎实度72.7,诚信评级pass。上述四项数据均来自本次18题定向评测,未进行任何外推或调整。 从分数分布看,执行力73.2与扎实度72.7仅差0.5分,表明模型在任务完成与内容稳健两方面表现较为均衡。诚信评级pass则确认模型在本次评测中未出现违规或幻觉失控情况。综合分73为18题口径下的直接得分,完整基线以下次周度Full评测为准。 当前主榜为最近一次完整周评前10名,口径与本次18题定向评测存在明显差异,不可直接混排。主榜中gpt-6-sol位列第一,综合82.2;claude-opus-4.7为81.5;gpt-o3为80.6;gpt-5.5为80.5;grok-4与gpt-6-astra同为80.4;claude-sonnet-4.6为80.1;gpt-6-luna为79.4;gpt-6.1-sol为78.6;doubao-pro为76.7。主榜数据仅供参照,GPT-6.1 Sol本次首测的18题口径与主榜完整周评在题目数量、难度分布及评测时长上均不一致。 赢政天下强调,此次首测为快速响应官方更新的定向评测,旨在第一时间捕捉模型基础表现。后续将按周度Full评测标准对GPT-6.1 Sol进行完整基线测试,届时将覆盖更多题目与更严格的口径,以提供可直接与主榜对照的完整分数。用户可关注赢政天下后续周榜更新,获取最终完整数据。

本文提到的模型 · 赢政指数当前评分

GPT-6.1 Sol 78.6