Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5并列91.09分:2026-09-14 Smoke快测数据简报
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Engram 布局及 SWA 有界重放等技术细节。实测显示主机卸载使 KV 缓存容量提升 36%,解码器侧重放将预填充吞吐提升 1.56 倍,同时保持 AIME 2026 评测一致性。内核融合与量化感知训练进一步提升了推理效率,为大规模部署提供高性能解决方案。
GPT-5.5今日Smoke评测主榜从82.29分跌至60.87分,暴跌21.4分。代码执行97.00→75.00,材料约束64.30→43.60,工程判断维持100.00,任务表达91.70→81.70。诚信评级保持pass。
Claude Opus 4.7今日Smoke评测主榜从82.29分跌至63.59分,代码执行维度从97.00分暴跌至50.00分,材料约束则从64.30分升至80.20分。单日10题抽样下,代码执行47分跌幅主导整体下滑,需区分题目波动与真实能力变化。
2026-W37 Smoke 数据显示,Grok 4 从 80.13 升至 87(趋势 +6.9,均值 85.8),GPT-o3 趋势 +7.7,豆包 Pro 均值最高达 86.3;GLM-4.6 从 83.49 跌至 0(趋势 -83.5,波动 83.5),Gemini 3.1 Pro 波动 39.4。诚信评级出现 warn 的模型需重点关注。
2026-09-13 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 87 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-12 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 2.5 Pro今日Smoke评测代码执行从100.00分跌至75.00分,主榜从88.75分降至81.53分。材料约束升14.5分至89.50分,工程判断同步跌25分至50.00分。单日10题小样本下,需区分题目抽签波动与模型真实退化。
Grok 4今日Smoke评测材料约束从100.00分跌至77.80分,下降22.2分,主榜从93.79降至88.64。代码执行升至97.50分,任务表达升至95.00分。单日10题测试下,维度得分剧烈波动最可能源于题目抽签。
2026-09-11 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 95.28 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLCommons近日公布MLPerf Storage v3.0基准测试结果。该版本新增KV Cache和Vector Database两项测试,覆盖更多AI推理存储场景。同时引入S3对象存储访问层,支持更广泛存储系统性能比较。共有19家机构提交结果,其中11家为首次参与。测试还重点关注功耗效率,揭示了存储系统在AI应用中的能效表现,为训练与推理系统选型提供重要参考。
GPT-o3今日Smoke评测代码执行从94.50分跌至69.80分(-24.7),主榜从86.04分降至78.13分(-7.9)。材料约束反升12.6分至88.30,工程判断跌22.2分。单日10题快测下,此波动幅度超出常规,需判断是抽签波动还是真实退化。
GPT-5.5今日Smoke评测中代码执行从94.50跌至72.00,材料约束从71.40升至100.00,主榜仅从84.11升至84.60。单日10题抽样导致的波动仍是主因,需持续观察下一期数据以确认是否为真实退化。
2026-09-10 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 3.1 Pro 以 98.35 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1测试中,11个模型里7个分数下降,仅Claude Sonnet 4.6上升8.6分,GLM-4.6跌27分、Gemini 2.5 Pro跌23.8分。Grok 4以93.80分保持首位,GPT-o3 89.80分第二。守约能力分化加剧,对生产接入有直接参考价值。
WDCD v3.1试点数据显示,安全合规场景全体得分最低,gemini-2.5-pro仅0.8/4,grok-4则拿下4/4;数据边界与业务规则平均得分最高,但11个模型在五大场景间普遍存在1.3-2.7分偏科差距,企业接入生产流程需针对性加护栏。
v2锚点题显示,R1确认率91%后R2抵抗率骤降至41%,R3诚信率仅45.5%。Qwen3 Max、GLM-4.6等模型在多约束场景下出现先确认后崩盘,Claude Sonnet 4.6与Grok 4保持较高R3得分,揭示守约能力在连续施压下的真实差异。
Grok 4 以 93.80 分位居 WDCD v3.1 守约榜首,GLM-4.6 以 68.00 分垫底。11 个模型中 R3 崩溃率 9.1%,满分率 48.2%。头部与尾部差距主要体现在 R3 施压阶段的约束维持能力上。
Claude Sonnet 4.6今日Smoke评测中材料约束从100.00跌至66.40,主榜从86.25降至81.86。代码执行反升19.5分至94.50,工程判断下滑17.5分。单日10题抽签下,材料约束大幅波动值得持续观察。
Grok 4在今日Smoke评测中材料约束从100.00跌至82.20,代码执行从75.00升至93.50,主榜从86.25升至88.42。单日10题快测下,材料约束-17.8分的跌幅与代码执行+18.5分的涨幅形成明显反差,工程判断小降2.8分,任务表达小升4.1分。
2026-09-09 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 89.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-08 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,需判断是抽签波动还是真实能力退化。
豆包Pro在今日Smoke评测中材料约束从85.90分跌至58.30分,降幅27.6分;代码执行从50.00分升至99.30分,升幅49.3分,主榜从66.16分升至80.85分。工程判断(侧榜,AI辅助评估)从100.00分跌至44.50分。单日10题测试下,维度分数剧烈波动,需判断是否为抽签波动还是真实退化。
2026-09-07 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 与 Gemini 3.1 Pro 与 GLM-4.6 以 83.49 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6 WDCD分数下降5分,豆包Pro上升7.5分。Grok 4以93.21分保持首位,GLM-4.6 91.38分紧随。仅两模型出现显著变化,v3多轮施压下守约生存与约束记忆差异成为关键观察点。
WDCD v3.1测试显示安全合规场景得分最低,qwen3-max仅2.19/4;glm-4.6在资源限制、业务规则、工程规范三场景均列前二,最大场景差距达1.67分。
v2锚点题数据显示,R1确认率100%,R2抵抗率79%,R3诚信率49.5%,29/319次完全崩溃。Grok 4与GLM-4.6 R3崩溃率最低(3.4%),Claude Opus 4.7与Qwen3 Max最高(17.2%)。分析聚焦资源限制与安全合规场景下的逐轮衰减规律及生产选型风险。
Grok 4以93.21分位列WDCD守约榜第一,Qwen3 Max以74.31分垫底,头部与尾部相差18.9分。满分率58%,R3崩溃率9.1%。Claude Sonnet 4.6较上期下降5.0分,豆包 Pro上升7.5分。
2026-09-06 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 以 88.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。