DeepSeek V4 Pro 与 GPT-5.5 与 GPT-o3并列80.52分:2026-08-05 Smoke快测数据简报
2026-08-05 赢政指数 Smoke 快测覆盖 9 个模型,DeepSeek V4 Pro 与 GPT-5.5 与 GPT-o3 以 80.52 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
真机实测,数据说话。我们用严谨的方法论评测AI大模型、智能硬件与前沿技术,只为给你最客观的参考。
2026-08-05 赢政指数 Smoke 快测覆盖 9 个模型,DeepSeek V4 Pro 与 GPT-5.5 与 GPT-o3 以 80.52 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测因API故障/超时,execution与judgment维度数据缺失,自动进入补跑,本期不参与排名。材料约束得分51.80分,任务表达50.00分,其余维度为空。单日10题快测波动属正常,但完整性受损需关注。
豆包 Pro 今日 Smoke 评测因 API 故障导致 execution、grounding、judgment、integrity、communication 五维度数据完全缺失,主榜排名取消。单日 10 题快测中出现此类全维度超时,需区分题目抽签波动与模型真实退化。
2026-08-04 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 89.56 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-03 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测因API故障/超时导致integrity与communication维度缺失,主榜得分74.00,代码执行82.30,材料约束95.00,工程判断70.80,任务表达无数据,已进入自动补跑且不参与本期排名。
2026-07-28至2026-08-02七天Smoke数据中,Qwen3 Max从59.28分升至96.1分,趋势+36.8;Gemini 3.1 Pro从100分跌至94.45分,趋势-5.6。Claude Opus 4.7与Gemini 2.5 Pro同样大幅上升,GPT-o3与GLM-4.6则出现下滑,高波动模型与诚信评级变化成为本周核心信号。
2026-08-02 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 96.7 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLPerf自2018年推出以来,已成为衡量AI系统性能的行业标准,追踪到大语言模型推理能效提升超100倍、训练速度提升超50倍。随着AI服务广泛应用,企业采购推理算力需求日益复杂,MLCommons正式推出MLPerf Endpoints v0.7。该版本聚焦企业买家,强调当前性、全面性、可比性和洞察性,首批结果来自Coreweave、Google、Intel、KRAI和Nvidia等厂商。未来v1.0将引入更多买家导向规则、成本归一化及代理工作负载,支持滚动提交,助力采购决策。
SGLang 与 Miles 携手 Moonshot AI 和 NVIDIA,为 2.8 万亿参数的 Kimi K3 模型提供 Day-0 支持。该混合架构融合 KDA 线性注意力与 MLA,带来全新内存管理、统一内存池及 DSpark 推测解码等创新。单卡 decode 吞吐最高达 423 tok/s,prefill 阶段达每 GPU 2808 tok/s,同时支持 LoRA RL 训练。文章详解架构适配、状态管理及性能优化,助力开源大模型高效 serving。
本文介绍了Miles团队在Blackwell架构上实现的两种原生低精度RL方案:端到端MXFP8与MoE专家per-token NVFP4。通过从checkpoint转换、Megatron训练、SGLang rollout到实时权重更新的全链路精细精度控制,两种格式均可在保持训练-推理一致性的前提下大幅提升吞吐。实验显示,在Qwen3-30B-A3B的8x B200测试中,BF16与五种低精度配置的奖励曲线高度重合,而MXFP8与NVFP4显著缩短了rollout时间。文章详细对比了MXFP8与NVFP4的格式特性、反向传播模式选择,以及针对最终层和共享专家的BF16保护策略,为Blackwell时代高效RL训练提供了可落地的工程方案。
RadixArk 与 Google Cloud 达成合作,将 SGLang 推理框架引入 TPU 平台,为开发者提供硬件选择的灵活性。SGLang 已获超 3 万 GitHub 星标,支持 Gemma、Qwen 等主流模型及 Wan、Flux 等扩散模型。目前通过 SGL-JAX 即可在最新 TPU 上运行,年底还将推出 PyTorch 原生后端 SGL-torchtpu,实现数据并行、Radix Cache 等前沿特性。双方强调,此举消除迁移成本,让用户用相同 API 在 GPU 与 TPU 间无缝切换,打造开放、高性能的 AI 推理生态。