Grok 4以89.15分居首:2026-08-31 Smoke快测数据简报
2026-08-31 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 89.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-31 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 89.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 3.1 Pro今日Smoke评测主榜从96.60分跌至85.83分,降幅10.8分。其中材料约束从93.30分跌至78.90分,工程判断(侧榜,AI辅助评估)从75.00分跌至50.00分。代码执行降7.8分,任务表达升6.7分。诚信评级维持pass。
Grok 4今日Smoke评测主榜从96.99分跌至88.14分,代码执行下降9.3分至90.70,材料约束下降8.3分至85.00。工程判断小幅回升5.5分,诚信评级维持pass。单日10题测试下,此类波动需区分题目抽签与真实能力变化。
2026-08-24至2026-08-30 Smoke数据中,Claude Opus 4.7从82.98分升至93.08分(趋势+10.1),Gemini 3.1 Pro从96.98分跌至85.83分(趋势-11.2)。Grok 4均值90分最高,GLM-4.6波动43.6分最大。GLM-4.6与豆包 Pro诚信评级从warn转为pass。
2026-08-30 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 93.08 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLCommons 推出首个端到端检索增强生成(RAG)推理基准,涵盖文档摄取与多跳问答全流程。该基准采用 FRAMES 数据集,包含 824 个多跳查询和 2515 篇维基百科文章,支持从实时检索文档生成答案,有效降低幻觉并利用私有知识。基准测量摄取管道与 QnA 管道的整体性能,揭示模型放置、共驻、调度及前缀缓存等优化空间,为真实部署和未来智能体 AI 基准奠定基础。
随着AI在金融、医疗等敏感领域的广泛部署,企业迫切需要了解模型在其特定数据和用例下的可靠性和安全性。然而,传统评估方式难以兼顾数据隐私、模型权重保护以及基准完整性。MLCommons携手Google DeepMind、OpenMined与AVERI,首次开展双盲评估概念验证。通过保留的AILuminate™安全基准提示集和安全计算环境,实现了测试数据、模型权重与评估过程的加密隔离,既避免了基准污染,也保护了各方知识产权。该方法为未来目的特定AI部署提供了高完整性、可信赖的评估路径,标志着行业向IP安全、抗饱和测试标准迈进。
今日Smoke评测中,Claude Sonnet 4.6代码执行从97.00降至75.00(-22),材料约束从67.60升至93.30(+25.7),主榜从83.77微降至83.24。仅2题/维度的快测下,单日大幅波动源于题目抽签差异,而非模型退化。
Claude Opus 4.7今日Smoke评测主榜从93.54分跌至83.24分,代码执行从97.00分骤降至75.00分,材料约束反而升至93.30分。单日10题测试下,代码执行维度波动最大,需区分抽签因素与真实能力变化。
2026-08-29 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本文深入探讨1.6万亿参数MoE模型DeepSeek-V4-Pro在H20 GPU上的高效服务方案。通过硬件角色分配、Humming MXFP4AFP8量化及Online C128技术,结合PP2/PP4预填充与低延迟/高吞吐解码配置,显著提升TTFT与TPOT性能。单节点H20-141GB实现271 tokens/s输出,优化后预填充达8.45k input tokens/s,1M token提示处理仅需43.7秒。文章提供场景化部署方法论,为受限硬件下的前沿模型服务提供实用参考。
本文探讨强化学习中Rollout数据传输的挑战与Mooncake解决方案。在Miles框架中,Rollout生成与模型训练分离部署,产生异构、碎片化的结构化数据。Mooncake通过结构化对象传输架构,实现高效PUT/GET操作,较Ray路径远程GET延迟降低10-14倍,PUT提升1.2-1.6倍。文章详细分析数据异构性、内存碎片问题,并展示同步/异步传输流程、Miles对象解剖及基准测试结果,为大规模RL系统提供低延迟数据路径。
针对SOTA大模型冷启动耗时过长的问题,Ant Ling Infra团队与SGLang团队推出Weight Cache Daemon。该守护进程通过CUDA IPC零拷贝映射,将量化后权重常驻GPU内存,实现从分钟级到亚秒级的权重加载加速。基于Ling-2.6-1T FP8模型,权重加载时间从495秒降至0.63秒,总启动时间减少93.9%。支持多实例权重共享、<1秒主动-备用故障转移,以及多节点模式,为生产环境提供高可用、低成本的LLM服务恢复方案。
本文深入分析Ling-3.0-flash混合注意力MoE模型在4张NVIDIA Blackwell GPU上的Batch-1解码优化。通过NEXTN和DSpark两条推测解码路径,单请求吞吐从288 tok/s提升至606 tok/s,均值TPOT从3.33ms降至1.53ms。在1000请求对照测试中,DSpark进一步将均值TPOT压至0.78ms,吞吐达1120 tok/s。文章详述主机超前运行、PDL链式调度、内核融合及数值精度调整等关键技术,揭示Batch-1场景下权重带宽与启动延迟的优化路径。
Qwen团队开源Qwen3.8-Flash-Next,这是一款多模态MoE模型,也是Qwen4架构的早期预览。SGLang与Qwen、NVIDIA及AMD团队合作,提供Day-0支持。该模型采用Gated DeltaNet与Qwen Sparse Attention混合设计,引入Gated Residual和N-gram Embedding等创新。模型参数达125B激活6B,支持NVFP4量化,在B200上使用MTP推测解码可达540 tok/s。SGLang优化了KV缓存管理、索引复用及HyperConnection内核,实现长上下文高效推理。
SGLang Diffusion 团队在 8×NVIDIA H200 上对 MiniMax-H3 视频生成进行了全面基准测试。通过固定提示、种子、分辨率和去噪步数,SGLang 的无损路径比 Diffusers 快 1.85–1.95 倍。结合 Cache-DiT 步重用与 SubBlock 稀疏注意力,最高可达 6.24 倍加速(SSIM 0.76–0.91)。质量优先推荐单独使用 Cache-DiT,平衡方案则采用 SubBlock 0.75 + Cache-DiT stride。测试覆盖 T2VA 与 FL2VA 两种任务,详细数据与执行轨迹图均已呈现。
本文深入解析 Infer-forge 工程系统,围绕 SGLang 构建可复现的推理优化框架。通过 MonoRepo 统一跨仓库工作空间、Harness 提供执行保障、Task Loop 维持长期任务连贯性,以及 Task Graph 协调多任务收敛,实现从内核到部署的全链路可验证工程。系统强调部署点的全局约束链,支持 Agent = Model + Harness 的可靠执行,已在实际项目中协调 38 个任务节点,峰值并发任务达 9 个。文章公开方法论,助力团队构建适应自身环境的工程系统。
GPT-5.5今日Smoke评测主榜从95.01跌至85.93,下降9.1分。材料约束从88.90暴跌至72.40,代码执行小降3分,而工程判断从75升至100。主榜仅由代码执行与材料约束构成,此次下跌主要源于材料约束失分。
GPT-o3今日Smoke评测主榜从100.00跌至89.92分,材料约束从100.00骤降至77.60分(-22.4),代码执行维持100.00分,工程判断升至95.80分。单日10题快测中材料约束维度2题表现拉低整体,需观察是否为抽签波动。
2026-08-28 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 93.54 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包Pro今日Smoke评测中材料约束从100.00跌至79.50,主榜却从86.25升至90.78。代码执行从75.00升至100.00,工程判断从100.00跌至75.00。单日10题抽签波动可能是主因,需观察后续一致性。
今日Smoke评测中,Claude Sonnet 4.6材料约束从100.00跌至79.50,降20.5分;代码执行从73.70升至100.00,主榜反升5.2分至90.78。工程判断(侧榜,AI辅助评估)跌39.5分。单日10题抽样波动或为主要因素,需持续观察。
2026-08-27 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-o3 以 100 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1测试中,Claude Sonnet 4.6较Run #291上涨13.5分升至91.60分,Gemini 2.5 Pro下跌12.5分,Grok 4以96.30分继续领跑。3升4降格局下,守约能力分化加剧,对生产流程接入具有直接参考价值。
WDCD v3.1五大场景测试显示,安全合规场景全体得分最低,qwen3-max仅1.5/4,claude-sonnet-4.6满分。doubao-pro工程规范3.9/4却业务规则仅2.15/4,差距1.75。企业接入生产流程时,安全合规与业务规则需额外护栏。
v2 锚点题数据显示 11 个模型 R1 确认率、R2 抵抗率、R3 诚信率均为 0%,R3 完全崩溃 0/10。所有模型在三轮施压下均未守约,凸显当前大模型在硬约束下的系统性脆弱。
Grok 4以96.30分位居WDCD v3.1守约榜首,豆包Pro 67.90分垫底,11模型中满分率58.2%、R3崩溃率0%。头部三强与尾部三强平均分差超24分,Claude Sonnet 4.6单期上涨13.5分,GPT-5.5下滑5.3分。数据揭示不同模型在多轮施压下的真实约束生存差异。
豆包 Pro 在今日 Smoke 评测中代码执行从 91.70 分跌至 75.00 分(-16.7),材料约束从 69.40 分升至 100.00 分(+30.6),主榜从 81.67 分升至 86.25 分(+4.6)。工程判断升 36.1 分,任务表达降 8.3 分。诚信评级维持 pass。数据指向题目抽签波动而非模型退化。
2026-08-26 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 97.75 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
歌听上了,接下来是电影。RMVB 把一部电影压进 300MB,也把所有人推进"有声音没画面"的解码器地狱——于是"万能播放器"成了那个年代最动人的承诺。档案馆的收录页记下了全部细节:1.5MB 的 MPC 与 34.8MB 的暴风"万能版"、PotPlayer 简介里白纸黑字的作者出走始末、快播去广告版里民间高手的改版手记。这一次腾讯照例入场,而且产品真赢了口碑——却没能赢下时代。