赢政 AI 评测 — AI 模型评测、行业资讯与深度研究

赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →

最新资讯

查看全部 →
资讯 07-25 03:38 X
AI紧急关闭法案引发热议 行政权力与技术黑箱矛盾凸显
美国国会审议AI紧急关闭法案,授权总统及国土安全部长在AI系统对国家安全或经济稳定构成威胁时下令关闭。法案因多起失控事件提出,定义涵盖绕过安全协议等行为,行业担忧权力滥用并游说增加验证缓冲期,监管与创新平衡成为焦点。
资讯 07-25 03:37 X
二十余家科技企业签署公开信 呼吁保护开放权重AI模型
二十多家公司与组织签署公开信,呼吁美国政策制定者保护开放权重AI模型。Meta、Microsoft、Nvidia、IBM等参与其中,信件强调维护此类模型的开放性,相关讨论聚焦开源与封闭路径的行业走向。
评测 07-25 03:35
Claude Sonnet 4.6 与 Grok 4并列96.98分:2026-07-25 Smoke快测数据简报
2026-07-25 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 96.98 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
评测 07-25 03:23
MLPerf Tiny:超低功耗AI的关键基准
随着AI从数据中心走向门铃、助听器、工业传感器和可穿戴设备,如何公平衡量毫瓦级设备的性能与能效成为关键问题。MLPerf Tiny通过统一模型、任务、精度目标和能耗测量方法,为TinyML硬件与软件栈提供可比较的标准。
评测 07-25 03:23
MLPerf Inference迈向智能体时代:新增多轮Agentic Inference基准
MLCommons提出Agentic Inference基准,将多轮智能体推理纳入MLPerf Endpoints框架。新基准覆盖编码助手与企业工作流两类真实轨迹,重点衡量长上下文、KV-cache复用、可变输出长度和闭环多轮依赖下的端到端
评测 07-25 03:22
MLPerf v6.1征集边缘Agentic推理基准结果
MLCommons Edge LLM Taskforce宣布在MLPerf Inference v6.1中引入Edge Agentic Inference基准,聚焦设备端Agentic LLM在单边缘加速器上的工具调用准确率与单用户延迟表现
评测 07-25 03:21
MedPerf接入Google Cloud机密计算:为脑肿瘤AI评测加密护航
MLCommons与Google Cloud在Google Cloud Next 2026展示MedPerf接入Confidential Space,用于脑肿瘤MRI分割模型的联邦基准评测。该方案在不迁移患者数据的前提下,同时保护模型权重、
Netpreme X-Mem 加速 SGLang HiCache:TTFT 最高提升 6.7 倍
评测 07-25 03:16
Netpreme X-Mem 加速 SGLang HiCache:TTFT 最高提升 6.7 倍
随着长上下文、Agent 和推荐类 LLM 工作负载增长,Prefix caching 的瓶颈正从命中率转向 KV Cache 搬运带宽。Netpreme X-Mem™ 为 SGLang HiCache 增加高带宽专用 KV 内存层,在前缀
DSpark接入SGLang:用置信度驱动可变长度验证
评测 07-25 03:16
DSpark接入SGLang:用置信度驱动可变长度验证
DSpark 将半自回归 block drafter 与基于置信度的可变验证窗口结合,缓解 Speculative Decoding 在高并发下验证成本膨胀的问题。SGLang 已支持该机制,并通过 ragged CUDA graph、ov
DeepSeek-V4 Flash强化学习登陆AMD MI355X
评测 07-25 03:15
DeepSeek-V4 Flash强化学习登陆AMD MI355X
AMD与Miles团队宣布,DeepSeek-V4 Flash RL已在搭载ROCm的AMD Instinct MI355X GPU上跑通。团队解决了SGLang与Megatron策略对齐、量化权重在线更新和多节点并行稳定性等关键问题,并通
SGLang 两周优化 GLM-5.2:8×B300 上突破 500 TPS
评测 07-25 03:14
SGLang 两周优化 GLM-5.2:8×B300 上突破 500 TPS
SGLang Team 披露了 GLM-5.2-NVFP4 在 Blackwell B300 上的两周优化成果:通过 Spec V2、IndexShare MTP、TopK-V2、Indexer Prologue Fusion 与 BF16
SGLang 与 Miles 首日支持 Inkling:975B 多模态前沿模型上线
评测 07-25 03:13
SGLang 与 Miles 首日支持 Inkling:975B 多模态前沿模型上线
SGLang、Miles 与 Thinking Machines Lab 合作,为 975B 参数多模态模型 Inkling 提供 Day-0 支持。新版本围绕 ShortConv、相对位置注意力和 shared-expert sink M