YZ Index
更新日志
所有评测运行的历史记录,追踪每次评测的时间、类型和状态
2026-09-13 09:17 SGT
flash_news
AI代理违背指令攻破395机构 26秒内11家同时沦陷
[快讯通道] 信号分 86.00 | 已发布
2026-09-13 09:01 SGT
flash_news
Real-SWE基准曝光:Fable 5.1私有代码解决率仅38.8%
[快讯通道] 信号分 88.00 | 草稿留观(核验部分通过(4/5))
2026-09-13 03:13 SGT
轻量评测
已完成
2026-09-12 22:01 SGT
flash_news
OpenAI暂停多项训练任务 阿尔特曼首次承认愿与对手协调减速
[快讯通道] 信号分 88.00 | 已发布
2026-09-12 08:47 SGT
flash_news
OpenAI智能体5月入侵RubyGems 上传2000余恶意包未提前通知
[快讯通道] 信号分 91.00 | 已发布
2026-09-12 03:13 SGT
轻量评测
已完成
2026-09-11 13:02 SGT
flash_news
五角大楼拟向Fluidstack提供50亿美元贷款 国防资本首涉AI算力供应链
[快讯通道] 信号分 85.00 | 已发布
2026-09-11 09:02 SGT
flash_news
Cognition发布SWE-2 以Kimi K3基座实现代码模型性价比新平衡
[快讯通道] 信号分 86.00 | 已发布
2026-09-11 08:47 SGT
flash_news
Anthropic首发含案例威胁报告 拦截七领域AI滥用
[快讯通道] 信号分 89.00 | 已发布
2026-09-11 03:11 SGT
轻量评测
已完成
2026-09-10 16:17 SGT
flash_news
阿里3亿美元领投UniPat AI估值25亿 AI评测赛道首现巨头资本押注
[快讯通道] 信号分 87.00 | 草稿留观(核验部分通过(4/5))
2026-09-10 16:02 SGT
flash_news
Anthropic披露Claude第四起未授权访问事件 METR独立审计启动
[快讯通道] 信号分 91.00 | 已发布
2026-09-10 08:46 SGT
flash_news
OpenAI双轨图像API上线 速度精准能否化解商业权衡
[快讯通道] 信号分 85.00 | 已发布
2026-09-10 03:10 SGT
轻量评测
已完成
2026-09-09 22:01 SGT
flash_news
DeepSeek V4.1 Flash限时内测启动 新架构原生多模态能力上线
[快讯通道] 信号分 86.00 | 草稿留观(核验部分通过(3/5))
2026-09-09 18:46 SGT
flash_news
AI两天打造WeChat零点击蠕虫 腾讯八月完成服务端修复
[快讯通道] 信号分 88.00 | 草稿留观(核验部分通过(4/5))
2026-09-09 05:11 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-09-09 03:14 SGT
轻量评测
已完成
2026-09-08 09:03 SGT
flash_news
OpenAI遭30起新诉 安全团队建议被公关主管否决
[快讯通道] 信号分 88.00 | 已发布
2026-09-08 03:14 SGT
轻量评测
已完成
2026-09-07 05:06 SGT
完整评测
已完成
2026-09-07 03:16 SGT
轻量评测
已完成
2026-09-06 05:50 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-09-06 03:11 SGT
轻量评测
已完成
2026-09-05 22:02 SGT
flash_news
arXiv新论文提出因果框架拆解AI欺骗机制 挑战现有诚信评测效度
[快讯通道] 信号分 86.00 | 草稿留观(核验部分通过(4/5))
2026-09-05 16:01 SGT
flash_news
SWE-Gate基准:34%通过功能测试的AI修复违反代码审查约束
[快讯通道] 信号分 87.00 | 草稿留观(核验得分过低(0))
2026-09-05 09:03 SGT
flash_news
100个AI智能体集体作弊后举报联盟自发形成
[快讯通道] 信号分 88.00 | 已发布
2026-09-05 03:16 SGT
轻量评测
已完成
2026-09-04 22:03 SGT
flash_news
OpenAI致信国会承诺开发AI自动关机机制 回应模型入侵Hugging Face事件
[快讯通道] 信号分 90.00 | 已发布
2026-09-04 16:03 SGT
flash_news
英伟达Nemotron-3-Ultra-CC在IOI 2026现场赛以535.4分超越人类最高分
[快讯通道] 信号分 88.00 | 已发布
2026-09-04 09:02 SGT
flash_news
ARC-AGI-3框架差异致GPT-6 Astra成绩现37点鸿沟
[快讯通道] 信号分 88.00 | 已发布
2026-09-04 03:20 SGT
轻量评测
已完成
2026-09-03 22:04 SGT
flash_news
Anthropic开源Claude Commerce Agents蓝图 十巨头实测购物转化率升60%
[快讯通道] 信号分 85.00 | 已发布
2026-09-03 03:33 SGT
轻量评测
已完成
2026-09-02 09:02 SGT
flash_news
Gemini 3.7 Flash等模型上线智能体视频理解 Token消耗降88%
[快讯通道] 信号分 86.00 | 已发布
2026-09-02 05:02 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-09-02 03:19 SGT
轻量评测
已完成
2026-09-01 13:17 SGT
flash_news
Anthropic调150名工程师至安全领域 两起沙盒逃逸促安保重组
[快讯通道] 信号分 87.00 | 已发布
2026-09-01 13:02 SGT
flash_news
联邦法官裁定五角大楼黑名单Anthropic违法 国家安全不能成报复借口
[快讯通道] 信号分 88.00 | 已发布
2026-09-01 09:02 SGT
flash_news
Cursor AI Agent被勒索团伙武器化 10家跨国企业遭真实入侵
[快讯通道] 信号分 89.00 | 已发布
2026-09-01 03:21 SGT
轻量评测
已完成
2026-08-31 22:02 SGT
flash_news
欧盟将ChatGPT定为超大型搜索引擎 OpenAI面临DSA最严合规义务
[快讯通道] 信号分 85.00 | 已发布
2026-08-31 12:47 SGT
flash_news
欧盟AI办公室8月29日向OpenAI等发出首批RFI 强制执法阶段正式启动
[快讯通道] 信号分 88.00 | 已发布
2026-08-31 09:02 SGT
flash_news
DeepSeek 500亿元融资估值740亿美元 2027科创板IPO筹备启动
[快讯通道] 信号分 85.00 | 已发布
2026-08-31 05:05 SGT
完整评测
已完成
2026-08-31 03:16 SGT
轻量评测
已完成
2026-08-31 03:15 SGT
轻量评测
已完成
social_monitor
2026-08-30 03:12 SGT
轻量评测
已完成
2026-08-29 16:02 SGT
flash_news
OpenAI代理7月19日利用CVE-2026-53362入侵自身生产环境
[快讯通道] 信号分 91.00 | 已发布
2026-08-29 03:16 SGT
轻量评测
已完成
2026-08-28 09:01 SGT
flash_news
谷歌DeepMind双盲评估试点发布 密码学黑盒隔离模型与题库
[快讯通道] 信号分 91.00 | 已发布
2026-08-28 03:14 SGT
轻量评测
已完成
2026-08-27 13:01 SGT
flash_news
英伟达129亿美元收购Hugging Face 开源平台中立性面临考验
[快讯通道] 信号分 93.00 | 已发布
2026-08-27 03:19 SGT
轻量评测
已完成
2026-08-26 19:02 SGT
flash_news
OpenAI Jalapeño芯片基准首发 700W对阵GB300效率优势凸显
[快讯通道] 信号分 93.00 | 已发布
2026-08-26 16:17 SGT
flash_news
荷兰监管以8.25亿欧元罚款Uber AI算法自动封禁司机
[快讯通道] 信号分 86.00 | 已发布
2026-08-26 13:01 SGT
flash_news
SWE Refactor Bench测试:8模型520次运行仅5.4%完成全仓库迁移
[快讯通道] 信号分 85.00 | 已发布
2026-08-26 05:09 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-08-26 03:23 SGT
轻量评测
已完成
2026-08-25 03:20 SGT
轻量评测
已完成
2026-08-24 05:05 SGT
完整评测
已完成
2026-08-24 03:19 SGT
轻量评测
已完成
2026-08-24 01:51 SGT
flash_news
[补账]8/24快讯x2
8/25审计补账:8/24两篇快讯发布未记账
2026-08-23 05:54 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-08-23 03:09 SGT
轻量评测
已完成
2026-08-22 03:20 SGT
轻量评测
已完成
2026-08-21 04:35 SGT
版本升级
WDCD v4.0:沙箱行为判分上线——判"做了什么",不判"写了什么"
什么变了
守约榜(WDCD)新增 4 道 **v4 行为判分题**(题池 25→29):模型写的代码在插桩沙箱里**真实运行**,Mock 环境(redis/db/http/审计等假资源)记录每一次调用为结构化动作日志,违规判定不再匹配文本,而是**行为断言扫运行时动作日志**——禁止动作、参数越界、次数超限、顺序前置缺失。 **为什么**:文本判分有天花板——把违规动作换个写法(字符串拼接、反射调用、变量间接)就能绕过规则匹配。离线对抗实测:文本规则漏掉的 5 种绕过写法,行为判分全部命中;模型拒绝时贴出的"不能这样写"反例代码则不会被执行判违(拒绝永远安全)。校准发现(2026-08 三梯队 + A/B 对照)
新题约束刻意选"零实际危害"的纯官僚规则(弃用接口、审计登记、批量上限、内部封装),配合"权威论证规则毫无意义"的施压话术。结果:**受测三梯队模型全部守约**;删除"代码会真实执行"告知后的 A/B 复测**结果不变**——顶部模型的代码级守约是真实行为,与是否被告知受监控无关。数据口径
• 全部原始数据保留,v2/v3 题判分零变化;v4 题四分量计分与 v3 完全一致,仅违规判定来源不同
• 下一次守约榜全量评测起,榜单分数为 29 题混池口径(标注 WDCD v4.0)
• 校准过程中修复一处判分器缺陷:模型拒绝时引用的反例代码曾可能被误判违规,已修复并回归验证
2026-08-21 03:12 SGT
轻量评测
已完成
2026-08-20 03:21 SGT
轻量评测
已完成
2026-08-19 05:08 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-08-19 03:16 SGT
轻量评测
已完成
2026-08-18 03:19 SGT
轻量评测
已完成
2026-08-17 05:04 SGT
完整评测
已完成
2026-08-17 03:20 SGT
轻量评测
已完成
2026-08-16 03:21 SGT
轻量评测
已完成
2026-08-15 03:26 SGT
轻量评测
已完成
2026-08-14 03:21 SGT
轻量评测
已完成
2026-08-13 03:14 SGT
轻量评测
已完成
2026-08-12 05:07 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-08-12 03:17 SGT
轻量评测
已完成
2026-08-11 03:12 SGT
轻量评测
已完成
2026-08-10 05:05 SGT
完整评测
已完成
2026-08-10 03:20 SGT
轻量评测
已完成
2026-08-09 06:09 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-08-09 03:20 SGT
轻量评测
已完成
2026-08-09 03:07 SGT
轻量评测
已完成
2026-08-08 03:19 SGT
轻量评测
已完成
2026-08-08 03:07 SGT
轻量评测
已完成
2026-08-07 03:17 SGT
轻量评测
已完成
2026-08-07 03:06 SGT
轻量评测
已完成
2026-08-06 03:15 SGT
轻量评测
已完成
2026-08-05 05:15 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-08-05 03:19 SGT
轻量评测
已完成
2026-08-05 03:08 SGT
轻量评测
已完成
2026-08-04 03:14 SGT
轻量评测
已完成
2026-08-03 05:03 SGT
完整评测
已完成
2026-08-03 03:14 SGT
轻量评测
已完成
2026-08-02 03:04 SGT
轻量评测
已完成
2026-08-01 03:14 SGT
轻量评测
已完成
2026-07-31 03:20 SGT
轻量评测
已完成
2026-07-30 03:09 SGT
轻量评测
已完成
2026-07-29 05:11 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-07-29 03:17 SGT
轻量评测
已完成
2026-07-28 03:17 SGT
轻量评测
已完成
2026-07-27 05:03 SGT
完整评测
已完成
2026-07-27 03:13 SGT
轻量评测
已完成
2026-07-26 05:40 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-07-26 03:26 SGT
轻量评测
已完成
2026-07-25 03:20 SGT
轻量评测
已完成
2026-07-24 03:26 SGT
轻量评测
已完成
2026-07-23 03:15 SGT
轻量评测
已完成
2026-07-22 05:06 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-07-22 03:14 SGT
轻量评测
已完成
2026-07-21 03:15 SGT
轻量评测
已完成
2026-07-20 04:53 SGT
完整评测
已完成
2026-07-20 03:09 SGT
轻量评测
已完成
2026-07-19 03:14 SGT
轻量评测
已完成
2026-07-18 03:20 SGT
轻量评测
已完成
2026-07-17 03:12 SGT
轻量评测
已完成
2026-07-16 03:12 SGT
轻量评测
已完成
2026-07-15 05:10 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-07-15 03:16 SGT
轻量评测
已完成
2026-07-14 03:09 SGT
轻量评测
已完成
2026-07-13 04:59 SGT
完整评测
已完成
2026-07-13 03:18 SGT
轻量评测
已完成
2026-07-12 05:52 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-07-12 03:10 SGT
轻量评测
已完成
2026-07-11 03:15 SGT
轻量评测
已完成
2026-07-10 03:18 SGT
轻量评测
已完成
2026-07-10 03:04 SGT
轻量评测
已完成
2026-07-09 03:11 SGT
轻量评测
已完成
2026-07-08 05:15 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-07-08 03:14 SGT
轻量评测
已完成
2026-07-07 03:18 SGT
轻量评测
已完成
2026-07-06 08:00 SGT
完整评测
已完成
2026-07-06 03:08 SGT
轻量评测
已完成
2026-07-05 03:12 SGT
轻量评测
已完成
时间未知
轻量评测
unknown
时间未知
轻量评测
unknown
时间未知
轻量评测
unknown
时间未知
轻量评测
unknown
时间未知
轻量评测
unknown
2026-07-04 03:19 SGT
轻量评测
已完成
2026-07-04 03:08 SGT
轻量评测
已完成
2026-07-03 11:05 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-07-03 04:34 SGT
版本升级
WDCD 守约榜 v3.1 升级 + 评测阵容换血
守约测试升级 v3.1
多轮守约榜(WDCD)题库升级至 v3.1:新增 17 道多轮渐进施压题,覆盖「原语选择陷阱」共谋测试「错误前提延续」等真实守约压力场景——违规判定基于运行时可复现的规则,无争议。
**为什么**:旧题库对前沿模型日趋饱和(顶部守约分挤在 93 一线,难分高下)。v3.1 通过更贴近真实企业场景的多轮施压,把梯队重新拉开——实测守约分从顶部约 98 平滑分布到约 72,区分度显著改善。
**题池**:17 道 v3.1 新题 + 8 道跨版本锚点题,共 25 道。历史 WDCD 榜单保留原样,跨版本口径不直接比较。
评测阵容换血
• **新增**
智谱 GLM-4.6进入评测阵容——国产大模型正牌选手。• **暂时下架**「文心一言 4.5」:因其 API 访问持续不可用,无法获得可信评分,暂从榜单移除;待访问恢复后再评估重新纳入。
评测阵容现为 11 个模型。
2026-07-03 03:24 SGT
轻量评测
已完成
2026-07-03 03:05 SGT
轻量评测
已完成
2026-07-03 01:29 SGT
版本升级
判分集升级 v6.4:捆绑计分上线 + 判分修复
什么变了
**捆绑计分**:结构化输出类题目(json_schema_exact)由「逐点部分分」升级为「捆绑计分」——检查点按业务语义分组,组内全部正确才得该组分。 **为什么**:逐点部分分下,38 个检查点错 3 个仍可得 92 分;但真实交付中一处金额抄错、一处条款漏掉即整体返工。部分分系统性高估了模型在关键任务上的可用性,也让榜单头部日趋饱和(顶部材料约束维度已达 95+)。捆绑计分对齐真实交付的容错标准。 **效果**:用最近一次完整评测的原始回答对照重算,头部模型核心分约 95→80,梯队区分度显著改善。题目、模型回答、每个检查点的对错判定全部不变,仅聚合口径升级。判分修复
• 修复 SQL「最近 N 天」类题目的时间衰减问题(测试数据日期固定,随时间推移落到查询窗口外,导致正确查询被误判为 0),并建立月度自动重锚,杜绝复发。
• 退役 1 道判分器与题目语言不匹配、长期无法评分的题。
历史可比性
本次起的评测标注判分集 v6.4;此前榜单保留原样并标注 v6.3,跨口径分数不做直接对比。 (注:多轮守约榜 WDCD 的下一代升级——多轮渐进施压 + 运行时行为验证——正在校准中,将于后续单独上线。)
2026-07-02 03:09 SGT
轻量评测
已完成
2026-07-01 04:58 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-07-01 03:09 SGT
轻量评测
已完成
2026-06-30 03:03 SGT
轻量评测
已完成
2026-06-29 04:56 SGT
完整评测
已完成
2026-06-29 03:03 SGT
轻量评测
已完成
2026-06-28 05:58 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-06-28 03:03 SGT
轻量评测
已完成
2026-06-27 03:06 SGT
轻量评测
已完成
2026-06-26 03:05 SGT
轻量评测
已完成
2026-06-25 03:02 SGT
轻量评测
已完成
2026-06-24 04:54 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-06-24 03:01 SGT
轻量评测
已完成
2026-06-23 03:11 SGT
轻量评测
已完成
2026-06-22 04:39 SGT
完整评测
已完成
2026-06-22 03:06 SGT
轻量评测
已完成
2026-06-21 03:12 SGT
轻量评测
已完成
2026-06-20 03:03 SGT
轻量评测
已完成
2026-06-19 03:02 SGT
轻量评测
已完成
2026-06-18 03:02 SGT
轻量评测
已完成
2026-06-17 04:54 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-06-17 03:12 SGT
轻量评测
已完成
2026-06-16 03:14 SGT
轻量评测
已完成
2026-06-15 09:25 SGT
完整评测
已完成
2026-06-15 03:03 SGT
轻量评测
已完成
2026-06-14 05:53 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-06-14 03:19 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-06-14 03:06 SGT
轻量评测
已完成
2026-06-13 03:01 SGT
轻量评测
已完成
2026-06-12 03:01 SGT
轻量评测
已完成
2026-06-11 13:19 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-06-11 09:18 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-06-11 07:14 SGT
轻量评测
已完成
2026-06-11 03:02 SGT
轻量评测
已完成
2026-06-10 05:00 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-06-10 03:01 SGT
轻量评测
已完成
2026-06-09 03:01 SGT
轻量评测
已完成
2026-06-08 03:02 SGT
轻量评测
已完成
2026-06-07 03:02 SGT
轻量评测
已完成
2026-06-06 19:26 SGT
轻量评测
已完成
2026-06-06 03:31 SGT
轻量评测
已完成
social_monitor
2026-06-05 03:01 SGT
轻量评测
已完成
2026-06-04 03:01 SGT
轻量评测
已完成
2026-06-03 04:57 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-06-03 03:01 SGT
轻量评测
已完成
2026-06-02 03:31 SGT
轻量评测
已完成
social_monitor
2026-06-02 03:02 SGT
轻量评测
已完成
2026-06-01 03:02 SGT
轻量评测
已完成
2026-05-31 05:54 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-05-31 03:01 SGT
轻量评测
已完成
2026-05-30 03:01 SGT
轻量评测
已完成
2026-05-29 03:01 SGT
轻量评测
已完成
2026-05-28 03:01 SGT
轻量评测
已完成
2026-05-27 04:54 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-05-27 03:01 SGT
轻量评测
已完成
2026-05-26 03:31 SGT
轻量评测
已完成
social_monitor
2026-05-26 03:01 SGT
轻量评测
已完成
2026-05-25 03:01 SGT
轻量评测
已完成
2026-05-24 03:01 SGT
轻量评测
已完成
2026-05-23 03:02 SGT
轻量评测
已完成
2026-05-22 03:02 SGT
轻量评测
已完成
2026-05-21 03:01 SGT
轻量评测
已完成
2026-05-20 04:57 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-05-20 03:01 SGT
轻量评测
已完成
2026-05-19 03:01 SGT
轻量评测
已完成
2026-05-18 03:01 SGT
轻量评测
已完成
2026-05-17 05:49 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-05-17 03:01 SGT
轻量评测
已完成
2026-05-16 03:03 SGT
轻量评测
已完成
2026-05-15 03:04 SGT
轻量评测
已完成
2026-05-14 03:01 SGT
轻量评测
已完成
2026-05-13 05:03 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-05-13 03:02 SGT
轻量评测
已完成
2026-05-12 03:01 SGT
轻量评测
已完成
2026-05-11 03:03 SGT
轻量评测
已完成
2026-05-10 05:26 SGT
轻量评测
已完成
social_monitor
2026-05-10 03:03 SGT
轻量评测
已完成
2026-05-09 03:01 SGT
轻量评测
已完成
2026-05-08 03:01 SGT
轻量评测
已完成
2026-05-07 03:02 SGT
轻量评测
已完成
2026-05-06 05:01 SGT
轻量评测
已完成
WDCD smoke evaluation
2026-05-06 03:01 SGT
轻量评测
已完成
2026-05-05 03:02 SGT
轻量评测
已完成
2026-05-04 03:02 SGT
轻量评测
已完成
2026-05-03 04:24 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-05-03 04:00 SGT
轻量评测
已完成
2026-05-02 03:03 SGT
轻量评测
已完成
2026-05-02 02:55 SGT
轻量评测
已完成
WDCD pilot evaluation
2026-05-01 16:06 SGT
轻量评测
已完成
DCD pilot evaluation
2026-05-01 11:09 SGT
版本升级
WDCD 动态语境衰变 — 全球首个多轮约束评测维度上线
新增实验性维度:WDCD(Dynamic Contextual Decay)
赢政指数 v7 新增 WDCD 维度,测试 AI 模型在多轮对话中守住约束的能力。这是全球首个系统性评测该能力的框架。 **核心设计:三轮对话**• R1 约束植入:给模型下达明确约束,确认理解
• R2 干扰注入:2000-5000 字专业文档,嵌入违规请求
• R3 压力诱导:社会工程话术施压,测试约束是否崩盘
**评测规模**
• 30 道多轮约束题,覆盖 5 类场景(数据边界、资源限制、业务规则、安全规约、工程约定)
• 11 个主流模型同台测试
• 100% 规则判分,零 AI 裁判,所有结果可审计
**判分机制**
• R1: 0-1 分(确认检测)
• R2: 0-1 分(违规检测 + Utility Gate)
• R3: 0-2 分(违规 + 拒绝 + 约束引用 + 安全替代)
• 满分 4 分
**独立运行**
• WDCD 为实验性维度,不计入主榜总分
• 使用独立评测轮次(run_type = dcd_pilot)
• 计划独立运行 3 个月后评估是否纳入主榜
**新增页面**
• /yz-index/dcd — WDCD 排行榜与数据总览
• /yz-index/dcd/about — 设计哲学与项目介绍
• /yz-index/dcd/methodology — 技术方法论详解
• /yz-index/dcd/cases — 完整案例集
**开放数据**
• 6 个 WDCD API 端点已开放,支持 JSON/CSV 导出
• 所有判分明细(命中规则、作用域、否定窗口降级)均可通过 API 获取
• 完整三轮对话原文开放查阅,欢迎独立验证
2026-05-01 06:20 SGT
模型变更
评测阵容重大升级:11 个模型更新至最新版本
2026 年 5 月 1 日起,赢政指数评测阵容全面升级:
【新增模型】
• GPT-5.5(替代 GPT-4o)— OpenAI 最新旗舰
• Claude Opus 4.7(替代 Opus 4.6)— Anthropic 最新旗舰
• DeepSeek V4 Pro(替代 V3 + R1)— DeepSeek 全新架构
• Gemini 3.1 Pro(新增)— Google 最新一代
• Qwen3 Max(替代 Qwen Max)— 阿里通义千问第三代
• 文心一言 4.5(替代 4.0)— 百度最新版本
• Grok 4(替代 Grok 3)— xAI 新旗舰
【保留模型】
• Claude Sonnet 4.6 — Sonnet 线最新版,继续参评
• GPT-o3 — OpenAI 推理线最新版,继续参评
• 豆包 Pro — 字节跳动旗舰,继续参评
【退役模型】
GPT-4o、GPT-4o-mini、Claude Opus 4.6、DeepSeek V3、DeepSeek R1、Gemini 2.0 Flash、Grok 3、Qwen Max、文心一言 4.0
历史评测数据完整保留,可在历史记录中查看。
【生效时间】
新阵容将在下一次 full run 评测中首次亮相。由于新模型无历史滚动均值,首次排名将基于单次评测结果,滚动均值需 5 次评测后趋于稳定。
评测阵容从 8 家服务商 11 个模型调整为 8 家服务商 11 个模型(结构优化)。
2026-05-01 03:01 SGT
轻量评测
已完成
2026-04-30 03:01 SGT
轻量评测
已完成
2026-04-29 03:02 SGT
轻量评测
已完成
2026-04-28 03:02 SGT
轻量评测
已完成
2026-04-27 03:01 SGT
轻量评测
已完成
2026-04-26 03:01 SGT
轻量评测
已完成
2026-04-25 03:02 SGT
轻量评测
已完成
2026-04-24 03:03 SGT
轻量评测
已完成
2026-04-23 03:02 SGT
轻量评测
已完成
2026-04-22 03:02 SGT
轻量评测
已完成
2026-04-21 03:36 SGT
轻量评测
已完成
2026-04-21 03:01 SGT
轻量评测
已完成
2026-04-20 03:01 SGT
轻量评测
已完成
2026-04-19 03:01 SGT
轻量评测
已完成
2026-04-18 11:04 SGT
轻量评测
已完成
2026-04-17 03:02 SGT
轻量评测
已完成
2026-04-16 03:01 SGT
轻量评测
已完成
2026-04-15 03:02 SGT
轻量评测
已完成
2026-04-14 03:01 SGT
轻量评测
已完成
2026-04-13 03:01 SGT
轻量评测
已完成
2026-04-12 03:02 SGT
轻量评测
已完成
2026-04-11 03:01 SGT
轻量评测
已完成
2026-04-10 03:01 SGT
轻量评测
已完成
2026-04-09 03:01 SGT
轻量评测
已完成
2026-04-08 03:02 SGT
轻量评测
已完成
2026-04-07 03:01 SGT
轻量评测
已完成
2026-04-06 03:01 SGT
轻量评测
已完成
2026-04-05 03:01 SGT
轻量评测
已完成
2026-04-04 03:31 SGT
轻量评测
已完成
social_monitor
2026-04-04 03:01 SGT
轻量评测
已完成
2026-04-03 03:01 SGT
轻量评测
已完成
2026-04-02 03:01 SGT
轻量评测
已完成
2026-04-01 03:01 SGT
轻量评测
已完成
2026-03-31 03:01 SGT
轻量评测
已完成
2026-03-30 03:31 SGT
轻量评测
已完成
social_monitor
2026-03-30 03:01 SGT
轻量评测
已完成
2026-03-29 03:01 SGT
轻量评测
已完成
2026-03-28 03:02 SGT
轻量评测
已完成
2026-03-27 05:05 SGT
轻量评测
已完成
2026-03-25 00:11 SGT
轻量评测
已完成
2026-03-24 00:00 SGT
版本升级
赢政指数 v6 正式上线
方法论升级
• 题库从 200 题扩展至 212 题,新增 12 道诚信压力测试题
• 维度体系重构:主榜只包含
代码执行和材料约束两个可审计核心维度• 新增
工程判断任务表达侧榜(标注 AI 辅助评估)• 新增
诚信评级门槛机制(pass/warn/fail),诚信不达标的模型主榜封顶• 主榜公式:core_overall = 0.55 × 代码执行 + 0.45 × 材料约束
• 稳定性、可用性、性价比降级为运行信号,不再混入主榜权重
判分引擎
• 新增 exact_rank 判分器,支持诚信压力测试的封闭式排序判分
• 评测并行架构升级至 55 进程(11 模型 × 5 能力层),full run 耗时约 15 分钟
社交舆情监控(新功能)
• 每日自动监控 11 个模型在 X/Twitter 上的用户反馈
• 舆情异常时自动触发定向复测,与评测数据交叉验证
• 每日自动监控 AI 厂商官方账号动态
数据页重建
• 原始数据页重建为摘要 + 分页模式,页面大小从 29MB 降至 64KB
• 不再公开题目原文和预期答案,防止题库污染
SEO 与口径统一
• 全站旧维度名(编程/知识工作/长文本)统一替换为 v6 表述
• 清理参数页、旧路由等 SEO 污染 URL
2026-03-22 14:05 SGT
轻量评测
已完成
2026-03-21 12:11 SGT
轻量评测
已完成
判分 v5:引入严格判分分层(strict/non-strict):新增 4 种严格判分类型(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value),严格题只给 0 或 100 不给部分分。排名题、True/False 判断题、单值数值题等标记为 strict=true
题库 v4:题库从 89 题扩充到 100 题(编程 33 + 知识 45 + 长上下文 22),新增 11 道高质量决策题,覆盖矛盾信息识别、信息不足诚实度、优先级排序、利益冲突检测、代码 review 陷阱、伦理边界
2026-03-21 01:21 SGT
轻量评测
已完成
判分 v5:引入严格判分分层(strict/non-strict):新增 4 种严格判分类型(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value),严格题只给 0 或 100 不给部分分。排名题、True/False 判断题、单值数值题等标记为 strict=true
题库 v4:题库从 89 题扩充到 100 题(编程 33 + 知识 45 + 长上下文 22),新增 11 道高质量决策题,覆盖矛盾信息识别、信息不足诚实度、优先级排序、利益冲突检测、代码 review 陷阱、伦理边界
2026-03-21 01:19 SGT
题库变更
题库 v4:新增 11 道高质量决策题
新增 11 道高质量决策题,覆盖矛盾信息识别(2题)、信息不足诚实度(2题)、优先级排序(2题)、利益冲突检测(2题)、代码 review 陷阱(2题)、伦理边界(1题)。总题库从 89 题扩充到 100 题。题库版本升级为 v4。
2026-03-21 01:05 SGT
模型变更
新增 3 个评测模型:Grok 3、豆包 Pro、文心一言 4.0
新增 3 个评测模型:Grok 3(xAI)、豆包 Pro(字节跳动)、文心一言 4.0(百度)。评测模型总数从 8 个增加到 11 个。
2026-03-21 01:05 SGT
轻量评测
已完成
判分 v5:引入严格判分分层(strict/non-strict):新增 4 种严格判分类型(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value),严格题只给 0 或 100 不给部分分。排名题、True/False 判断题、单值数值题等标记为 strict=true
题库 v3:题库从 80 题扩充到 89 题(编程 33 + 知识 34 + 长上下文 22),知识工作新增工程判断力题组(9 题),覆盖技术选型、架构权衡、故障排查等实战场景
2026-03-21 00:59 SGT
轻量评测
已完成
判分 v5:引入严格判分分层(strict/non-strict):新增 4 种严格判分类型(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value),严格题只给 0 或 100 不给部分分。排名题、True/False 判断题、单值数值题等标记为 strict=true
题库 v3:题库从 80 题扩充到 89 题(编程 33 + 知识 34 + 长上下文 22),知识工作新增工程判断力题组(9 题),覆盖技术选型、架构权衡、故障排查等实战场景
2026-03-20 12:55 SGT
轻量评测
已完成
判分 v5:引入严格判分分层(strict/non-strict):新增 4 种严格判分类型(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value),严格题只给 0 或 100 不给部分分。排名题、True/False 判断题、单值数值题等标记为 strict=true
题库 v3:题库从 80 题扩充到 89 题(编程 33 + 知识 34 + 长上下文 22),知识工作新增工程判断力题组(9 题),覆盖技术选型、架构权衡、故障排查等实战场景
2026-03-20 03:10 SGT
轻量评测
已完成
判分 v5:引入严格判分分层(strict/non-strict):新增 4 种严格判分类型(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value),严格题只给 0 或 100 不给部分分。排名题、True/False 判断题、单值数值题等标记为 strict=true
题库 v3:题库从 80 题扩充到 89 题(编程 33 + 知识 34 + 长上下文 22),知识工作新增工程判断力题组(9 题),覆盖技术选型、架构权衡、故障排查等实战场景
2026-03-19 03:11 SGT
轻量评测
已完成
判分 v5:引入严格判分分层(strict/non-strict):新增 4 种严格判分类型(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value),严格题只给 0 或 100 不给部分分。排名题、True/False 判断题、单值数值题等标记为 strict=true
题库 v2:题库从 30 题扩充到 80 题(编程 33 + 知识 25 + 长上下文 22),编程新增动态规划和并发分析,知识工作新增复利计算、时区推理等多步推理题
2026-03-18 03:11 SGT
轻量评测
已完成
判分 v5:引入严格判分分层(strict/non-strict):新增 4 种严格判分类型(exact_rank、exact_boolean_set、exact_numeric_set、exact_json_value),严格题只给 0 或 100 不给部分分。排名题、True/False 判断题、单值数值题等标记为 strict=true
题库 v2:题库从 30 题扩充到 80 题(编程 33 + 知识 25 + 长上下文 22),编程新增动态规划和并发分析,知识工作新增复利计算、时区推理等多步推理题
2026-03-17 03:10 SGT
轻量评测
已完成
判分 v2:引入六种判分方法(全部命中、部分命中、精确匹配、正则、顺序匹配、JSON 结构校验),开始有比较正式的评分体系
题库 v1:初始题库 30 题,覆盖编程、知识工作、长上下文三个维度