Research Lab
Leaderboards tell you who's stronger. Lab tells you why.
排行榜回答"谁更强",Lab 负责回答"为什么"。
独立研究 / 数据驱动 / 开放验证 / 零赞助
我们不收任何 AI 公司的钱。不做"合作评测",不做"赞助报告",不做"评测前沟通"。赢政指数的每一分都是系统跑出来的,不是谈出来的。
研究亮点
动态语境衰变
约束在多轮对话中如何被遗忘?我们量化了从 R1 确认理解到 R3 完全妥协之间的衰减曲线,揭示模型"答应了但记不住"的真实规律。
否定窗口技术
区分"引用违规"和"执行违规"的判分创新。当模型说"我不会提供 X"时,X 出现在否定语境中不算违规,只有真正执行才扣分。
零 AI 裁判
为什么用规则代替 AI 判分更可信?WDCD 全部使用关键词匹配 + 正则规则判分,100% 可审计、可复现,消除"让 AI 评判 AI"的循环依赖。
数据透明
评测数据 API 开放
所有原始分数和回答均可通过 REST API 获取
判分规则完全公开
每道题的违规关键词和评分逻辑均可审查
嵌入式 Widget 可用
一行代码嵌入 WDCD 排行榜到任何网页
全部代码可审计
评测框架、判分引擎、数据管道的技术方法论完整公开
我们在拆什么
最新拆解 查看全部 →
REPORT
用对手造武器:DeepSeek Harness 的开发流水线,是一面照向整个行业的镜子
08-14
REPORT
开着门让你蒸的人,和焊死门防你蒸的人:DeepSeek 争议里被忽略的不对称
08-14
REPORT
"蒸馏"指控满一年:所有人都在指控,为什么没有一份证据能上法庭?
08-14
REPORT
违约不等于违法:当"国产自主"的 agent 框架,跑在一条被禁用的美国工具链上
08-14
REPORT
我们逐行验证了 DeepSeek Harness:它不是"泄露代码改的"——但 commit 历史里藏着另一个故事
08-14
REPORT
WDCD Run #276: Grok 4 Leads with 94.8 Points as Average Instruction Decay Hits -18.2%
08-12