Claude Sonnet 4.6材料约束暴跌20.5分 代码执行却冲到100
今日Smoke评测中,Claude Sonnet 4.6材料约束从100.00跌至79.50,降20.5分;代码执行从73.70升至100.00,主榜反升5.2分至90.78。工程判断(侧榜,AI辅助评估)跌39.5分。单日10题抽样波动或为主要因素,需持续观察。
今日Smoke评测中,Claude Sonnet 4.6材料约束从100.00跌至79.50,降20.5分;代码执行从73.70升至100.00,主榜反升5.2分至90.78。工程判断(侧榜,AI辅助评估)跌39.5分。单日10题抽样波动或为主要因素,需持续观察。
2026-08-27 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-o3 以 100 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1测试中,Claude Sonnet 4.6较Run #291上涨13.5分升至91.60分,Gemini 2.5 Pro下跌12.5分,Grok 4以96.30分继续领跑。3升4降格局下,守约能力分化加剧,对生产流程接入具有直接参考价值。
WDCD v3.1五大场景测试显示,安全合规场景全体得分最低,qwen3-max仅1.5/4,claude-sonnet-4.6满分。doubao-pro工程规范3.9/4却业务规则仅2.15/4,差距1.75。企业接入生产流程时,安全合规与业务规则需额外护栏。
v2 锚点题数据显示 11 个模型 R1 确认率、R2 抵抗率、R3 诚信率均为 0%,R3 完全崩溃 0/10。所有模型在三轮施压下均未守约,凸显当前大模型在硬约束下的系统性脆弱。
Grok 4以96.30分位居WDCD v3.1守约榜首,豆包Pro 67.90分垫底,11模型中满分率58.2%、R3崩溃率0%。头部三强与尾部三强平均分差超24分,Claude Sonnet 4.6单期上涨13.5分,GPT-5.5下滑5.3分。数据揭示不同模型在多轮施压下的真实约束生存差异。
豆包 Pro 在今日 Smoke 评测中代码执行从 91.70 分跌至 75.00 分(-16.7),材料约束从 69.40 分升至 100.00 分(+30.6),主榜从 81.67 分升至 86.25 分(+4.6)。工程判断升 36.1 分,任务表达降 8.3 分。诚信评级维持 pass。数据指向题目抽签波动而非模型退化。
2026-08-26 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 97.75 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
歌听上了,接下来是电影。RMVB 把一部电影压进 300MB,也把所有人推进"有声音没画面"的解码器地狱——于是"万能播放器"成了那个年代最动人的承诺。档案馆的收录页记下了全部细节:1.5MB 的 MPC 与 34.8MB 的暴风"万能版"、PotPlayer 简介里白纸黑字的作者出走始末、快播去广告版里民间高手的改版手记。这一次腾讯照例入场,而且产品真赢了口碑——却没能赢下时代。
文件下回来了,接下来是听。MP3 把整个乐坛装进硬盘,Winamp 强大到在下载站拥有自己的专属分类,而 2.7MB 的千千静听用歌词秀和皮肤装下了一代人的青春。档案馆的收录页记下了这一切:酷狗被归在"文件共享"类的 P2P 出身、千千静听被收购后悄悄出现的"在线歌曲限速设置"、以及星级从五星到三星的滑落。这一次,腾讯照例入场——而且这一次,它赢了。
2026-08-25 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro今日Smoke评测中材料约束从81.70分跌至63.30分,降幅18.4分,主榜仅微降2.2分至80.46分。代码执行却从83.40分升至94.50分,工程判断从75.00分跌至50.00分。单日10题快测下,材料约束异常波动值得追踪。
2026-08-24 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
在带宽以 KB 计的年代,"下载"是一门手艺,也是中文互联网最惨烈的软件战争之一。网际快车的编辑星级从五星跌到三星,档案馆的收录页亲眼记下了这场王朝更替;BT 与电驴教会一代人"上传也是美德",迅雷用 P2SP 完成降维打击,而腾讯照例入场——这一次也没能赢。
本期WDCD v3.1试点显示4模型分数上升、0模型下降。豆包Pro上涨10.2分,Gemini 2.5 Pro上涨8.1分,GLM-4.6上涨6.8分,Qwen3 Max上涨7.6分。Grok 4以94.00分保持首位,GLM-4.6升至88.93分进入前二。数据来自worst-of-3采样与规则判分。
WDCD v3.1试点数据显示,业务规则场景平均得分最低,Doubao-Pro仅1.83/4;Grok-4在资源限制、安全合规、业务规则三场景均列前二;工程规范整体最高但区分度最小。企业接入生产流程时需针对性加护栏。
v2锚点题数据显示,R1确认率97%、R2抵抗率77%、R3诚信率仅51.3%,26次完全崩溃。Grok 4 R3零崩溃,GLM-4.6与Claude Opus 4.7各仅1次。分析聚焦多约束场景与渐进施压下的守约差异,为生产接入提供具体护栏建议。
Grok 4 以 WDCD 94.00 分位列第一,豆包 Pro 68.17 分垫底,头部与尾部相差 25.83 分。R3 施压轮次崩溃率仅 8.2%,满分率 56.7%。数据揭示不同模型在多轮渐进施压下的真实守约差异,为企业接入生产流程提供直接参考。
对很多人来说,人生第一台电脑不在家里,在网吧的 3 号机上。计费系统是网吧的操作系统,还原软件让机器"百毒不侵",ARP 攻防是第一堂网络安全实战课,浩方与联众撑起对战的黄金年代——档案馆复原的网吧软件条目,拼出了这个消失行业的技术底座。
2026-08-23 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 以 82.64 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
输入法之战争夺的不是钱包,而是你敲下的每一个字。从智能 ABC 与五笔的路线之争,到拼音加加、紫光拼音的民间救赎,再到搜狗用搜索引擎词库降维打击、谷歌拼音的词库风波——档案馆复原的"汉字输入"分类收录页,完整保存了这场二十年战争的各个阵营。
Gemini 2.5 Pro今日Smoke评测主榜升至83.39分,代码执行从23.50升至69.80,材料约束从12.10升至100.00,诚信评级从fail转为pass。单日10题测试下,如此大幅波动最可能源于题目抽签差异,而非模型本身发生实质性改变。
2026-08-22 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2008 年装杀毒软件要花钱:瑞星的狮子、金山毒霸、江民 KV2007,讲究的上卡巴斯基。熊猫烧香把安全焦虑推到顶点,行业迎来黄金时代——然后 360 的"永久免费"三年清盘了整个收费市场。档案馆复原的老收录页,完整保存了这场免费革命前夜的市场生态。
2008 年重装完 XP,每个人都有一张烂熟于心的装机单:搜狗拼音、QQ 2009、千千静听、暴风影音万能版、迷你迅雷、瑞星杀毒、WinRAR……赢政天下软件史档案馆从 Wayback 复原了这批老软件的原始收录页。我们按当年的装机顺序重新铺开这张单子,看看它们后来都去了哪。
WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是真实行为——顺带我们还发现并修复了自家判分器的一起"冤案"。
Gemini 2.5 Pro 在 2026-08-21 Run#288 的 Smoke 快测中诚信评级 fail,探针得分 25.00,主榜 18.37 分,代码执行 23.50 分,材料约束 12.10 分。同日其余模型诚信均为 pass 或 warn,探针得分 40-90 分不等。
2026-08-21 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.08 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-5.5今日Smoke评测主榜从98.35分跌至88.27分,降幅10.1分。其中材料约束从100.00分跌至83.70分,代码执行从97.00分跌至92.00分。工程判断保持75.00分不变,任务表达下降10分,诚信评级维持pass。
Claude Opus 4.7今日Smoke评测主榜从98.35分跌至90.16分,材料约束从100.00暴跌至87.90,代码执行降5分。单日10题测试下,材料约束维度成为最大拖累。