跳到主内容
赢政指数
赢政资讯
AI 专题
Winzheng Lab
WDCD
订阅
中文
中文
English
日本語
首页
›
专题
›
AI 代码能力评测
AI 代码能力评测
202 篇文章 · 第 1/11 页
哪个 AI 模型写代码最强?HumanEval 和 MBPP 是常用基准,但它们只测函数级补全,与真实开发场景差距大。赢政指数的代码执行维度(Execution)在隔离沙箱中运行模型生成的完整程序,验证编译通过率、运行时正确性和边界处理能力,是目前少数采用真实代码执行验证的独立评测。本专题追踪各模型的代码能力排名、编程工具动态和 AI 辅助编程的行业实践。
深度指南
Qwen 3.8 27B 全解:谁做的、开源吗、基准争议与独立评测数据
Warp 软件工厂(Factories)全解:AI 开发的"开箱即用"能走多远
Cognition AI 全解:Devin、4.92 亿 ARR、400 亿估值与 SpaceX 传闻
横评
Claude Sonnet 4.6代码执行暴跌27.4分,材料约束却暴涨37.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从71.90分跌至44.50分,材料约束从50.60分升至88.30分,主榜仅微升1.9分至64.21分。工程判断升至100分,任务表达跌至45分。单日10题抽样下,维度剧烈波动是否反映真实能力退化值得追踪。
2026-10-05
横评
Grok 4代码执行暴跌31.3分 材料约束反升34.7分
Grok 4今日Smoke评测代码执行从95.30分跌至64.00分,降31.3分;材料约束从48.40分升至83.10分,涨34.7分。主榜仅降1.6分至72.60分。单日10题抽签导致的波动是主因,需持续观察。
2026-10-05
横评
GPT-6.1 Sol主榜暴跌9.2分 代码执行单日降16.7分
GPT-6.1 Sol今日Smoke评测主榜从86.25分跌至77.07分,代码执行从75.00分降至58.30分,材料约束维持100.00分,工程判断维持100.00分,任务表达升至87.50分。单日10题测试下,代码执行维度波动最大。
2026-10-03
横评
Gemini 2.5 Pro 材料约束暴跌28分 代码执行却升至100分
Gemini 2.5 Pro今日Smoke评测中材料约束从100.00分跌至72.00分,代码执行从71.90分升至100.00分,主榜微升至87.40分。单日10题抽样导致的波动与真实能力退化需区分判断。
2026-10-03
横评
GLM-4.6 材料约束 100 分代码执行 41.70 分 诚信探针仅 15 分
GLM-4.6 在 2026-10-02 Smoke 快测中材料约束达到 100.00 分,代码执行仅 41.70 分,主榜 67.94 分,诚信评级 fail(探针 15.00)。当日 14 个模型中仅 GLM-4.6 触发诚信探针,其余模型探针得分均在 55 分以上。
2026-10-02
谷歌发布Gemini 4 Argon,号称史上最强模型
谷歌正式发布新一代大模型Gemini 4 Argon,官方称其为迄今最强模型,定位为编程与网络安全领域的“主力干将”。此举被视为谷歌在AI军备竞赛中回应OpenAI、Anthropic等对手的关键一步,也预示着大模型竞争正从通用能力比拼,转向垂直专业场景的深耕。
2026-10-01
横评
GPT-5.5代码执行暴跌22分 材料约束却飙升25.9分
GPT-5.5今日Smoke评测中代码执行从72.00降至50.00,材料约束从69.10升至95.00,主榜仅微降0.5分至70.25。工程判断维持100.00,任务表达降8.3分,诚信评级保持pass。单日维度剧烈波动但整体排名影响极小。
2026-10-01
横评
Qwen3 Max代码执行暴跌24分 主榜下滑7.4分
今日Smoke评测中Qwen3 Max代码执行从94.00分跌至70.00分,主榜从84.51分降至77.16分,材料约束则从72.90分升至85.90分。工程判断与任务表达两项侧榜得分上升,诚信评级维持pass。
2026-10-01
横评
GPT-o3代码执行暴跌21.8分 材料约束反升33.5分 主榜微涨
今日Smoke评测中,GPT-o3代码执行从93.80分跌至72.00分(-21.8),材料约束从49.30分升至82.80分(+33.5),主榜从73.78分升至76.86分,诚信评级由warn转为pass。单日10题抽签导致的波动是主因。
2026-09-30
横评
Claude Opus 4.7代码执行72分材料约束85分 Smoke评测主榜微降2.4分
Claude Opus 4.7今日Smoke评测代码执行从100.00降至72.00,材料约束从56.00升至85.00,主榜从80.20降至77.85。单日10题测试下,代码执行-28分与材料约束+29分形成鲜明对比,需区分题目抽签波动与真实能力变化。
2026-09-30
横评
GPT-o3代码执行暴跌24.5分 主榜掉15.2,抽签还是真实退化
GPT-o3今日Smoke评测主榜从96.01跌至80.78分,代码执行单项暴跌24.5分至72.50,材料约束微降3.9分。工程判断保持100分,任务表达反升15分。分析显示此次大跌最可能源于2题抽签波动,而非模型整体退化。
2026-09-28
横评
Claude Opus 4.7 Smoke评测主榜跌13.9分 代码执行单日暴跌22分
Claude Opus 4.7今日Smoke评测主榜从96.01分跌至82.16分,代码执行从97.00分跌至75.00分,降幅22分;材料约束小降3.9分,任务表达从50.00分升至80.00分,工程判断维持100.00分。
2026-09-28
横评
GPT-5.5 Smoke评测主榜暴跌12.5分 代码执行单日跌28分
GPT-5.5今日Smoke评测主榜从91.32分跌至78.80分,代码执行从100.00暴跌至72.00,材料约束反升至87.10。单日10题抽签下,代码执行维度2题表现显著下滑,其他维度持平或上升,需区分题目波动与真实能力变化。
2026-09-27
Supabase用户数据暴露警钟
TechCrunch报道称,部分Supabase客户因配置不当,将大量用户数据公开暴露在互联网上。事件并非平台整体被攻破,而是凸显AI生成应用、低代码和“氛围编程”在快速上线时容易忽视权限、数据库规则与安全审计,进而让个人信息面临泄露风险。
2026-09-26
Lovable年化收入破6亿美元,氛围编程席卷全球
瑞典AI编程平台Lovable年化收入突破6亿美元,联合创始人Fabian Hedin透露平台上创建的应用每月获得近10亿次浏览。随着"氛围编程"概念走红,非技术人员也能通过自然语言构建应用,Lovable正成为这一趋势的领跑者。
2026-09-25
Grok 4.7发布:DeepSWE基准71%、按量计费比半悖论背后的真实成本
xAI于2026年9月21日发布Grok 4.7,DeepSWE v1.1基准以高强度设置达到71.0%,CursorBench 4.0提升至46.3%,每百万token定价维持$2/$6不变。但据Artificial Analysis测算,该模型完成单任务的token消耗较Grok 4.6增加12
2026-09-23
横评
GPT-o3代码执行暴跌32.5分 主榜从96.01跌至80.48
GPT-o3今日Smoke评测主榜从96.01分跌至80.48分,代码执行维度从97.00暴跌至64.50,材料约束反升至100.00。单日10题小样本测试下,执行能力出现显著波动,侧榜工程判断下降11.6分,任务表达上升25分,诚信评级维持pass。
2026-09-23
横评
Grok 4 代码执行从96.30分跌至69.50分,主榜单日下滑10分
Grok 4今日Smoke评测主榜从90.86分降至80.89分,代码执行维度暴跌26.8分至69.50分,材料约束反升10.6分至94.80分。工程判断侧榜跌25分,任务表达侧榜升20分。单日10题抽签导致的波动与模型真实能力变化需区分判断。
2026-09-23
横评
Grok 4材料约束暴跌15.8分 主榜从95.44滑至90.86
Grok 4今日Smoke评测材料约束从100.00跌至84.20,主榜下滑4.6分至90.86,代码执行反升至96.30。工程判断(侧榜)同步跌18.8分,诚信评级转为pass。单日10题抽签波动是否掩盖真实退化,值得持续追踪。
2026-09-22
横评
Claude Sonnet 4.6材料约束暴跌15.8分 代码执行反升47分
Claude Sonnet 4.6今日Smoke评测主榜升至91.24分,但材料约束从100.00分跌至84.20分,降15.8分,代码执行则从50.00分跃升至97.00分。单日两题抽样导致的波动仍是主因,需持续观察 grounding 维度是否出现系统性退化。
2026-09-22
1
2
3
4
»
相关专题
AI 评测基准对比
指令遵从与守约测试
OpenAI 专题
Anthropic 专题
AI 安全专题