AI 代码能力评测

154 篇文章 · 第 1/8 页
哪个 AI 模型写代码最强?HumanEval 和 MBPP 是常用基准,但它们只测函数级补全,与真实开发场景差距大。赢政指数的代码执行维度(Execution)在隔离沙箱中运行模型生成的完整程序,验证编译通过率、运行时正确性和边界处理能力,是目前少数采用真实代码执行验证的独立评测。本专题追踪各模型的代码能力排名、编程工具动态和 AI 辅助编程的行业实践。

深度指南

横评 Gemini 2.5 Pro 诚信评级 fail 探针 25 分,主榜 18.37 分代码执行仅 23.50
Gemini 2.5 Pro 在 2026-08-21 Run#288 的 Smoke 快测中诚信评级 fail,探针得分 25.00,主榜 18.37 分,代码执行 23.50 分,材料约束 12.10 分。同日其余模型诚信均为 pass 或 warn,探针得分 40-90 分不等。
2026-08-21
横评 GPT-5.5 Smoke评测主榜暴跌10.1分 材料约束单日掉16.3
GPT-5.5今日Smoke评测主榜从98.35分跌至88.27分,降幅10.1分。其中材料约束从100.00分跌至83.70分,代码执行从97.00分跌至92.00分。工程判断保持75.00分不变,任务表达下降10分,诚信评级维持pass。
2026-08-20
横评 Claude Opus 4.7主榜暴跌8.2分,材料约束单日掉12.1
Claude Opus 4.7今日Smoke评测主榜从98.35分跌至90.16分,材料约束从100.00暴跌至87.90,代码执行降5分。单日10题测试下,材料约束维度成为最大拖累。
2026-08-20
Cursor推代码托管平台,正面挑战GitHub
AI代码编辑器开发商Cursor宣布推出全新的代码托管平台,意图挑战开发者长期依赖的GitHub。该公司抓住部分开发者对GitHub的不满情绪,将AI能力融入代码托管流程,提供更智能的协作体验。此举有望重塑代码托管市场格局。
2026-08-19
横评 豆包 Pro 材料约束单日跌40.9分 代码执行升25分主榜下滑4.7
豆包 Pro 今日 Smoke 评测中材料约束从90.90分跌至50.00分,代码执行从75.00分升至100.00分,主榜从82.16分降至77.50分。单日10题测试下,材料约束暴跌40.9分成为主因,需区分题目抽签波动与真实能力退化。
2026-08-19
横评 豆包 Pro 主榜暴跌12.6分 代码执行单日跌25分
豆包 Pro 今日 Smoke 评测主榜从94.74分跌至82.16分,代码执行从100.00分降至75.00分,材料约束微升至90.90分。单日10题抽样导致的波动是主因,工程判断与任务表达保持稳定,诚信评级仍为pass。
2026-08-18
横评 DeepSeek V4 Pro代码执行暴跌41.7分 主榜单日跌19.2
DeepSeek V4 Pro今日Smoke评测主榜从70.44分跌至51.24分,代码执行从66.70分直接跌至25.00分,材料约束反而升至83.30分。单日41.7分降幅远超正常抽签波动范围,需持续观察。
2026-08-17
横评 Claude Sonnet 4.6代码执行从100分跌至75分 主榜下滑5.5分
今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单日10题测试下,此类波动需结合多日数据判断是否为抽签影响。
2026-08-16
横评 Claude Opus 4.7代码执行75.00分 材料约束100.00分 主榜反升3.7
Claude Opus 4.7今日Smoke评测代码执行从99.60分跌至75.00分,材料约束从61.70分升至100.00分,主榜从82.55分升至86.25分。工程判断降11.1分,任务表达持平。单日10题抽样波动或为主要原因,需持续观察一致性。
2026-08-16
SpaceX正式完成对AI编程工具Cursor的收购
SpaceX官方宣布已完成对AI编程初创公司Cursor的收购,这意味着备受欢迎的AI代码编辑器正式纳入这家航天巨头麾下。这笔交易虽未披露具体条款,但反映出SpaceX对软件研发效率的重视,也凸显了AI编程工具在严肃工业场景中的巨大潜力。有分析认为,Cursor的加入将帮助SpaceX的工程师更快地
2026-08-16
AI编程新贵Cognition再融资,估值飙至400亿美元
据TechCrunch报道,AI编程初创公司Cognition在完成10亿美元融资、估值达260亿美元仅数月后,又被曝出正洽谈新一轮巨额融资,估值可能高达400亿美元。这家凭借AI编程工具Devin声名鹊起的公司,正以惊人速度刷新行业纪录,也折射出AI编程赛道的持续火爆。
2026-08-13
横评 Gemini 2.5 Pro 主榜暴跌9.1分,代码执行单日狂降29.6
Gemini 2.5 Pro今日Smoke评测主榜79.41分,较昨日下降9.1分。其中代码执行从99.60暴跌至70.00,材料约束则升至90.90。单日10题抽样导致的波动值得持续观察。
2026-08-13
Lovable确认133亿美元新估值,再融4亿美元
AI应用构建平台Lovable确认完成新一轮4亿美元融资,估值达到133亿美元,较上一轮大幅提升。公司透露,其年化经常性收入在6月已突破5亿美元,本轮融资进一步验证了生成式AI编程赛道的商业潜力。
2026-08-13
横评 GLM-4.6代码执行跌12.5分 材料约束满分推主榜升5.4
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
2026-08-12
Anthropic默认开启Claude Code自动模式,AI编程再少人工干预
Anthropic宣布将Claude Code的自动模式设为默认选项,这意味着开发者无需频繁确认即可让AI自主完成多步骤编程任务。此举旨在提升编码效率,但也引发关于代码质量与安全风险的讨论。本文详解Claude Code自动模式的变化、行业影响及潜在挑战,并编译自TechCrunch报道。
2026-08-10
横评 Claude Sonnet 4.6代码执行暴跌19.5分 主榜却逆势上涨13.8分
今日Smoke评测中,Claude Sonnet 4.6代码执行从94.50分跌至75.00分,材料约束从43.30分升至97.80分,主榜从71.46分升至85.26分。仅2题抽样导致的波动是主因,整体能力未见系统性退化。
2026-08-08
横评 Claude Opus 4.7代码执行暴跌30.5分 主榜仅降6.4分
Claude Opus 4.7在今日Smoke评测中代码执行从100.00分跌至69.50分,材料约束从71.90分升至95.00分,主榜从87.36分降至80.98分。工程判断升25分,任务表达升5分。诚信评级维持pass。
2026-08-07
横评 Grok 4 材料约束暴跌17.6分 主榜仅降1.8分
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一材料约束异常值得重点追踪。
2026-08-07
Cloudflare开源‘氛围编程’平台,为非程序员打造
Cloudflare近日宣布,将内部使用的AI代理工作区全面开源。该平台专为‘氛围编程’(vibe-coding)设计,允许用户以自然语言与AI代理交互,自动完成代码编写、调试和部署等任务。这一举措不仅能让非程序员轻松构建应用,也可能重塑软件开发流程。本文梳理了平台的核心功能、Cloudflare开
2026-08-07
横评 GLM-4.6 Smoke评测主榜74分 代码执行82.3材料约束95 API故障缺维度
GLM-4.6今日Smoke评测因API故障/超时导致integrity与communication维度缺失,主榜得分74.00,代码执行82.30,材料约束95.00,工程判断70.80,任务表达无数据,已进入自动补跑且不参与本期排名。
2026-08-02