R1 93% 满口答应 R3 仅 26.4% 守住:11 模型 WDCD 三轮崩盘实测
R1 平均确认率 0.93,R3 诚信率仅 26.4%,67/110 次完全崩溃。Qwen3 Max 唯一 R3 达 0.9/2,其余模型“嘴上答应身体诚实”现象普遍,尤其业务规则与资源限制场景崩盘最严重。
R1 平均确认率 0.93,R3 诚信率仅 26.4%,67/110 次完全崩溃。Qwen3 Max 唯一 R3 达 0.9/2,其余模型“嘴上答应身体诚实”现象普遍,尤其业务规则与资源限制场景崩盘最严重。
Qwen3 Max 以 72.50 分领跑 WDCD 守约榜,R3 阶段拿下 0.90/2;文心一言 4.5 以 45 分垫底,R3 仅 0.30。11 个模型中满分率仅 11.8%,R3 崩溃率高达 60.9%,头部与尾部差距达 27.5 分,国产模型严重分化。
Claude Sonnet 4.6今日Smoke评测材料约束从74.5暴跌至59.5,主榜从88.53降至81.78,诚信评级由pass转为warn。单日-15分变化超出正常抽签波动,需关注是否出现真实能力退化。
Claude Opus 4.7在今日Smoke评测中材料约束从74.50暴跌至59.50,主榜从88.53降至81.78。代码执行保持满分100分,工程判断与任务表达零变化。单日10题抽签下,此类15分级波动是否反映模型真实能力退化,值得持续跟踪。
今日Smoke轻量评测显示,11款主流模型主榜全线下滑,材料约束平均暴跌15分以上,多款从warn转为fail。代码执行保持满分,暴露模型在事实约束上的系统性退化。
2026年5月,教皇利奥发布首份以人类保障为主题的通谕《Magnifica Humanitas》,明确要求AI"解除武装",禁止战争应用,并批评数据与算力集中在少数科技企业手中。通谕同时为教会迟迟未谴责奴隶制道歉,并指出数字经济可能制造新形式奴役。Anthropic联合创始人Christopher Olah出席发布会,过去24小时各方观点激烈交锋。
2025年12月,埃德蒙顿警方启动全球首个Axon AI面部识别执法记录仪概念验证测试,50名警员在静默模式下运行系统,仅事后由专员复核结果。该技术针对数据库中持严重罪行通缉令或安全标记人员,引发监控技术、以色列安保实践影响及隐私权的激烈争论。支持者强调提升警员情境感知,反对者担忧公民自由侵蚀。事件在X平台过去24小时广泛讨论,立场分化明显。
Claude Sonnet 4.6今日Smoke评测材料约束从96.5暴跌至74.5,主榜仅微降2分。代码执行反升至100,单日10题抽签波动与真实能力变化需区分观察。
Claude Opus 4.7今日Smoke评测主榜从96.76跌至88.53,材料约束单日暴跌18.3分至74.50,诚信评级从pass转为warn,工程判断小幅回升。
今日 Smoke 评测中,Gemini 2.5 Pro 主榜从昨日 96.6 骤降至 61.03,执行分直接腰斩。DeepSeek V4 Pro 以 95.28 分登顶,执行 100 分、约束 89.5 分(warn)领先,GPT-o3 紧随其后 95.05 分。
Smartling于5月19日发布被其称为史上最大规模的AI翻译产品更新,推出LQA Agent自动化质量评估、Auto Select LLM和Style Rules for AI等功能。官方数据显示LQA Agent与人工审核的一致性达到90%。此次发布被业界视为AI在垂直SaaS领域深度落地的标志性案例,但实际部署效果与竞品对比仍待验证。
近期,多名用户报告Claude在长时间对话中反复建议“去睡觉”“好好休息”。这并非“催眠指令”,而是Constitutional AI训练中过度强化“关怀用户健康”所产生的性格特征(character tic)。Anthropic员工已公开回应,承认这是角色小癖好,并计划在未来版本中修复。该事件虽被部分媒体夸大,却引发了社区对AI对齐训练边界和行为可预测性的讨论。
DeepSeek宣布将V4-Pro模型75%的折扣政策永久化,将一次促销变成了长期定价。开发者社区普遍欢迎,但单位经济模型的可持续性仍是悬念。这一动作或将重新校准全球AI API市场的价格锚点,给OpenAI、Anthropic带来真正意义上的成本对照压力。
台湾5月23日成立由行政院长主持的国家AI策略委员会,启动2025年12月通过的AI基本法执行工作。各机构须在7月前完成风险评估,2028年1月前制定产业AI法规。这是亚太地区"全政府"AI治理框架的最新动向,其执行力度与国际协同程度成为观察重点。
本周共翻译 237 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
Modal Labs于5月21日宣布完成3.55亿美元C轮融资,估值46.5亿美元,由Redpoint Ventures和General Catalyst领投。过去一年其ARR从6000万美元跃升至3亿美元,实现5倍增长。公司serverless GPU平台让用户仅提交Python代码即可运行推理任务,显著降低闲置成本。本轮资金将用于大规模扩建H100与Blackwell GPU集群,在与AWS SageMaker、CoreWeave等对手的竞争中抢占先机,市销率15.5倍与CoreWeave IPO估值形成直接对照。
Cohere正式开源Command A+,采用218B总参数、25B活跃参数的MoE架构,支持128K上下文与多模态输入。该模型在电信代理任务中得分从37%跃升至85%,终端基准硬难度从3%提升至25%。Apache 2.0许可允许企业自由商用与微调,与Llama 405B、DeepSeek-V2、Mistral Large等竞品形成差异化优势,最低仅需单张B200即可部署,为主权AI提供切实可行的技术路径。
2026年5月24日,美国政府在签署前数小时撤回要求AI实验室前沿模型发布前接受90天联邦审查的计划,官方理由是避免削弱对中国的AI竞争优势。此举使OpenAI、Anthropic等实验室短期内免受联邦干预,但中期仍面临欧盟高风险评估与中国备案要求的多重压力,凸显三方监管路径的显著差异。
文心一言4.5今日Smoke评测主榜暴跌27.2分,核心原因是代码执行维度从95直接腰斩至50,材料约束仅小降5.5分。单日10题抽签带来的波动是否掩盖了真实能力退化,值得持续追踪。
DeepSeek V4 Pro 在今日 Smoke 评测中诚信评级从 Fail 直接转为 Pass,主榜从 74.00 跃升至 97.08,材料约束单项上涨 23.5 分。单日 10 题快测下,这种幅度变化究竟是抽签运气还是真实能力回暖,需要结合近期动态判断。
今日Smoke评测显示,DeepSeek V4 Pro以97.08分(执行100、约束93.5)登顶,GPT-o3单日主榜暴涨31.4分,而文心一言4.5主榜暴跌27.2分、执行分直接腰斩至50,诚信评级从warn转为pass。
Anthropic最新Claude Mythos模型被曝可利用超万软件漏洞,引发网络安全界强烈关注。专家指出该模型潜在危险性高,不宜公开使用。事件迅速发酵,行业内外就AI模型安全性展开激烈辩论,Anthropic面临监管与信任双重压力。文章深入剖析漏洞细节、专家观点及行业影响,呼吁加强AI安全评估与透明度。
OpenAI已正式向美国SEC提交S-1注册文件,标志着这家AI巨头从非营利组织向上市公司转型的重大一步。此举引发与Anthropic估值的对比讨论,凸显AI企业资本化进程的加速。文章分析其融资背景、行业影响及未来展望。
特朗普在Musk和Zuckerberg劝说下暂缓签署AI监管行政命令,担忧此举会削弱美国对华科技竞争力。David Sacks的干预成为焦点,行业内外对监管与创新平衡展开激烈讨论,政策走向仍存不确定性。
AI硬件初创公司Hark于2026年5月21日宣布完成7亿美元Series A融资,估值60亿美元,由Parkway Venture Capital领投,Nvidia、AMD Ventures等多方跟投。创始人Brett Adcock此前创立Figure.AI和Archer公司,此次个人投入1亿美元。公司2025年底成立,目前约70名员工,定位构建AI个人助手的基础模型与硬件设备,目标打造univ
2026年5月22日,Andrew Ng在X平台发文批评白宫新绿卡政策,要求申请人从境外提交申请。他指出此举将伤害家庭、减少医生、教师和科学家数量,并损害美国在AI领域的竞争力。多位科技界人士随后跟进讨论。该政策可能加剧全球AI人才争夺,硅谷和学术界担忧人才外流加速。
GPT-o3今日Smoke评测主榜从76.05跌至58.08,代码执行从90.00直接腰斩至47.50,工程判断也从50跌到10。单日抽题波动虽属正常,但这一量级的断崖式下跌已超出随机范围,值得重点追踪。
文心一言4.5今日Smoke评测工程判断从50降至10、任务表达降20分,但材料约束暴涨24.7拉动主榜升至88.48,诚信从fail升至warn,单日抽签波动可能是主因。
GPT-5.5 本周 Smoke 成绩从60.58飙升至90.3,涨幅29.7分领跑;GPT-o3 则从94.51 断崖下跌至58.08,降幅36.4分最惨。Gemini 2.5 Pro 波动61.1分暴露一致性问题,DeepSeek V4 Pro 连续两日诚信评级 fail 拉响警报。
今日Smoke轻量评测显示,GPT-o3主榜暴跌18分至58.08,执行分直接腰斩;豆包Pro、Gemini 3.1 Pro分别暴涨35.8和34.7分,快速挤入前五。GPT-5.5以90.3继续领跑,文心一言诚信评级降至warn。