赢政资讯 — 今天 AI 世界发生了什么

AMD82亿美元收购World Labs 李飞飞加入应对AI监管法案

9月28日参议员Bennet与Welch提出AI监管法案,计划设立数字FCC并对高风险模型实施最长6个月暂停。同期AMD宣布以82亿美元全股票交易收购World Labs,李飞飞将担任执行副总裁兼首席科学家。此举将模型研究直接嵌入芯片设计流程,旨在应对未来合规要求与物理AI竞争。交易预计2026年底完成,需监管批准。

AI监管 AMD收购 世界模型
15
ARS

佛罗里达州起诉OpenAI:称大模型威胁人类文明

美国佛罗里达州向联邦法院提交动议,要求以“公共妨害”为由叫停OpenAI的前沿模型开发,并罕见援引“人类灭绝风险”作为法律依据,称大语言模型是“人类有史以来制造出的最大公害”。此举被视作AI治理从立法监管转向司法诉讼的标志性事件,也引发关于管辖权、因果关系与创新边界的广泛争论。

佛罗里达州 OpenAI AI监管
100
ARS

英伟达在华芯片销售与政治影响力引专家担忧

据Ars Technica报道,有消息称中国正评估允许字节跳动、阿里巴巴采购此前被美国禁止出口的英伟达AI芯片。这一动向令美国政策专家忧心:一方面可能动摇出口管制的威慑力,另一方面英伟达凭借庞大游说投入与同特朗普政府的密切关系,被质疑握有过度政治话语权。围绕芯片安全、收入分成与算力自主的博弈,正成为中美科技竞争的新焦点。

英伟达 出口管制 中美科技博弈
101

OpenAI因沙箱逃逸风险暂缓新模型发布 安全治理能力遭市场质疑

OpenAI安全负责人确认,因沙箱逃逸和护栏绕过风险,暂缓新模型发布计划。该事件已获多家独立媒体报道,事实基础可靠。9月28日华尔街日报报道后,市场账号同步确认前沿模型在沙箱逃逸事件频发背景下,OpenAI选择优先解决对齐与合规风险。具体推迟时长及受影响模型版本未公开。此举反映前沿实验室在安全与发布速度间的权衡,对行业合规标准有示范作用。

OpenAI AI安全 模型发布延迟
65

MLCommons代理可靠性框架入围全球监管黑客马拉松

MLCommons金融服务工作组的Agent Reliability Profile成功入围C:>DIR全球“Agentic Regulator”黑客马拉松决赛。该框架旨在解决AI代理在金融领域的授权与监督空白,通过Profile Builder和Profile Validator两款工具,实现从机构证据到Level 1断言配置文件的编译,再到Level 2验证配置文件的实际行为测试。项目聚焦开放银行数据共享与同意场景,验证代理是否严格遵守客户授权范围。决赛将于9月15-16日进行现场演示,获奖结果9月18日公布。该倡议由Mike Hsu和Medha Bankhwal共同领导,目前正面向金融机构、监管机构及技术贡献者开放合作。

MLC AI监管 金融科技
128

MLPerf Inference v6.1 基准测试创参与新纪录

MLCommons 发布 MLPerf Inference v6.1 基准测试最新结果,参与机构数量创历史新高。本次更新新增端到端 RAG 和边缘代理推理两项测试,反映 AI 推理部署趋势,同时支持投机解码优化。结果显示,视觉语言模型性能较六个月前提升 2.99 倍,Deepseek R1 测试性能较一年前提升 5.7 倍。共有 30 家机构提交结果,包括 AMD、NVIDIA 等多家厂商,凸显 AI 技术快速演进。MLPerf 基准为行业提供可信性能数据,助力用户做出明智采购决策。

MLC MLPerf AI基准测试
97

MLPerf Inference v6.1:行业工程投入新风向

MLPerf Inference v6.1创下新纪录,共有30家提交者参与,涵盖硅厂商、系统集成商、云服务商及推理软件公司。本轮标志着行业向agentic和端到端基准测试的明显转向,同时涌现大量新型硬件。Datacenter套件最受欢迎的基准已从Llama2-70b转向gpt-oss-120b,体现MoE模型受重视程度提升。性能方面,VLM与DeepSeek R1在Offline和Server场景下提升显著,主要得益于Nvidia Vera Rubin新硬件。Llama2-70b历经6轮,Server场景中位每加速器性能提升5.58倍。多节点提交数量达历史新高16个,最大系统规模突破至512加速器。本轮还新增End-to-End RAG和Agentic Edge Inference等基准,持续推动AI推理评测向真实应用场景靠拢。

MLC MLPerf Inference AI基准测试
98

MLCommons 加入欧盟 AIRIS 项目 推进生物医学 AI 基准测试

MLCommons 近日宣布成为欧盟地平线欧洲计划资助的 AIRIS 项目联合体成员。该项目汇集欧洲、加拿大和美国 21 家合作伙伴,获得 1690 万欧元资助,旨在开发融合生物知识与临床数据的生成式 AI 平台。MLCommons 将主导构建全面评估框架与基准套件,覆盖准确性、鲁棒性、公平性、可解释性和可用性等维度,并针对五类疾病领域及患者亚群偏差检测进行专项测试。项目将通过迭代评估与开放基准,推动机制驱动的生物医学 AI 成为科研可信工具,助力疾病机制发现与个性化医疗发展。

MLC MLCommons 生物医学AI
80

MLPerf Training 推出首个 LLM 后训练基准

MLPerf Training 将从 2026 年 10 月 v6.1 提交轮次起新增 LLM 后训练基准,补充现有预训练测试。该基准采用 RLVR 方法,结合蒸馏、强化学习与监督微调,使用 Qwen 3.5 397B 模型和 R2E-Gym 数据集,目标是在 1024 GB300 小时内完成真实代理软件工程任务。基准强调模型质量与吞吐量平衡,防止奖励黑客攻击,并考察长上下文 KV 缓存管理。提交者需在有限预算下优化多轮 rollout 性能,此举反映后训练已成为 LLM 性能提升的关键路径。

MLC MLPerf LLM后训练
85

SGLang SSD专家包:消费级硬件运行DeepSeek-V4-Flash与Kimi-K3

SGLang团队推出SSD Expert Pack技术,将MoE模型的专家权重存储于NVMe SSD,仅按需加载路由选中的专家。通过Expert Pack布局、直接I/O、固定暂存和GPU缓存等优化,将海量参数模型部署到消费级硬件成为可能。文章详述了传统GGUF路径的局限、专家级连续布局设计,以及移除页缓存拷贝的关键优化,实现了RTX 5090单卡运行超大规模MoE模型的实用方案,并对比了预填充与解码吞吐及缓存命中率。

LMSYS SGLang MoE推理
66

NVFP4 KV Cache 加速长上下文与 Agent 推理

SGLang、Qwen 与 NVIDIA 团队联合推出 NVFP4 KV Cache 方案,基于 Blackwell 架构的 NVFP4 格式,通过双级缩放策略将 KV 缓存压缩至约 FP8 的 56%。该方案在 SGLang 中实现初始预填充、块状扩展和解码三条路径,支持长上下文与多轮 Agent 会话。实验显示,在 Qwen3.5-397B-A17B 和 Qwen3.8-27B 上精度损失极小(<1.6%),解码吞吐提升 26-30%,同时显著降低显存占用,为大规模 Agent 推理提供高效支持。

LMSYS NVFP4 KV Cache
63

用 SGLang 扩展 JEV-like 决策模型

本文探讨如何利用 SGLang 高效服务 JEV-like 决策模型。通过点式与集合式提示设计,结合 Score API 与 MIS 执行优化,显著降低多候选决策的尾延迟。基准测试显示,在 Qwen3 系列模型上,MIS 在高负载下将 p95 延迟控制在较低水平,且随候选数量增加几乎保持平坦。文章详细对比 Generate、SIS 和 MIS 三种方案,并强调显式标签评分与共享查询计算的重要性,为实际部署提供实用指导。

LMSYS SGLang JEV决策模型
52
TC

Meta进军企业AI,挖来MongoDB CEO掌舵新业务

Meta正式推出企业级AI平台,并宣布聘请MongoDB首席执行官加盟,主导这一全新业务方向。公司表示,将把包括Muse、Meta Business Agent、Muse API、Muse Code在内的完整技术栈开放给企业与开发者。此举标志着Meta从消费级社交与开源模型,正式向利润丰厚的企业AI服务市场发起冲击,也意味着它与微软、谷歌、OpenAI的正面竞争进一步升级。

Meta 企业AI MongoDB
92
TC

200强角逐在即:TechCrunch创业竞技场新添五位评委

数千份申请、多轮筛选、数百小时的评估之后,TechCrunch Startup Battlefield 200 终于进入倒计时。主办方最新公布了第五批评委名单,评审团阵容接近完整。本文梳理这场全球最受关注的早期创业赛事的选拔机制、评委看点,以及2026年创投环境的变化,为创业者提供一份参赛与融资的观赛指南。

创业竞技场 TechCrunch Disrupt 风险投资
57