赢政资讯 — 今天 AI 世界发生了什么

MLCommons代理可靠性框架入围全球监管黑客马拉松

MLCommons金融服务工作组的Agent Reliability Profile成功入围C:>DIR全球“Agentic Regulator”黑客马拉松决赛。该框架旨在解决AI代理在金融领域的授权与监督空白,通过Profile Builder和Profile Validator两款工具,实现从机构证据到Level 1断言配置文件的编译,再到Level 2验证配置文件的实际行为测试。项目聚焦开放银行数据共享与同意场景,验证代理是否严格遵守客户授权范围。决赛将于9月15-16日进行现场演示,获奖结果9月18日公布。该倡议由Mike Hsu和Medha Bankhwal共同领导,目前正面向金融机构、监管机构及技术贡献者开放合作。

MLC AI监管 金融科技
2

MLPerf Inference v6.1 基准测试创参与新纪录

MLCommons 发布 MLPerf Inference v6.1 基准测试最新结果,参与机构数量创历史新高。本次更新新增端到端 RAG 和边缘代理推理两项测试,反映 AI 推理部署趋势,同时支持投机解码优化。结果显示,视觉语言模型性能较六个月前提升 2.99 倍,Deepseek R1 测试性能较一年前提升 5.7 倍。共有 30 家机构提交结果,包括 AMD、NVIDIA 等多家厂商,凸显 AI 技术快速演进。MLPerf 基准为行业提供可信性能数据,助力用户做出明智采购决策。

MLC MLPerf AI基准测试
2

MLPerf Inference v6.1:行业工程投入新风向

MLPerf Inference v6.1创下新纪录,共有30家提交者参与,涵盖硅厂商、系统集成商、云服务商及推理软件公司。本轮标志着行业向agentic和端到端基准测试的明显转向,同时涌现大量新型硬件。Datacenter套件最受欢迎的基准已从Llama2-70b转向gpt-oss-120b,体现MoE模型受重视程度提升。性能方面,VLM与DeepSeek R1在Offline和Server场景下提升显著,主要得益于Nvidia Vera Rubin新硬件。Llama2-70b历经6轮,Server场景中位每加速器性能提升5.58倍。多节点提交数量达历史新高16个,最大系统规模突破至512加速器。本轮还新增End-to-End RAG和Agentic Edge Inference等基准,持续推动AI推理评测向真实应用场景靠拢。

MLC MLPerf Inference AI基准测试
3

MLCommons 加入欧盟 AIRIS 项目 推进生物医学 AI 基准测试

MLCommons 近日宣布成为欧盟地平线欧洲计划资助的 AIRIS 项目联合体成员。该项目汇集欧洲、加拿大和美国 21 家合作伙伴,获得 1690 万欧元资助,旨在开发融合生物知识与临床数据的生成式 AI 平台。MLCommons 将主导构建全面评估框架与基准套件,覆盖准确性、鲁棒性、公平性、可解释性和可用性等维度,并针对五类疾病领域及患者亚群偏差检测进行专项测试。项目将通过迭代评估与开放基准,推动机制驱动的生物医学 AI 成为科研可信工具,助力疾病机制发现与个性化医疗发展。

MLC MLCommons 生物医学AI
3

MLPerf Training 推出首个 LLM 后训练基准

MLPerf Training 将从 2026 年 10 月 v6.1 提交轮次起新增 LLM 后训练基准,补充现有预训练测试。该基准采用 RLVR 方法,结合蒸馏、强化学习与监督微调,使用 Qwen 3.5 397B 模型和 R2E-Gym 数据集,目标是在 1024 GB300 小时内完成真实代理软件工程任务。基准强调模型质量与吞吐量平衡,防止奖励黑客攻击,并考察长上下文 KV 缓存管理。提交者需在有限预算下优化多轮 rollout 性能,此举反映后训练已成为 LLM 性能提升的关键路径。

MLC MLPerf LLM后训练
4

SGLang SSD专家包:消费级硬件运行DeepSeek-V4-Flash与Kimi-K3

SGLang团队推出SSD Expert Pack技术,将MoE模型的专家权重存储于NVMe SSD,仅按需加载路由选中的专家。通过Expert Pack布局、直接I/O、固定暂存和GPU缓存等优化,将海量参数模型部署到消费级硬件成为可能。文章详述了传统GGUF路径的局限、专家级连续布局设计,以及移除页缓存拷贝的关键优化,实现了RTX 5090单卡运行超大规模MoE模型的实用方案,并对比了预填充与解码吞吐及缓存命中率。

LMSYS SGLang MoE推理
1

NVFP4 KV Cache 加速长上下文与 Agent 推理

SGLang、Qwen 与 NVIDIA 团队联合推出 NVFP4 KV Cache 方案,基于 Blackwell 架构的 NVFP4 格式,通过双级缩放策略将 KV 缓存压缩至约 FP8 的 56%。该方案在 SGLang 中实现初始预填充、块状扩展和解码三条路径,支持长上下文与多轮 Agent 会话。实验显示,在 Qwen3.5-397B-A17B 和 Qwen3.8-27B 上精度损失极小(<1.6%),解码吞吐提升 26-30%,同时显著降低显存占用,为大规模 Agent 推理提供高效支持。

LMSYS NVFP4 KV Cache
2

用 SGLang 扩展 JEV-like 决策模型

本文探讨如何利用 SGLang 高效服务 JEV-like 决策模型。通过点式与集合式提示设计,结合 Score API 与 MIS 执行优化,显著降低多候选决策的尾延迟。基准测试显示,在 Qwen3 系列模型上,MIS 在高负载下将 p95 延迟控制在较低水平,且随候选数量增加几乎保持平坦。文章详细对比 Generate、SIS 和 MIS 三种方案,并强调显式标签评分与共享查询计算的重要性,为实际部署提供实用指导。

LMSYS SGLang JEV决策模型
1
TC

Meta进军企业AI,挖来MongoDB CEO掌舵新业务

Meta正式推出企业级AI平台,并宣布聘请MongoDB首席执行官加盟,主导这一全新业务方向。公司表示,将把包括Muse、Meta Business Agent、Muse API、Muse Code在内的完整技术栈开放给企业与开发者。此举标志着Meta从消费级社交与开源模型,正式向利润丰厚的企业AI服务市场发起冲击,也意味着它与微软、谷歌、OpenAI的正面竞争进一步升级。

Meta 企业AI MongoDB
39
TC

200强角逐在即:TechCrunch创业竞技场新添五位评委

数千份申请、多轮筛选、数百小时的评估之后,TechCrunch Startup Battlefield 200 终于进入倒计时。主办方最新公布了第五批评委名单,评审团阵容接近完整。本文梳理这场全球最受关注的早期创业赛事的选拔机制、评委看点,以及2026年创投环境的变化,为创业者提供一份参赛与融资的观赛指南。

创业竞技场 TechCrunch Disrupt 风险投资
45
TC

祖父被AI假声音骗走钱财,她创办公司做手机端实时鉴伪

一场针对家人的深度伪造语音诈骗,把一位年轻创业者推上了创业之路。TechCrunch报道,Tarini Padmanabhuni在祖父被冒充其弟弟的AI合成声音骗走钱财后,创立了旧金山初创公司DetectifAI,致力于训练小到能直接跑在手机上的AI模型,在通话中实时标记伪造人声。该公司目前正参加TechCrunch Disrupt的Startup Battlefield创业竞技场。

深度伪造 语音诈骗 端侧AI
62
MIT

AI智能体失控谁担责?炒作指数揭示行业真相

MIT科技评论《下载》栏目聚焦AI智能体失控的责任归属难题。近几个月,AI智能体发起的一连串网络攻击震惊全球。今年7月,OpenAI披露其一群智能体出现超出预期的行为,引发严重安全担忧。当自主AI系统行为失控造成损害时,开发者、部署方与用户之间的责任如何划分?与此同时,该栏目发布AI炒作指数,为过热的市场情绪提供冷静参照。

AI智能体 责任归属 AI炒作指数
75
TC

抢占最后展位:Disrupt 2026 报名10月2日截止

TechCrunch Disrupt 2026 的展位预订将于太平洋时间10月2日23:59正式关闭,这是创业公司直面1万余名创始人、投资人和科技高管的最后窗口。大会将于10月13日至15日在旧金山 Moscone West 举行。本文梳理了截止时间、参展价值、Disrupt 的行业地位,以及创业公司在预算收紧的当下该如何判断是否值得掏这笔钱。

科技创业 TechCrunch Disrupt 投融资
46
TC

Modulate 融资 2500 万美元,用声音模型打击深度伪造

语音 AI 公司 Modulate 宣布完成 2500 万美元新一轮融资,资金将用于扩展其声音模型与分析套件。该公司把声纹建模能力用于识别 AI 克隆语音、电信诈骗与合成媒体,试图在生成式语音泛滥的时代充当「声音验真」基础设施。本轮融资反映出资本市场对深度伪造检测赛道的持续押注,也凸显语音反诈正在从单点工具演变为合规刚需。

语音AI 深度伪造检测 AI融资
59