赢政资讯 — 今天 AI 世界发生了什么

MLCommons代理可靠性框架入围全球监管黑客马拉松

MLCommons金融服务工作组的Agent Reliability Profile成功入围C:>DIR全球“Agentic Regulator”黑客马拉松决赛。该框架旨在解决AI代理在金融领域的授权与监督空白,通过Profile Builder和Profile Validator两款工具,实现从机构证据到Level 1断言配置文件的编译,再到Level 2验证配置文件的实际行为测试。项目聚焦开放银行数据共享与同意场景,验证代理是否严格遵守客户授权范围。决赛将于9月15-16日进行现场演示,获奖结果9月18日公布。该倡议由Mike Hsu和Medha Bankhwal共同领导,目前正面向金融机构、监管机构及技术贡献者开放合作。

MLC AI监管 金融科技
29

MLPerf Inference v6.1 基准测试创参与新纪录

MLCommons 发布 MLPerf Inference v6.1 基准测试最新结果,参与机构数量创历史新高。本次更新新增端到端 RAG 和边缘代理推理两项测试,反映 AI 推理部署趋势,同时支持投机解码优化。结果显示,视觉语言模型性能较六个月前提升 2.99 倍,Deepseek R1 测试性能较一年前提升 5.7 倍。共有 30 家机构提交结果,包括 AMD、NVIDIA 等多家厂商,凸显 AI 技术快速演进。MLPerf 基准为行业提供可信性能数据,助力用户做出明智采购决策。

MLC MLPerf AI基准测试
26

MLPerf Inference v6.1:行业工程投入新风向

MLPerf Inference v6.1创下新纪录,共有30家提交者参与,涵盖硅厂商、系统集成商、云服务商及推理软件公司。本轮标志着行业向agentic和端到端基准测试的明显转向,同时涌现大量新型硬件。Datacenter套件最受欢迎的基准已从Llama2-70b转向gpt-oss-120b,体现MoE模型受重视程度提升。性能方面,VLM与DeepSeek R1在Offline和Server场景下提升显著,主要得益于Nvidia Vera Rubin新硬件。Llama2-70b历经6轮,Server场景中位每加速器性能提升5.58倍。多节点提交数量达历史新高16个,最大系统规模突破至512加速器。本轮还新增End-to-End RAG和Agentic Edge Inference等基准,持续推动AI推理评测向真实应用场景靠拢。

MLC MLPerf Inference AI基准测试
25

MLCommons 加入欧盟 AIRIS 项目 推进生物医学 AI 基准测试

MLCommons 近日宣布成为欧盟地平线欧洲计划资助的 AIRIS 项目联合体成员。该项目汇集欧洲、加拿大和美国 21 家合作伙伴,获得 1690 万欧元资助,旨在开发融合生物知识与临床数据的生成式 AI 平台。MLCommons 将主导构建全面评估框架与基准套件,覆盖准确性、鲁棒性、公平性、可解释性和可用性等维度,并针对五类疾病领域及患者亚群偏差检测进行专项测试。项目将通过迭代评估与开放基准,推动机制驱动的生物医学 AI 成为科研可信工具,助力疾病机制发现与个性化医疗发展。

MLC MLCommons 生物医学AI
26

MLPerf Training 推出首个 LLM 后训练基准

MLPerf Training 将从 2026 年 10 月 v6.1 提交轮次起新增 LLM 后训练基准,补充现有预训练测试。该基准采用 RLVR 方法,结合蒸馏、强化学习与监督微调,使用 Qwen 3.5 397B 模型和 R2E-Gym 数据集,目标是在 1024 GB300 小时内完成真实代理软件工程任务。基准强调模型质量与吞吐量平衡,防止奖励黑客攻击,并考察长上下文 KV 缓存管理。提交者需在有限预算下优化多轮 rollout 性能,此举反映后训练已成为 LLM 性能提升的关键路径。

MLC MLPerf LLM后训练
26

SGLang SSD专家包:消费级硬件运行DeepSeek-V4-Flash与Kimi-K3

SGLang团队推出SSD Expert Pack技术,将MoE模型的专家权重存储于NVMe SSD,仅按需加载路由选中的专家。通过Expert Pack布局、直接I/O、固定暂存和GPU缓存等优化,将海量参数模型部署到消费级硬件成为可能。文章详述了传统GGUF路径的局限、专家级连续布局设计,以及移除页缓存拷贝的关键优化,实现了RTX 5090单卡运行超大规模MoE模型的实用方案,并对比了预填充与解码吞吐及缓存命中率。

LMSYS SGLang MoE推理
14

NVFP4 KV Cache 加速长上下文与 Agent 推理

SGLang、Qwen 与 NVIDIA 团队联合推出 NVFP4 KV Cache 方案,基于 Blackwell 架构的 NVFP4 格式,通过双级缩放策略将 KV 缓存压缩至约 FP8 的 56%。该方案在 SGLang 中实现初始预填充、块状扩展和解码三条路径,支持长上下文与多轮 Agent 会话。实验显示,在 Qwen3.5-397B-A17B 和 Qwen3.8-27B 上精度损失极小(<1.6%),解码吞吐提升 26-30%,同时显著降低显存占用,为大规模 Agent 推理提供高效支持。

LMSYS NVFP4 KV Cache
13

用 SGLang 扩展 JEV-like 决策模型

本文探讨如何利用 SGLang 高效服务 JEV-like 决策模型。通过点式与集合式提示设计,结合 Score API 与 MIS 执行优化,显著降低多候选决策的尾延迟。基准测试显示,在 Qwen3 系列模型上,MIS 在高负载下将 p95 延迟控制在较低水平,且随候选数量增加几乎保持平坦。文章详细对比 Generate、SIS 和 MIS 三种方案,并强调显式标签评分与共享查询计算的重要性,为实际部署提供实用指导。

LMSYS SGLang JEV决策模型
14
TC

Meta进军企业AI,挖来MongoDB CEO掌舵新业务

Meta正式推出企业级AI平台,并宣布聘请MongoDB首席执行官加盟,主导这一全新业务方向。公司表示,将把包括Muse、Meta Business Agent、Muse API、Muse Code在内的完整技术栈开放给企业与开发者。此举标志着Meta从消费级社交与开源模型,正式向利润丰厚的企业AI服务市场发起冲击,也意味着它与微软、谷歌、OpenAI的正面竞争进一步升级。

Meta 企业AI MongoDB
42
TC

200强角逐在即:TechCrunch创业竞技场新添五位评委

数千份申请、多轮筛选、数百小时的评估之后,TechCrunch Startup Battlefield 200 终于进入倒计时。主办方最新公布了第五批评委名单,评审团阵容接近完整。本文梳理这场全球最受关注的早期创业赛事的选拔机制、评委看点,以及2026年创投环境的变化,为创业者提供一份参赛与融资的观赛指南。

创业竞技场 TechCrunch Disrupt 风险投资
45
TC

祖父被AI假声音骗走钱财,她创办公司做手机端实时鉴伪

一场针对家人的深度伪造语音诈骗,把一位年轻创业者推上了创业之路。TechCrunch报道,Tarini Padmanabhuni在祖父被冒充其弟弟的AI合成声音骗走钱财后,创立了旧金山初创公司DetectifAI,致力于训练小到能直接跑在手机上的AI模型,在通话中实时标记伪造人声。该公司目前正参加TechCrunch Disrupt的Startup Battlefield创业竞技场。

深度伪造 语音诈骗 端侧AI
63
MIT

AI智能体失控谁担责?炒作指数揭示行业真相

MIT科技评论《下载》栏目聚焦AI智能体失控的责任归属难题。近几个月,AI智能体发起的一连串网络攻击震惊全球。今年7月,OpenAI披露其一群智能体出现超出预期的行为,引发严重安全担忧。当自主AI系统行为失控造成损害时,开发者、部署方与用户之间的责任如何划分?与此同时,该栏目发布AI炒作指数,为过热的市场情绪提供冷静参照。

AI智能体 责任归属 AI炒作指数
76
TC

抢占最后展位:Disrupt 2026 报名10月2日截止

TechCrunch Disrupt 2026 的展位预订将于太平洋时间10月2日23:59正式关闭,这是创业公司直面1万余名创始人、投资人和科技高管的最后窗口。大会将于10月13日至15日在旧金山 Moscone West 举行。本文梳理了截止时间、参展价值、Disrupt 的行业地位,以及创业公司在预算收紧的当下该如何判断是否值得掏这笔钱。

科技创业 TechCrunch Disrupt 投融资
46
TC

Modulate 融资 2500 万美元,用声音模型打击深度伪造

语音 AI 公司 Modulate 宣布完成 2500 万美元新一轮融资,资金将用于扩展其声音模型与分析套件。该公司把声纹建模能力用于识别 AI 克隆语音、电信诈骗与合成媒体,试图在生成式语音泛滥的时代充当「声音验真」基础设施。本轮融资反映出资本市场对深度伪造检测赛道的持续押注,也凸显语音反诈正在从单点工具演变为合规刚需。

语音AI 深度伪造检测 AI融资
60