海外AI精选

精选TechCrunch、MIT科技评论、WIRED等全球顶尖科技媒体AI报道中文,如转载中文请标注本站出处。

TechCrunch MIT Tech Review VentureBeat WIRED AI News

MLPerf Client v2.0 发布:新增图像生成与智能体AI基准

MLCommons近日推出MLPerf Client v2.0基准测试套件,扩展了对AI PC的评估能力。新版本新增图像生成和Agentic AI类别,同时升级LLM推理测试,支持Phi 4 Mini Instruct和Qwen 3 8B模型。该基准涵盖笔记本、台式机和工作站等设备,测量本地AI工作负载的响应性和吞吐量。合作方包括AMD、Intel、Microsoft和NVIDIA,代码已开源至GitHub,供开发者免费下载使用。

MLC MLPerf Client AI基准测试
566

SGLang 实现 Muse Glimmer Day-0 支持,优化本地 Agentic 推理

Meta Superintelligence Labs 与 SGLang 团队合作,为 30B 参数多模态模型 Muse Glimmer 带来 Day-0 支持。该模型具备 128k+ 上下文窗口,专为本地 Agentic 工作流设计。SGLang 通过 SM120 后端和 MLX 后端提供高性能优化,在 RTX 5090 上实现最高 1452 tok/s 总吞吐和 236 tok/s 单用户解码速度,支持 DFlash 推测解码、RadixAttention 前缀缓存等特性,并兼容 BF16、NVFP4、GGUF 等多种量化格式,覆盖 NVIDIA 和 Apple Silicon 硬件平台。

LMSYS SGLang Muse Glimmer
418

统一基数缓存:混合模型前缀缓存的单一树结构

本文介绍SGLang的Unified Radix Cache方案,通过单一radix tree拓扑解决混合模型(FULL、SWA、MAMBA等组件)的KV缓存复用难题。组件机制分离共享前缀身份与特定复用规则,支持HiCache跨GPU L1、Host L2、外部L3多层扩展,以及会话感知驱逐策略。实验显示DeepSeek-V4等多模型在多轮对话中命中率达96.8%-98%,TTFT显著降低,同时Rust核心实现进一步优化长前缀场景性能。该设计避免了组合类爆炸,保持树核心通用性,为新型混合架构提供灵活扩展路径。

LMSYS SGLang 前缀缓存
377

SGLang 实现 NVIDIA Nemotron 3.5 Lightning 零日支持

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供零日支持。该模型采用 30B 参数混合专家架构,仅激活 3B 参数,专为高吞吐量代理任务设计,支持最长 1M 上下文长度。模型支持多令牌预测、DFlash 和 DSpark 等推测解码技术,可实现高达 4 倍吞吐提升。SGLang 提供 OpenAI 兼容接口、推理开关控制和预算设置,方便企业定制化部署。Nemotron 3.5 Lightning 在 PinchBench 等基准上展现出优异的效率表现,适合本地助手、金融风控、网络安全等场景。

LMSYS SGLang NVIDIA Nemotron
411

SGLang 实现 Qwen3.8 模型 Day-0 支持

SGLang 与 Miles 团队携手 Qwen、NVIDIA 等,为 Qwen3.8-2.4T-A95B 提供 Day-0 支持。该模型拥有 2.4T 总参数、95B 激活参数,采用混合注意力架构,对服务栈状态管理提出新挑战。文章详述混合 GDN/GQA 注意力、MoE 路由、NVFP4 量化、ReplaySSM 状态恢复、Chunked PP Prefill 及 PD 解耦等关键技术,并展示 FP8/NVFP4 下的高吞吐表现与 RL 训练结果。SGLang 通过 FlashInfer 内核优化与 Unified Radix Cache,实现高效 prefix caching 与 speculative decoding,显著提升 8K/1K 场景下的每 GPU token 吞吐。

LMSYS SGLang Qwen3.8
413

SGLang 高级 CUDA Graph 技术解析

本文深入探讨 SGLang 在 CUDA Graph 上的创新实践。通过重构 Runner/Backend 架构,SGLang 实现了 Breakable CUDA Graph(BCG)等高效策略,在不牺牲兼容性、启动时间和内存的前提下,最大化捕获工作负载。BCG 已成为预填充阶段默认方案,相比 eager 执行提速 1.70 倍,全捕获达 1.93 倍。文章详细解析全图、breakable 分段及内存管理机制,并展示其在 decode、prefill 及投机解码中的灵活应用,为 LLM 推理引擎性能优化提供重要参考。

LMSYS SGLang CUDA Graph
385

Miles v0.1:生产级前沿后训练系统

Miles v0.1是前沿后训练的全栈生产就绪系统,继承slime设计理念,围绕“验证、干净、可定制”原则优化RL训练循环每个阶段。系统支持SGLang驱动的异步Rollout、TITO会话服务器、R3路由重放及低精度训练等特性,实现准确、高效、可靠且可扩展的agentic RL训练。本文详解其RL循环、Rollout机制、训练优化及评估模式,为研究者和开发者提供完整实践指南。

LMSYS 后训练 强化学习
335
TC

AI芯片公司Etched一个月估值翻倍至210亿美元

量化交易巨头Jane Street安装了AI芯片初创公司Etched首个发货的AI集群系统,并对性能印象深刻,随即领投新一轮大规模融资。受此推动,Etched的估值在一个月内翻倍至210亿美元。这标志着专用AI推理芯片正获得市场高度认可,也表明在英伟达主导的AI芯片市场,差异化路线依然能创造巨大价值。Etched的崛起,或为AI基础设施竞争格局带来新的变量。

AI芯片 Etched 估值飙升
258
AIN

Alvys发布AI代理平台,货运TMS自动化再提速

货运软件提供商Alvys推出代理式AI平台Alvys Foundry,该平台可在其运输管理系统(TMS)中直接实现运营任务自动化。支持预构建与自定义AI代理,能与现有货运数据和工作流无缝集成。已提供20余种预构建代理,覆盖关键运营场景,帮助承运商和经纪人简化流程、提升效率、降低人为错误。这标志着代理式AI在货运管理领域的重要落地。

AI代理 运输管理系统 货运科技
238
MIT

AI自我改进没那么快:递归进化愿景与现实差距

AI行业宣称AI很快将在几乎无需人类监督的情况下自我改进,大型语言模型已能编写代码、生成合成数据、优化芯片,看似递归自我改进近在眼前。但深入剖析后会发现,数据循环、评估难题和目标错位等瓶颈依然存在。本文梳理现状与技术局限,指出AI自我进化或比预期更慢,人类监督仍是关键。

递归自我改进 AI自主进化 合成数据
310
MIT

AI使用报告背后:我们仍不知道真实用户行为

人工智能公司Anthropic和OpenAI定期发布用户行为报告,展示人们如何使用Claude和ChatGPT等产品。然而,研究人员指出,这些报告只选择性地披露数据,缺乏独立来源验证真实使用情况。斯坦福大学计算机科学博士生Anka Reuel认为,这种信息不对称让我们无法真正了解AI的实际影响和风险。本文分析了这些报告背后的局限,并呼吁建立更透明的数据披露机制。

AI使用报告 数据透明度 人工智能
308
MIT

月球时代开启,宇航员角色迎剧变

NASA Artemis II的四名宇航员今年绕月飞行,创造出人类离地球最远的新纪录,比1972年阿波罗13号多出约4000英里。尽管未在月球表面着陆,这次任务却标志着宇航员角色的根本转变——从传统飞行员与驾驶员,到需要兼顾科学研究、地质考察、工程运维甚至跨文化协作的综合型探索者。商业航天与长期月球驻留规划,也正重新定义着“宇航员”的内涵。本文编译自MIT Technology Review。

宇航员 Artemis II 月球探索
223
TC

Anthropic年化收入飙至650亿美元

据TechCrunch报道,AI初创公司Anthropic的年化收入在短短两个月内增加了180亿美元,达到惊人的650亿美元。这一数字不仅彰显了大型语言模型商业化的加速度,也印证了企业级AI需求的爆发式增长。分析指出,Anthropic凭借Claude系列模型的安全性与可靠性,已成为企业AI市场的核心玩家。但高额研发与算力支出、激烈的行业竞争,仍对其长期盈利能力构成考验。

Anthropic AI收入 人工智能
375
TC

AI自动化创企Relay关闭,团队加入谷歌Chrome团队

专注于AI代理自动化技术的初创公司Relay宣布关闭,其团队成员将加入谷歌Chrome团队,负责浏览器内置AI研发。创始人Jacob Bank表示,Chrome将推出“雄心勃勃”的AI功能,帮助用户更高效地完成任务。分析认为,此次整合是谷歌加码浏览器AI竞争的重要信号,未来Chrome或将深度集成智能代理能力,让浏览器自主执行跨站任务。

AI自动化 谷歌 Chrome
392