2026年9月17日,Z.ai发布长篇技术博客,披露此前匿名测试的“牛Alpha”即GLM-5.3-Flash模型已全量运行在超过10万张国产AI加速器上,性能较初始基线提升三倍,单token成本达到主流方案可比水平。
事实还原
GLM-5.3-Flash于2026年8月26日发布,是GLM-5系列首个原生多模态模型,采用320B总参数、18B激活参数的混合稀疏与线性注意力架构。在发布前,该模型以ox-alpha名称在OpenCode和OpenRouter平台匿名测试,一周内成为两平台使用量最高模型,六天内处理超过62万亿token。
博客指出,此前无人操作过如此规模的国产加速器集群。芯片显存容量与带宽有限、生态不成熟、内核支持不完整,工程师需猜测未文档化的驱动行为。团队在SGLang基础上自研推理引擎,并由GLM-5.3驱动的Infra Agent完成大量基础设施优化。
机制拆解
Z.ai提出“密集反馈方法”,将正确性测试、运行日志、执行轨迹、微基准与端到端指标整合为可重复工作流,使Agent能在本地验证假设。反馈需满足本地化、低成本及时获取、支持客观验证三项属性。
具体案例包括:通过分区与非分区内核路径对比,发现KDA内核Context Parallelism路径中tl.dot默认使用TF32导致精度问题,修复后合并至Flash Linear Attention上游;DeepEP v1.2.1中intranodedispatch与intranodecombine未释放Python GIL,修复后KV Transfer差距从20%以上降至1%以内;Agent从SGLang等项目提炼优化骨架,对KDA Decode内核应用除法优化与V维瓦片合并,实现1.71倍加速。
产业影响
该实践显示,国产加速器在显存与生态限制下,通过自研引擎与AI辅助优化可在两周内达到生产就绪。模型从初始适配到生产部署的快速迭代,依赖Encode-Prefill-Decode解耦架构、W8A8量化及混合精度缓存等技术组合。
战略判断
【分析】上述案例表明,AI辅助基础设施构建可能降低对成熟生态的依赖,但仍需验证在更大规模与更复杂负载下的长期稳定性;若类似方法在其他国产集群复制,将改变推理成本结构与供应链格局。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接