两场开源奇袭:阿里2.4万亿参数与智谱神秘牛模同周揭幕

阿里巴巴Qwen3.8-Max以2.4万亿参数MoE架构开源,同期智谱AI旗下Z.ai将神秘"牛模"Ox Alpha揭晓为GLM-5.3-Flash,320B参数、MIT许可证、API定价仅0.075美元/百万token。两款模型从不同方向夹击OpenAI与Anthropic的闭源护城河,让2026年8月成为开源大模型的分水岭周。

2026年8月的最后一周,AI开源社区经历了一次罕见的双重冲击。阿里巴巴Qwen团队正式开放2.4万亿参数MoE巨型模型Qwen3.8-Max的权重下载,数天后智谱AI旗下Z.ai确认其此前在OpenRouter平台神秘运行的"Ox Alpha"正是GLM-5.3-Flash——一个320亿激活参数、MIT完全开源、当周成为OpenRouter最受欢迎模型的多模态系统。

两种开源路径,两套策略

Qwen3.8-Max走的是能力优先路线。据官方博客,该模型总参数2.4万亿,每次推理激活950亿,底层架构延续Qwen3.5引入的Gated DeltaNet与稀疏MoE混合设计,支持100万token上下文,覆盖文本、图像和视频输入。阿里将其定位为"首次开源Qwen-Max级别模型",意味着此前最强的商业版本能力今天可以在私有服务器上自由运行。

GLM-5.3-Flash走的则是反差路线。Z.ai先让模型以匿名身份"Ox Alpha"在OpenRouter上线,公开宣称这是"为编码和持续agent工作而生的前沿模型",但拒绝透露研发方。据CNET报道,Ox Alpha当周跻身OpenRouter最受欢迎榜首,全部流量通过国产AI芯片提供服务。身份揭晓后,Z.ai母公司股价随即上涨(Bloomberg数据)。

这种"先测试市场反应、再官宣"的策略在没有品牌光环的情况下以实际表现建立信任,数据胜过PR稿件。

推理成本:26倍的鸿沟

两款模型的对比重点在于定价结构。Qwen3.8-Max托管API定价为每百万输入token 2美元、输出6美元;GLM-5.3-Flash的公开API定价为每百万输入token 0.075美元,输出0.25美元,9月9日前享受5折优惠期。即便不考虑折扣,GLM-5.3-Flash的输入成本仍比Qwen3.8-Max低约26倍。

这种差距源于架构选择,而非倾销策略。GLM-5.3-Flash总参数320B,但每token仅激活18B,典型的"大而稀疏"推理设计;Qwen3.8-Max虽然激活参数高达950亿,但2.4万亿的总量意味着更高的显存与带宽压力。两者针对的是不同细分市场:GLM-5.3-Flash适合高并发生产部署,Qwen3.8-Max则更适合对精度要求极高的专业任务。

GLM-5.3-Flash的模型权重本身超过300GB,私有化部署所需的算力并不轻量,MIT许可证的"自由"在实践中仍受制于基础设施成本。

编码与agent:两者都在押注同一赛道

两款模型的发布材料均将编码能力和长链agent任务列为核心卖点。

Qwen3.8-Max宣称在代码生成、复杂多步骤任务规划上相较前一代有"全面提升",并新增了reasoning_effort可调参数,让开发者可以在响应速度与推理深度之间权衡。GLM-5.3-Flash则在延续GLM-5.1的1M长上下文基础上,专门针对"持续agent工作"优化——能使用浏览器、操作桌面应用,将模型从问答工具推向自主执行层。

据第三方评测平台BenchLM.ai数据,GLM-5.3在agent编码子任务上表现突出;Qwen3.8-Max在多模态推理和宽泛能力测试上领先,但在部分核心编码基准上仍落后于Claude Fable 5。两者各有所长,并未形成"一统天下"的格局。

国产开源浪潮的深层逻辑

如果把视野拉宽,这两次发布只是2026年上半年中国开源大模型加速周期的延续。同期活跃的还有Kimi K3(2.8万亿参数,号称全球首个3T级开放模型)、DeepSeek-V4系列(1.6万亿总参数),以及月之暗面等实验室的多次迭代。

这一集体行动背后的共同逻辑是开源即渗透。通过将权重公开,中国实验室绕过了建立API生态所需的时间成本,直接在全球开发者工具链中占据位置。Hugging Face上的下载量、OpenRouter上的调用量,都是比商务合同更快速的市场份额积累方式。

据apifox的市场分析,2026年上半年中国主要大模型API价格已经历至少6轮下调,通用token正逼近零毛利边界。在这种价格战格局下,Qwen和GLM选择同时以"能力旗舰"姿态出击,是在告诉市场:中国开源模型的天花板已经不再是"够用就好",而是真正进入前沿竞争序列。

开发者该怎么选

从实际部署角度看,选择逻辑相对清晰。需要高并发、成本敏感、任务类型偏向编码和文档处理的团队,GLM-5.3-Flash的性价比难以忽视;需要多模态能力全覆盖、长链复杂推理、且不依赖私有化部署的场景,Qwen3.8-Max的生态兼容性(支持vLLM、SGLang等主流框架)和更大的激活参数量提供了更稳的上限。

两者都不是"买入就安全"的选择。Qwen3.8-Max的私有化部署对硬件要求极为严苛,GLM-5.3-Flash的300GB+权重同样如此。开源的自由,最终还是要拿算力来兑换。

独立判断

这一轮中国开源模型的集中爆发,标志着一个重要转折:开源社区已无需用"够便宜"来为中国模型辩护,而是可以直接讨论"够不够强"。Qwen3.8-Max和GLM-5.3-Flash都在编码与agent两个最具实用价值的维度做出了可验证的能力声明,并通过开放权重允许独立核实。

社区能否维持活跃的微调与部署生态,模型在实际生产环境(而非基准测试)中的表现是否稳定,这两点决定了这次开源能否真正改变竞争格局。