Qwen 3.8 27B 全解:谁做的、开源吗、基准争议与独立评测数据

最后更新: 2026-08-21 · 本页为常青参考页,随事件进展与最新公开评测数据持续更新
阿里巴巴 Qwen 团队发布的开源模型 Qwen 3.8 27B 在 LiveCodeBench 等基准上超越部分闭源前沿模型,可在消费级硬件运行,但"蒸馏争议"随之而来。本指南梳理发布事实、开源属性、基准争议的两面,以及 Qwen 系模型在独立评测中的实测数据。

Qwen 3.8 27B 是什么

2026 年 8 月,阿里巴巴 Qwen 团队发布开源模型 Qwen 3.8 27B。两个核心卖点:其一,在 LiveCodeBench 等编码基准上的成绩超过部分闭源前沿模型;其二,27B 的参数规模让它可以在消费级硬件上本地运行,无需依赖高端算力。多家独立媒体证实了发布事实。首发报道见:阿里巴巴 Qwen 3.8 27B 开源模型发布

社区反应是典型的两极:一边是"开源编码模型追平闭源"的兴奋,一边是对成绩来源的质疑(详见下文基准争议一节)。

谁做的、开源吗——两个高频问题

谁做的:Qwen(通义千问)是阿里巴巴的大模型系列,由阿里巴巴 Qwen 团队研发,是目前开源阵营中最活跃的厂商系列之一。

开源吗:Qwen 3.8 27B 以开源模型形式发布,权重可下载、可本地部署、可修改——这正是它与 Qwen3 Max 等旗舰 API 模型的关键区别:后者只通过 API 提供服务,前者你可以拿回家自己跑。需要注意"开源"在大模型语境下通常指开放权重(open weights),训练数据与完整训练细节未必公开——这一点恰恰是本次争议的火种。

基准争议:LiveCodeBench 高分从哪来

发布后争议迅速聚焦一点:模型是否通过蒸馏(从更强模型的输出中学习)获得性能提升。由于训练细节未公开披露,这一质疑无法被证实也无法被证伪。支持者认为蒸馏本身是正当技术路线,成绩就是成绩;质疑者认为若靠蒸馏闭源模型的输出刷分,"开源超越闭源"的叙事就变了味。

更普遍的教训是:厂商发布的基准成绩需要独立验证。基准题目可能进入训练数据(污染)、评测口径可能被挑选、单一基准可能被过拟合。社区讨论的共识方向是关注模型的实际运行效果而非宣传指标。

独立评测视角:Qwen 系模型的实测数据

本站赢政指数对 Qwen 旗舰模型做持续独立评测——代码执行维度在隔离沙箱中真实运行模型生成的完整程序(编译、运行、边界处理全部实测),WDCD 测试衡量多轮施压下的指令遵从,全程规则判分、零 AI 裁判。下方表格是最新公开全量评测中 Qwen 系模型的实时成绩(随每次评测自动更新)。

Qwen 3.8 27B 本身尚未进入我们的评测池;若后续纳入,其成绩将出现在主榜。在此之前,对"27B 开源模型 vs 闭源旗舰"的传闻成绩,建议保持"待独立验证"的态度。

本地部署:能跑,但注意预期管理

按官方口径,Qwen 3.8 27B 支持消费级硬件运行——这通常意味着经过量化后可在高配消费级显卡(或大内存的 Apple Silicon 设备)上推理。27B 规模在"本地能跑"和"能力够用"之间是一个务实的平衡点,也是它被开发者社区快速采用的主因。

预期管理两条:其一,量化会带来一定能力损耗,本地量化版的表现与基准榜单上的全精度成绩不是一回事;其二,编码代理类任务对上下文长度和稳定性要求高,建议先用自己的真实任务小规模验证,再决定是否替换现有方案——这也与本次发布"关注实际运行效果而非宣传指标"的社区共识一致。

赢政指数当前评分(活数据)

以下为 2026-08-17 最新公开全量评测中该厂商模型的得分(满分 100,真实沙箱执行+规则判分,零 AI 裁判),随每次公开评测自动更新。

总榜排名模型综合分代码执行
7 / 11 Qwen3 Max 73.3 74.9
查看完整榜单与方法论 →

常见问题

Qwen 是谁家的?谁在开发?

Qwen(通义千问)是阿里巴巴的大模型系列,由阿里巴巴 Qwen 团队研发。Qwen 3.8 27B 是该团队 2026 年 8 月发布的开源模型。

Qwen 3.8 27B 是开源免费的吗?

它以开源模型形式发布,权重可下载、可本地部署。大模型语境下的"开源"通常指开放权重,训练数据与完整训练细节未必公开;商用授权条款以官方模型卡为准。

Qwen 3.8 27B 真的超过闭源模型了吗?

在 LiveCodeBench 等特定编码基准上,官方公布的成绩超过了部分闭源前沿模型,这一发布事实获得多家媒体证实。但社区对成绩来源存在蒸馏争议,且厂商自报基准与独立评测是两回事——该模型尚未进入独立评测池,横向结论建议等独立数据。

普通电脑能跑 Qwen 3.8 27B 吗?

官方称支持消费级硬件运行,实践中通常指量化后在高配消费级显卡或大内存 Apple Silicon 设备上推理。注意量化版能力与基准榜单的全精度成绩存在差距。

Qwen3 Max 目前在独立评测中表现如何?

在赢政指数 2026-08-17 的最新公开全量评测中,Qwen3 Max 综合得分 73.3(满分 100),在 11 个参评模型中排名第 7。分数由真实代码沙箱执行等核心维度加权得出,全程规则判分、零 AI 裁判。