单张工作站GPU跑通753B参数模型:FreeToken打破本地推理的参数上限

加州大学伯克利分校与得克萨斯大学奥斯汀分校团队于2026年8月17日发布FreeToken,这套边缘原生MoE推理引擎通过带宽自适应调度,将本地可运行的参数上限从数十亿推至7530亿:8GB笔记本GPU运行35B模型、游戏台式机运行284B模型、单张工作站GPU运行753B的GLM-5.2。论文作者阵容包含Matei Zaharia与Ion Stoica,系统以Apache 2.0协议开源,发布三

2026年8月17日,一篇来自加州大学伯克利分校与得克萨斯大学奥斯汀分校的论文上传至arXiv。六天后,它登上HuggingFace每日论文热榜高位。论文展示的配置包括:8GB内存的笔记本GPU运行35B模型、游戏台式机运行284B模型、单张工作站GPU运行Z.ai的GLM-5.2——一个拥有7530亿参数的模型。

这套系统名叫FreeToken,正式标题是《FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution》。它把前沿模型部署从实验室演示转变为可在个人机器上安装、暴露OpenAI兼容API接口的软件。

为什么偏偏是现在

混合专家架构(MoE)是关键前提。以论文中点名的DeepSeek-V4-Flash为例:它拥有284B参数,但在处理每一个token时,只有43个解码层中的6个路由专家被激活,实际参与运算的参数量约为13B。稀疏性并不缩小模型的权重总量——以FP4量化存储,完整的专家池约占140GB——但它意味着在任意单次推理中,绝大多数专家可驻留在主机内存,按需调入。

现有引擎——llama.cpp、Ollama、KTransformers、MoE-Infinity——未能充分利用这一特性。据MarkTechPost报道,FreeToken论文识别出三个结构性问题:在预填充阶段,大批量token会在每一层路由到几乎全部专家,导致完整专家池跨PCIe搬运,在RTX 5090上约需2秒,在PCIe 4.0桌面显卡上长达5秒,在x8链路的笔记本上可能超过10秒;静态卸载策略无法适应异构资源分布;代理工作负载的执行模式持续变化,现有引擎对此无感知。

FreeToken的三层机制

FreeToken将整台个人机器——GPU、CPU、主机内存、互联带宽——视作统一弹性推理平台。

带宽自适应CPU-GPU协同执行是第一层。系统持续测量实际可用带宽,动态决定专家计算在GPU或CPU侧执行,同时采用全层双缓冲预填充流式传输,让权重搬运与计算并行进行,并使用全局LRU专家缓存复用高频专家。

语义感知缓存是第二层,专为代理工作负载设计。FreeToken通过语义锚点检查点,识别KV缓存中可复用的部分,避免对整段上下文重新计算。

弹性内存管理是第三层。VRAM可在专家缓存和KV内存之间动态重新分配,工作负载模式切换时内存布局随之迁移。

数字能不能实际兑现

据MarkTechPost报道:RTX 5090上运行Qwen3.6-35B-A3B的速度为77至83 tokens/秒,运行DeepSeek-V4-Flash为22至25 tok/s;RTX 4060笔记本(8GB显存)运行35B模型速度为39.3 tok/s;相较于llama.cpp、Ollama和KTransformers,FreeToken的吞吐量提升幅度在1.5至2.3倍之间;所有测试场景中首token响应时间最长为44秒。

39.3 tok/s接近人类阅读速度上限,对交互式编码代理可用。753B模型在单张工作站GPU上的运行数据,论文原文有所说明但未给出标准化吞吐量指标。

这套系统已以Apache 2.0协议开源,发布于GitHub(FlashML-org/FreeToken),以freetoken v0.1.2打包上传PyPI,并提供Windows和Linux桌面应用一键安装。命令行工具ft serve在本地1919端口暴露OpenAI和Anthropic兼容接口,ft launch claude可直接将Claude Code、Codex等代理工具接入本地机器。截至2026年8月24日,该仓库已积累超过4100颗GitHub星。

硬件要求:需要NVIDIA RTX 30/40/50系列显卡,驱动r580+(CUDA 13),CLI仅支持Linux x86_64,桌面应用兼容Windows与Linux,暂不支持macOS。

谁签名,意味着什么

论文署名11人,包括Song Han(MIT)、Matei Zaharia(Apache Spark联合创始人、Databricks联合创始人)、Ion Stoica(Databricks与Anyscale联合创始人、Ray框架创始人)。背后的机构是FlashML,代码库与安装包已上线。

成本结构的实质性位移

据Spheron和Glows.ai等平台的2026年成本分析数据,AWS H100按需定价在每GPU每小时4.10至6.88美元之间,消费级云端RTX 4090出租价格约为每小时0.44美元,而购置一台RTX 4090本地工作站的市场价格约在4700至5000美元区间,RTX 5090双卡工作站约在5000至8000美元之间。在持续高利用率场景下(超过80%),本地硬件在3年维度上的总拥有成本已可低于云端持续租用。

FreeToken将同一张工作站GPU的可运行参数规模从数十亿提升至前沿量级。对于承受代理工作负载API账单的独立开发者和小型工程团队,本地部署的经济可行性门槛发生实质性位移。

数据主权是另一维度。FreeToken论文将医疗、法律、国防、金融列为最强适配场景。在气隙隔离环境中运行前沿参数规模模型时,私有代码审查、离线合同分析、本地批量合成数据生成等应用路径被打开。

独立判断

FreeToken把本地推理的参数上限从大致70B推进到7530亿参数的GLM-5.2,即便吞吐量不及数据中心,也将本地可选模型集扩展到此前无法触及的层级。

MoE的稀疏性激活是所有性能数字的前提。对于密集架构模型,这套机制的收益会大幅缩水。FreeToken的适用边界与MoE模型的普及程度强耦合,2026年主流前沿开放权重模型恰好几乎都是MoE架构。

从系统工程角度,FreeToken把异构硬件的动态调度做成了有稳定API接口的可部署软件。4100颗GitHub星在6天内积累,说明开发者社区对这一答案的判断是肯定的。

本地推理触及前沿参数量级的影响将在未来数月内逐步浮现,不仅在成本层面,也体现在云端推理服务商对定价策略的压力测试上。