SpecForge v0.3.0:统一解耦与同址推测解码训练栈

SpecForge v0.3.0:统一解耦与同址推测解码训练栈

SpecForge 团队推出 v0.3.0 版本,实现了目标模型推理与草稿模型训练的完全解耦,支持更广泛的推测解码算法,并统一了在线、离线与解耦工作流。

主要更新亮点

  • 在线训练现已完全解耦:补丁版 SGLang 服务器捕获目标特征,Mooncake 传输张量,训练器通过独立控制平面消费轻量引用。
  • 推理与训练可独立扩展:在 8×H20 测试平台上,3 个 SGLang 服务器 + 5 个训练器配置使端到端训练吞吐提升约 10%。
  • 单一运行时支持多种草稿算法:EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 及可选 D-PACE 目标。

同时发布多款社区贡献的开放 SpecBundle 草稿模型,并内置训练-服务一致性检查门。

从耦合训练器到训练流水线

在线草稿模型训练包含两个截然不同的工作负载:目标侧运行冻结大模型捕获隐藏状态,草稿侧训练小型模型进行前向反向传播。旧版同址设计将两者绑定同一生命周期,导致固定比例、资源干扰和共享故障边界等问题。新架构明确边界,使训练器无需拥有目标模型,仅需 token 序列、掩码与目标特征。

一个边界,三项契约

新在线运行时分为生产者池与消费者池。生产者调度提示至补丁 SGLang 捕获服务器,特征张量写入 Mooncake,仅传递 SampleRef 元数据。

SpecForge online-disaggregated training architecture

图 1:在线解耦训练架构示意图。

捕获契约

deployment.disaggregated.server_urls 中的每个 URL 对应一个 rollout worker,连接已打补丁的 SGLang 服务器。

投递契约

大张量通过 Mooncake 存储,训练器通过 FeatureDataLoader 解析引用构建批次。

生命周期契约

分布式 rank 同步推进,使用 SQLite 账本记录已训练样本,支持中断恢复。

解耦带来的收益

推理池与训练池可独立扩展。在 8×H20 测试床上,Qwen3-8B Domino 3k 上下文训练中,3 服务器 + 5 训练器配置较旧版同址实现吞吐提升 10%。

Qwen3-8B Domino 3k-context colocated training profileQwen3-8B Domino 3k-context disaggregated training profile

图 2-3:同址与解耦训练性能对比曲线。

新运行时已支持 EAGLE3、DFlash、Domino 等算法,性能测试显示显著加速。

EAGLE3 draft models: output throughput vs. baselineQwen3.5-397B-A17B DFlash output throughput vs. baselineQwen3.6-27B Domino end-to-end speedupKimi-K3 DSpark output throughput vs. baseline
本文来自 LMSYS 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!