Higgs Audio v3 TTS 登陆 SGLang-Omni:实时可控语音代理新突破
Boson AI 与 SGLang-Omni 团队近日宣布,Higgs Audio v3 TTS 模型已在 SGLang-Omni 框架上实现端到端部署。该模型专为对话式语音代理设计,支持 100 种语言且 WER/CER 保持个位数,同时允许开发者通过文本流直接控制情感、风格、韵律和音效。模型基于约 4B 参数的自回归解码器,采用多阶段生成架构,适合流式交互场景。SGLang-Omni 通过阶段抽象、轻量通信和内存隔离机制,高效支持此类多阶段模型的推理,显著提升了实时语音生成的性能与灵活性。