AI语音合成赛道再添重磅玩家。据TechCrunch报道,总部位于旧金山的初创公司Fish Audio宣布完成5200万美元种子轮融资,这是近年来AI语音领域规模最大的种子轮之一。该公司自2025年上线以来,已累计吸引超过800万用户使用其开源或托管版本模型,年经常性收入(ARR)达到2100万美元。值得注意的是,这笔融资距公司成立仅一年半,凸显了投资者对AI语音商业化前景的强烈信心。
从开源社区到企业级服务
Fish Audio的核心产品是一系列AI语音模型,能够根据文字输入生成高度自然的语音,并支持情感调控、多语种切换和实时合成。与其他竞争对手不同,Fish Audio采取了开源策略——将基础模型免费发布在GitHub和Hugging Face上,吸引了大量独立开发者和研究人员的关注。同时,公司提供托管API服务,面向内容创作者、游戏公司、有声书出版商和企业客户,按使用量收费。
创始人兼CEO张伟(化名)在采访中表示:“我们的使命是让高质量语音合成变得人人可及。开源社区提供了大量反馈和优化建议,帮助我们快速迭代;而企业版则通过定制化模型和私有化部署满足商业客户的需求。”据悉,Fish Audio的客户已涵盖多家大型媒体平台和在线教育机构。
“AI语音市场正从‘听个响’走向‘以假乱真’,Fish Audio的开源策略降低了行业门槛,但也面临商业化平衡的挑战。”——编者按
市场格局与竞争分析
目前AI语音合成领域竞争激烈。ElevenLabs凭借其超高拟真度和好莱坞合作占据头部位置,年营收已超1亿美元;国内则有科大讯飞、百度等巨头布局。Fish Audio的优势在于开源生态带来的社区活力和成本控制能力——其模型在同等质量下算力消耗比竞品低约30%。不过,开源也意味着技术壁垒相对较低,竞争对手可以快速复现和优化。
本轮融资由Andreessen Horowitz领投,Sequoia Capital跟投,估值暂未披露。资金将主要用于三方面:一是扩大研发团队至200人,重点攻克多模态语音生成和情感深度控制;二是建立企业级销售和客户成功团队;三是布局海外市场,尤其是日本、韩国和欧洲的语音合成服务需求增长迅速的地区。
行业分析师认为,AI语音的商业化路径正在从“通用模型”转向“垂直场景定制”。Fish Audio已推出面向游戏角色的动态语音引擎和面向无障碍阅读的辅助语音产品,这些细分领域可能成为其突破点。
创始人背景与技术壁垒
张伟此前在DeepMind和百度AI实验室从事语音合成研究,拥有多项核心专利。团队核心成员来自麻省理工学院和斯坦福大学,在TTS(文本转语音)和语音克隆领域有深厚积累。Fish Audio声称其最新的FishTTS-v2模型在中文和英文的自然度评分上超越了ElevenLabs的Turbo v2,并在MOS(平均意见分)测试中达到4.5分(满分5)。
然而,AI语音技术也面临伦理挑战。语音克隆可能被用于诈骗、伪造名人言论等。Fish Audio表示已部署实时水印检测系统,并要求API用户签署合规协议,防止滥用。公司还加入了AI语音内容溯源联盟,倡导行业自律。
未来展望
Fish Audio的融资热潮反映了资本市场对AI应用层公司的兴趣升温。随着大模型成本下降,语音交互有望成为元宇宙、智能汽车、智能家居等场景的标配。公司计划在明年推出实时对话语音模型,支持多轮互动和情绪感知,进一步拓展虚拟客服、数字人等应用。
不过,要维持高速增长,Fish Audio需要解决两个问题:一是如何在开源与商业化之间找到可持续的平衡点;二是面对巨头切入,如何构建差异化的护城河。
本文编译自TechCrunch
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接