2026年9月27日,北京实验室NaiveAI发布309B MoE开源模型Naive-N0.5-Flash,激活参数15.5B,支持1M上下文,采用MIT许可完全开源,推理速度最高达2000 tok/s。
事实还原
该模型由北京实验室NaiveAI于2026年9月27日推出。模型总参数309B,激活参数15.5B,原生支持1M上下文。架构上无全局注意力层,采用滑动窗口注意力与DeepSeek稀疏注意力混合设计,基于小米MiMo-V2.5改造并续训3.25T tokens。权重与推理代码以MIT许可开源,定位编码与AI研发任务。
机制拆解
模型训练过程采用AI参与优化研发的方式。AI模型负责探索混合注意力架构,同时优化训练、推理和部署系统。人类研究员提供方向指导和关键决策。推理系统NaiveRT结合mega-kernel fusion、Programmatic Dependent Launch和speculative decoding,在Standard模式下提供50 tokens/s每用户,在Ultrafast模式下最高达2000 tokens/s。
API定价为输入每百万tokens 0.10美元、输出0.40美元、缓存读取0.01美元。模型同时面向开发者提供开放权重。
产业影响
对开发者而言,MIT许可允许直接下载权重并修改代码,1M上下文和2000 tok/s峰值速度降低了长文本处理和快速迭代的门槛。对企业用户,API定价提供了一种可量化的调用成本选项。
对竞争格局而言,该模型的混合注意力设计与现有全注意力模型形成区别,开发者可据此测试本地或稀疏计算在编码任务中的实际表现。对上下游工具链,NaiveRT的优化路径可能影响后续推理框架的kernel融合和调度策略。
对照与先例
模型续训数据量为3.25T tokens,架构改造自小米MiMo-V2.5。评估中提及的对比模型包括GLM-5.3、Kimi-K3、Qwen-3.8-Max等,但具体分数需参考各模型官方博客。
战略判断
基于现有事实,接下来最可能出现的情况是开发者社区围绕MIT权重开展微调和工具集成,观察信号包括GitHub提交数量、实际推理延迟报告以及API调用量变化。
开发者选型时,可先在本地环境部署权重测试1M上下文下的编码任务,再对比API成本与自建推理的性价比。企业用户可通过小规模API调用验证Ultrafast模式在生产负载下的稳定性,再决定是否扩大使用。
模型宣称的递归自改进路径仍处于早期阶段。优势则在于完全开源的权重与代码,以及针对AI研发任务的训练定位。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接