Thinking Machines于2026年7月31日发布Inkling-Small,这是一款总参数2760亿、每token激活120亿的MoE模型,其性能与更大规模的Inkling相当,但体积和速度显著优化。全权重已开放于Hugging Face与Tinker Playground,支持文本、图像、音频多模态微调。
事实还原
根据公司官方博客披露,Inkling-Small采用Mixture-of-Experts架构,总参数2760亿,每token仅激活120亿参数。它在Terminal-Bench 2.1、HLE文本推理和IFBench指令遵循等基准上,通过可变思考努力机制,实现了与Inkling相近的表现,同时大幅降低计算需求。Inkling本身总参数9750亿、激活410亿,于2026年7月15日发布。
机制拆解
Inkling-Small的运作依赖MoE设计,仅唤醒部分专家网络处理输入。这使得2760亿参数模型在推理时仅消耗相当于120亿参数的算力。公司在NVIDIA GB300 NVL72系统上完成训练,并提供原版与NVFP4量化版本,便于Blackwell硬件部署。可变思考努力功能允许用户在minimal到xhigh区间调节输出质量与成本平衡,直接对应输出TFLOPs消耗。
产业影响
对开发者而言,模型全权重开放意味着可直接下载并在Tinker平台进行领域微调,无需依赖API调用。对企业用户,2760亿总参数却仅激活120亿的设计降低了部署门槛,尤其适合需要本地化推理的场景。对竞争格局,Thinking Machines此举提供了与Qwen等中文开源模型并行的美国开源选项,强调组织可自行塑造模型而非依赖封闭系统。
官方博客指出,Inkling-Small在agentic工具使用、推理和指令遵循基准上,比Inkling更高效,且与同量级开源模型竞争力相当。
对照与先例
与Inkling对比,Inkling-Small总参数从9750亿降至2760亿,激活参数从410亿降至120亿,保持多模态原生支持和最高100万token上下文。两者均在相同基准上展示性能-计算曲线,Inkling-Small曲线更靠左,表明相同性能下成本更低。Bridgewater Associates曾用类似开放模型微调金融任务,成本降至封闭模型的十四分之一,此案例印证了开放权重的实际价值。
战略判断
基于现有事实,更多组织可能在Tinker平台上针对特定工作流微调Inkling-Small,以验证其在低努力与高努力设置下的实际成本收益。
开发者选型时,若任务对延迟敏感且需多模态输入,Inkling-Small的120亿激活参数提供明确效率优势。企业若已有专有数据,可利用开放权重在本地完成微调,避免向封闭模型反复付费。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接