追寻LLM下一个重大突破的初创公司

追寻LLM下一个重大突破的初创公司
MIT科技评论的“未来展望”系列,聚焦那些不再满足于Transformer架构、试图重新定义大语言模型的初创公司。自2017年“Attention Is All You Need”论文以来,注意力机制主导了AI领域。如今,新一代创业者正从效率、推理能力和成本等角度出发,探索下一代基础模型。本文带你一窥这股正在酝酿的技术潮流。

2017年夏天,谷歌AI研究员发表了一篇名为“Attention Is All You Need”的论文,首次提出了Transformer架构。这篇论文改变了人工智能的发展轨迹,其核心的注意力机制成为此后几乎所有大语言模型(LLM)的基石,催生了GPT、Claude、Gemini等一系列系统。然而,就在这个架构统治了将近十年之后,一批初创公司正试图打破现状,寻找下一个重大突破。

注意力机制的成功与局限

Transformer的成功在于其可扩展性和并行处理能力,但并非没有短板。随着模型规模增大,注意力机制的二次方计算复杂度成为巨大瓶颈,推理成本高企,长上下文处理更是能耗黑洞。这些问题为后来者提供了切入点。

在MIT科技评论的“未来展望”系列中,我们注意到一批新兴创业公司正从不同方向发力:有的探求线性注意力或状态空间模型以替代传统注意力,有的则专注于测试时计算(test-time compute)与推理优化,还有的试图通过稀疏化或动态路由重塑模型内部结构。它们的目标并非简单地改进现有模型,而是要从底层重新定义大语言模型的运作方式。

“Attention Is All You Need”曾是一份宣言,如今更像是一种挑战——新一代研究者正在证明,注意力机制虽然强大,却未必是唯一答案。

创业热潮背后的驱动力

这一波创业热潮背后,是多重因素的汇合。首先是成本压力:训练和运行大模型的费用已经让许多企业望而却步,更高效的架构意味着更低的门槛。其次是技术演进:Mamba、RWKV等模型验证了非Transformer路线的可行性,激发更多探索。此外,企业对私有化部署、数据安全与低延迟的需求,也促使了更具适应性的模型架构出现。

编者按:下一个“大事件”可能不只一个

回望2017年,Transformer并非一夜成功,而是经历了数年的积累与验证。今天的初创公司们同样面临不确定性:它们不仅要证明新架构在学术基准上达标,还要在工程实践、生态兼容性和商业化落地中胜出。值得注意的是,未来的突破未必像Transformer那样一统江山,更可能是多种架构共存,各自适用于不同场景。真正值得期待的,或许不是“替代”注意力机制,而是让注意力与新的思路融合,碰撞出超越今天的智能形态。

这篇深度解析来自MIT科技评论的《What’s Next》系列,该系列通过行业、趋势与技术的交叉视角,为读者提供对未来的前瞻性洞察。随着这些初创公司逐步展现其成果,我们有望在未来几年看到一个更加多样化的AI生态。

本文编译自MIT Technology Review