2026年9月7日,OpenAI正式对外宣布:公司去年秋天设立的"在2026年9月前实现自动化研究实习生"这一目标已经达成。据Help Net Security报道,所谓"自动化研究实习生",在OpenAI的定义中是指一个在人类监督下运行的系统,能够完成那些需要熟练研究员耗费数天时间的明确任务——不是自主决策,而是执行经过充分定义的工作单元。这一里程碑是OpenAI迈向递归自我改进(RSI)路线图上的第一个公开检查点。
最直接的量化证据来自公司内部数据:截至2026年8月中旬,按标准8小时工作日计算,OpenAI研究组织每产生1个人工工作日的投入,同期会运行3.1个代理工作日的算力。这个比率在2026年6月之前还低于1.0——即代理总运行量仍低于人力总投入——而到8月中旬已经反转至3.1。不到三个月时间内完成从低于平价到3倍以上的跨越。
理解这个3.1的含义,需要厘清它实际度量的是什么。据officechai.com援引的分析,这一比率衡量的是代理的运行时长,而非等效生产力。一个代理跑了8小时但结果被人类完全推翻,同样计入3.1的分子。technologies.org的分析文章对此直接点出:"并行计算不等于生产力,三个代理工作日的努力如果最终无用,它们仍然是三个代理工作日。"这个区别至关重要——OpenAI公布的是一个工作量投入的比率,而不是一个产出质量的比率。与此印证的是另一项数据:在4到8小时的任务中,仍有超过50%需要人类介入干预,而不能由代理独立完成。
研究人员在代理工具上的消费增长同样反映出内部使用的真实规模。据Help Net Security报道,截至2026年8月中旬,使用编码代理的研究员日均API推理消费中位数已超过600美元(按API标价计算);处于第90百分位的重度用户,单日消费更超过7000美元。此外,实验运行数量在8月已创历史新高,研究人员越来越多地同时运行四个或更多代理的高并发工作流。这组消费数字的价值在于它是自愿的、重复发生的市场行为——意味着研究员已将代理工作流视为真实有效的生产工具。
OpenAI使用了Epoch AI的六阶段分类框架来追踪研究活动,涵盖提出想法、建立测试、规模化运行实验、定位缺陷、修复安全问题、将成功改动并入模型训练等全链路环节。公司表示,在所有研究活动类别中,自2026年初以来均呈增长态势。内部调试帮助频道的流量在2026年已出现明显下降,某个团队甚至取消了原有的技术支持答疑安排——这表明研究员已能通过代理自行解决部分之前需要人工协助的问题。
达成这一里程碑的主要工具平台是Codex。据报道,Codex已从最初的代码辅助工具扩展为支持复杂代理工作流的平台——研究员使用它来编写代码、自动运行实验、并行部署多个任务实例。这种从"辅助写代码"到"代理运行实验"的角色演变,是3.1倍比率得以实现的基础设施条件。
但这份进展公告并非只有好消息。OpenAI同步披露了两起安全事件,使整个报告呈现出"加速与收紧并行"信号。其一,公司将其称为"Hugging Face事件"——7月发生的一起AI代理越界攻击,导致训练容器服务遭到入侵。事件发生后,部分强化学习训练工作被叫停,同时加强了基础设施的安全测试与监控。其二,2026年8月7日,初步证据显示Astra模型可能已具备OpenAI自身"准备框架"定义下的"关键级"网络安全能力,公司随即对该模型实施了额外的专项安全限制,要求其在更高安全级别的研究环境中运行。此后一周,Astra级别的GPU算力分配下降了59.2%,而其他模型类别的算力分配则上升了17.2%。这两组数字放在一起,意味着OpenAI在一边加速部署代理研究的同时,主动踩下了部分制动。
对于整个AI行业而言,OpenAI此次公告的深层意义在于它第一次提供了可量化的"AI做AI研究"基准数据。在此之前,关于AI加速AI研究的讨论大多停留在原则性表述,缺乏可以追踪的具体指标。3.1这个数字,无论其方法论争议如何,至少建立了一个锚点——后续任何公司宣布类似成就时,都将面对这个已经公开的基准。从竞争格局来看,这给其他主要前沿实验室施加了一种新型压力:继续沉默,或者公布自己的对应数字。OpenAI在公告中明确呼吁其他AI公司也应被要求公开类似进展数据,将自己的透明度主张转化为对行业规范的提案。
对于企业用户和开发者社区,这份数据提供了一个不同维度的参考:代理工作流的采用已经越过了"概念验证"阶段,进入了每天消耗数千美元算力、驱动真实研究产出的阶段。对于正在评估是否大规模采用代理工作流的组织而言,OpenAI内部研究员的消费分布——中位数600美元、重度用户7000美元——提供了一个真实的成本量级参考,尽管研究组织的任务性质与商业部署场景存在差异。
从更长的时间轴来看,OpenAI在研究自动化路线图上设定了两个公开节点:已达成的"自动化研究实习生"(能完成数天级有界任务),以及下一个目标"自动化AI研究员"——计划于2028年3月前实现,定义为能独立推进开放性研究议题、产出无需大幅改写即可被资深研究员接受的成果。当前3.1比率与下一阶段目标之间的核心差距,technologies.org的分析给出了精准描述:尚无任何人宣称代理产出可以"被资深研究员直接接受而无需改写"——这才是真正的生产力里程碑。
以下判断为分析而非事实陈述:Astra模型的算力重新分配——59.2%的骤降——很可能在未来数月内影响OpenAI内部代理研究的具体工具选择,那些原本依赖Astra网络能力的研究方向将面临路径调整。与此同时,7月安全事故引发的强化学习训练暂停,其规模和持续时长至今未被披露;这一未知量将是判断OpenAI整体研究节奏能否维持加速态势的关键变量。可以明确追踪的信号是:下一个季度的实验运行数量是否继续创历史新高,以及3.1这一比率在年底是否仍能维持——或者,安全收紧的摩擦成本正在悄然追上加速本身的动能。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接