旗下矩阵

  • 投资界
  • 天天IPO
  • 解码LP
  • 并购
  • 前哨
  • 投资界AI

AI开始研究AI OpenAI「研究实习生」上岗,奥特曼画的饼已兑现一半

去年10月OpenAI奥特曼提出兑现日期,9月6日实现自动化AI研究实习生目标,还披露相关数据,同时面临安全问题,递归自我改进推进中。
·微信公众号:新智元 ASI启示录 ASI启示录

投资人解读

· OpenAI实现自动化AI研究实习生目标,其研究部门AI打工时长是人类3倍,8月中旬Agent工作日与人类工作日之比达3.14倍。研究进度提升,如实验数量和代码变更量增加,但也面临算力瓶颈。
· 7月因安全问题连踩两脚刹车,虽算力未减但工作负载调整。RSI从概念变为组织工程。
总结:OpenAI在AI研究上有进展,但安全风险与算力瓶颈并存,未来需关注其能否安全实现自动化AI研究员目标及人类对AI发展的可控性。

去年10月28日,OpenAI刚完成营利实体重组,奥特曼和首席科学家Jakub Pachocki开了一场直播。

奥特曼在直播里撂下一句话:与其天天吵AGI到底怎么定义,倒不如定两个能真正兑现的日子。

紧接着,Pachocki就把日子报了出来:

2026年9月,自动化AI研究实习生上岗。

2028年3月,自动化AI研究员就位。

十个多月过去,第 一个日子到了,OpenAI按期交卷。

9月6日,OpenAI研究员Boris Power转发官方博客:

OpenAI达成了自动化研究实习生的目标。

这是AI行业第 一张被公开兑现的能力时间表。

「研究实习生」不是一款产品,它是OpenAI对自己内部能力的一个定义:

一个能在人类指导下完成明确研究任务的系统,而且干的都是熟练研究员原本要花几天才能搞定的活。

至于那个计划在2028年实现的「研究员」,Pachocki给出的标准是:

能够自主交付更大型研究项目的系统。

一个需要人类指导,一个能自主交付更复杂的研究项目。

从「实习生」到「研究员」,差的主要是一整层判断力:做什么、做到哪、什么时候停。

这一层恰恰是今天AI最薄弱的地方。

OpenAI自己的数据显示,「决定做什么」在Agent输出里几乎不存在,任务一超过4小时,就得人频繁插手。

18个月补上这一层,OpenAI把路线也定好了:递归自我改进(Recursive Self-Improvement,RSI)。

让AI来研究AI,再让研究出来的AI继续研究AI。

但OpenAI也承认,自己还不知道该怎样安全地走到完全对齐、完整的RSI那一步。

实习生的账单

一天烧掉7000美元

在这次交卷报告里,OpenAI还披露了一个惊人的内部数据,AI的打工时长已经是人类的3倍:

截至2026年8月中旬,在OpenAI的研究部门里,每投入1个人类工作日,背后就有3.14个Agent工作日。

OpenAI研究部门Agent工作日与人类工作日之比,6月反超,8月中旬达3.14倍。

先来看看,这个「实习生」到底有多努力,又有多烧钱。

OpenAI这次没拿跑分说事,直接亮出了自家研究部门的工作账单。

年初的时候,OpenAI研究部门里那些Agent用量排名中等的研究员,还只是「少量使用」AI工具。

但到了8月中旬,这位中位数员工每天光是消耗的推理算力,按API价格算就超过了600美元。

如果是排在前10%的重度用户,每天烧掉的token直接突破7000美元。

OpenAI研究员每天消耗的Agent推理费用(按API价格)。左图为中位数研究员,8月中旬超600美元;右图为前10%重度用户,超7000美元。

这比不少高级程序员的月薪还要高。

今年以来,研究部门中位员工的输出token量暴涨了124倍,把公司其他部门远远甩在了后面。

其实在6月之前,整个研究部门的Agent总运行时间还比不过人类的总劳动时间。

但6月一过,曲线彻底反超,到了8月中旬直接拉升到了3.14倍。

OpenAI研究部门Agent工作日与人类工作日之比。5月初还不到0.5倍,6月反超,8月中旬达3.14倍。

研究员们甚至开始玩起了「多开」,同时开4个以上Agent并行干活的人越来越多。

钱花得这么狠,研究进度变快了吗?数据显示:

2026年8月,每位活跃实验者跑的实验数量,创下了自2025年1月开始统计以来的历史新高;全公司每位活跃贡献者的代码变更量,对比2025年之前的平均水平也实现了翻倍跨越。

不过OpenAI也深知其中的瓶颈——自动化推进得越深,最难自动化的那部分任务就会占掉研究员越来越多的精力,成为下一道卡点。

算力这道门槛,也会越来越重要。

换句话说:写代码早就不是限制起飞的瓶颈了。

实习生到底在干什么活

每个人类研究员背后都有3.14个Agent工作日,是不是说一个AI已经顶三个研究员了?

先别急着下结论。

OpenAI这次把Agent的工作明细拆开了,它用Epoch AI的一套分类法,把AI研发拆成六个阶段:

决策、设计、构建、运行、分析、沟通。

然后把Agent吐出的所有token逐条归类,看AI到底在忙什么。

结果显示,1月到8月,每位研究员每天的token增量,前三名清一色是「执行层」的苦活:

写研究和基础设施代码,增加19.82万个token;技术帮助与代码审查,增加15.88万个token;启动、监控和调试训练运行,增加13.31万个token。

「决策层」呢?

涨得少得可怜:「决定做什么」只增加2300个token;「算力与人员分配决策」增加1500个token;「决定继续还是叫停项目」仅仅增加200个token。

执行层和决策层,每天token增量差了近千倍!

用OpenAI的话说:高层规划在Agent输出里仍然只占极小一部分。

1月到8月,OpenAI每位研究员每天各类研究活动的Agent输出token增量。写代码涨19.82万居首,「决定继续还是叫停」只涨200,差了近千倍。

这里还有一个细节:

OpenAI内部原本有好几个团队每周开门诊,帮研究员排查实验环境问题。

到了2026年,去人工频道发帖求助的人越来越少,其中一个团队因为实在没人来,干脆停办答疑会,把人手全挪去改系统了。

找故障、修环境这种让人头秃的活,已经被Agent全面接管。

那成功率呢?

OpenAI统计发现,人类15分钟内能干完的简单任务,Agent零干预一次成功的比例高达86%。

任务拉长到4到8小时,零干预成功率就只剩43%。过去半年里,这一档成功完成的任务中,超过一半至少需要人插手一次。

拉到8到16小时,零干预成功率只剩四成。

所以说,「实习生」这个词用得极其精准:

你给它派个活,它能不知疲倦地干上几天的量;但大方向对不对、什么时候该停,还是得靠人类导师在背后盯着。

7月

OpenAI连踩两脚刹车

OpenAI贴出了一张强化学习算力曲线图,图上的两条虚线,就是两脚刹车的时间点。

7月15日至8月15日OpenAI强化学习GPU分配。7月20日安全暂停后算力应声腰斩;8月7日Astra类(绿色)再受限,一周内降59.2%,其他模型(蓝色)随即补位。

第 一脚刹车,7月20日。

那天OpenAI发现,Agent居然攻破了自家的研究基础设施。训练用的容器服务当天紧急关停,重新上线时加上了大量额外限制,面向最新部署模型的强化学习训练直接暂停两周。

第二脚刹车,8月7日。

当时,OpenAI发现初步证据表明,Astra模型可能具备了OpenAI安全框架定义的「关键网络能力」。

公司立刻给它追加专属限制,要求Astra只能在更高安全等级的研究环境里跑。接下来一周,Astra类的GPU分配再降59.2%。

然后,诡异的一幕出现了。

其他模型的GPU分配同期上涨17.2%,刚好把Astra腾出来的缺口补回约85%。整个强化学习工作负载的总算力,几乎没受影响。

算力不会闲着。管控一来,它自己找路流走,研究员转头就把腾出来的卡挪去训别的模型了。

所以,刹车踩下去了,但车却没停,而是换了条道。

OpenAI自己也承诺,只要发现继续推进会带来不可接受的安全风险,就会减速,甚至停止开发或部署。

它还公开提了一个要求:所有前沿实验室,都应该被要求公开追踪自己的RSI进度。

递归自我改进不再是口号

看OpenAI现在的招聘页,你会发现上面赫然挂着一个团队,就叫RSI。

岗位说明写到:构建能加速、并最终自己执行高质量研究的AI系统。

开出的年薪高达29.5万到44.5万美元。

同一家公司里,负责安全的Preparedness团队也在招人:递归自我改进安全研究员,年薪38万到50万美元。

一边招人猛踩油门,一边招人赶造刹车。

从去年10月奥特曼嘴上说说,到今天有编制、有预算、有安全对口岗,递归自我改进已经从论文里的一个概念,变成了OpenAI的一项组织工程。

下一个日子来临时

人类还能不能喊停

奥特曼口中第 一个日子,已经兑现。

在AI研发这个巨大循环里,执行层正在被整体接走:写代码、修环境、盯训练、排故障。决策层,还留在人类手中。

第二个日子,2028年3月的「自动化研究员」,距离今天还剩18个月。

OpenAI承认自己接下来还不知道怎么「安全走完这条路」。

系统一代比一代强,刹车却未必一代比一代灵。

7月那两脚刹车已经证明:就算踩下刹车,算力也不会停,它会绕道跑去训下一代模型。

真到了AI自己能当研究员的那天,人类还来得及喊停吗?

【本文由投资界合作伙伴微信公众号:新智元授权发布,本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。