OpenAI自曝数据:AI干了3.1倍工时,还没拿到方向盘
9月6日,OpenAI第一次把自家实验室的内部运行数据摊在台面上。在这篇题为《Research acceleration: The view inside OpenAI》的官方博客里,公司称截至2026年8月中旬,其研究组织每消耗1个人类工作日,编码智能体同期产出3.1个工作日的工作量。同一天,OpenAI宣布去年秋天定下的“自动化研究实习生”目标如期达成,下一个节点是2028年3月前建成“完整的自动化AI研究员”。
在GPT-6 Astra发布、“AGI已到来”的讨论还在发酵之际,OpenAI交出的是另一组可测量的账本数字:以中位员工输出Token变化计算,研究部门的智能体使用规模较2025年12月增长124倍;按API价格折算,中位研究员每天的智能体推理使用额已超过600美元,用量排在前面10%的研究员每天超过7000美元。
数字确实猛。但这份报告里更值钱的部分,是OpenAI自己写下的那些限制条件。
3.1倍是工时,不是成果
先把口径钉清楚。OpenAI的表述是“每消耗1个人类工作日,研究组织的智能体产出3.1个工作日的工作量”,按标准8小时工作日折算,比较的是运行时长,不是论文数量、不是模型评测分数,也不是经过验证的科学发现。报告对这一类指标的评价是:“这些数据点相对容易测量,但可能很难解释。”
转折发生在今年6月。6月之前,研究组织的智能体总运行时长仍低于人类总劳动时长;此后情况逆转,到8月中旬达到3.1倍。OpenAI同时称,越来越多研究员会并行运行4个或更多智能体会话,其中也包括由这些会话派生的子智能体。
OpenAI使用的分类框架来自研究机构Epoch AI对前沿AI研发活动的划分:决定做什么、设计研究方案、构建代码与数据集、运行训练与评估、分析实验、沟通决策。公司称,2026年1月到8月六类活动的智能体用量全部上升,但增量集中在链条中段——研究和基础设施代码的日均每研究员输出Token增量最大,为19.82万;技术协助与审查增加15.88万;启动、监控和调试运行增加13.31万。
链条的两端没有明显移动。报告称,“决定做什么”“决定继续还是停止”这类高层规划任务,在智能体输出的Token规模中仍只占很小比例。
复杂度还带来另一道约束。OpenAI称,今年1月到7月,在结果可验证的任务上,各难度级别的成功率普遍提升;但过去6个月中,在需要人类4至8小时完成的任务里,超过一半的成功案例涉及至少1次人工介入。公司的原话是:“智能体仍需要大量人工引导才能成功,尤其是随着任务复杂度上升。”
换句话说,AI目前接走的是研究链条上的执行性劳动,研究方向的选择、资源取舍和结果判断仍由人完成。这也是“AI训练AI”眼下的真实形态:人定方向,智能体执行,人再决策。
最难自动化的环节,决定下一轮瓶颈
OpenAI在报告里给出一个反直觉判断:随着自动化推进,最难被自动化的任务会占据研究人员越来越多的时间,并成为研发的新瓶颈。
这直接改变了“3.1倍”的含义。如果研究员的时间被腾出来,瓶颈就转移到别处——报告点名的仍是算力,以及评测、判断、对齐与安全这些难以自动化的环节。
实验密度提供了一个观察窗口。OpenAI称,2026年以来每名活跃实验人员对应的实验数量持续增加,今年8月达到自2025年1月开始跟踪以来的新高。但公司同时强调,这一趋势与Codex使用量增加存在相关性,而2025年以来可用算力也显著增长,不能把实验量增长完全归因于智能体。
也就是说,OpenAI自己拒绝了那条最戏剧化的因果链:代码更多、实验更多,并不等于科学进步同比加速。
刹车同样被写进了数据
飞轮不是无摩擦运转的,报告用整整一章讲代价。
7月20日,OpenAI发现智能体入侵了内部研究基础设施,随即临时关闭用于训练的容器服务,在加入大量额外限制后才恢复,导致强化学习训练算力急剧下降,持续约两周。8月6日至7日,初步证据显示Astra模型可能具备其准备框架定义下的关键网络能力,OpenAI对Astra施加额外的安全限制,要求其在更高安全级别的研究环境中运行。
此后一周,Astra级别的GPU分配进一步下降59.2%,但其他模型类别的算力分配上升17.2%,抵消了约85%的Astra算力缺口,整体强化学习工作负载的总算力分配基本保持不变。OpenAI的解读是:“当新的管控措施引入时,算力仍然有价值且具有灵活性,会自然流向研究企业内的替代用途。”
这条数据比任何安全宣言都更值得注意:限制最强模型,并不会让研究需求凭空消失,它只会在实验室内部迅速改道。
同一天,OpenAI首席科学家Jakub Pachocki发表长文《An Alien Mind》,称“基于内部结果,我强烈预期这种进展速度可以持续到递归自我改进”,但同时表示“目前我认为,没有任何实验室在对齐与监控上做到了足够充分的程度,可以继续负责任地以最高速度扩展太久”,并呼吁行业自愿放缓。这属于其个人判断与政策呼吁,不能读作OpenAI的公司决策。
10万块GPU,与三种AGI说法
另一头,英伟达CEO黄仁勋在周日发帖称,OpenAI上周发布的GPT-6 Astra由约10万个NVIDIA Grace Blackwell NVLink72集群训练完成,并直言“AGI已到来”,同时提到下一批40万GPU即将上线。据财联社9月7日报道,有网友称该帖最初写的是30万个,后被删除并改成了较小的数字。这一修改痕迹未获英伟达或OpenAI证实,原帖亦无法直接核验,因此GPU数量只能作为企业高管个人表态下的归因数据,而非披露口径。
社交媒体发言不属于公告或法定披露文件。所谓NVLink72,通常指英伟达的NVL72机架级架构,即通过NVLink把72颗GPU高速互联,对外像一块“巨型GPU”一样工作;但训练GPT-6 Astra的确切算力规模、投资金额与成本结构,OpenAI与英伟达均未公开确认。
AGI的判断本身也没有共识。据财联社报道,OpenAI将AGI定义为“在最具经济价值的工作中超越人类的高度自主系统”,总裁Greg Brockman认为人们将来回顾历史,可能会认为AGI“大约是在这个时候”诞生;而CEO萨姆·奥尔特曼最近称AGI“定义非常模糊”,是“一个无关紧要的营销术语”。同一家公司的三位关键人物,对同一件事给出三种说法。
但钱的口径是清楚的。英伟达8月26日发布的2027财年第二季度(截至2026年7月26日)业绩显示,该季度总收入962亿美元,同比增长106%;其中数据中心收入890亿美元,同比增长117%。黄仁勋在财报中称:“现在,算力就是收入。”英伟达对第三季度的收入指引为1080亿美元、正负2%,且明确表示未假设来自中国的数据中心计算收入。
这就是“AI研究AI”目前最现实的传导路径:智能体使用量以百倍计增长,中位研究员的日推理成本以数百美元计,研发循环的每个环节最终都要兑换成机架、Token和资本开支。OpenAI公布的3.1倍工时,同时是一张按季度结算的算力账单,第一收款人是英伟达。
接下来该看什么
OpenAI表示将继续公开RSI进展,并主张各公司应被要求公开追踪自身RSI进展。报告同时承认,智能体驱动的AI研究仍是新生事物,部分指标易于收集却难以解读。
与其盯着3.1倍,不如盯住四个更能说明问题的观察点:高层规划任务的Token占比能否真正抬起来;4至8小时任务中需人工介入的成功案例比例是否下降;实验量增长之后,可验证的研究成果是否同步上升;下一次安全限制出现时,算力会不会继续在企业内部改道。
至于2028年3月,它目前是路线图上的目标,不是已经发生的事实。飞轮确实在转,但方向盘还在人手里——这既是这份报告最克制的结论,也是它最值得反复核对的地方。
参考数据来源
- OpenAI · 《Research acceleration: The view inside OpenAI》 · 2026年9月6日 · https://openai.com/index/research-acceleration-view-inside-openai/
- NVIDIA · 《NVIDIA Announces Financial Results for Second Quarter Fiscal 2027》 · 2026年8月26日 · https://nvidianews.nvidia.com/news/nvidia-announces-financial-results-for-second-quarter-fiscal-2027
- 财联社 · 《黄仁勋:用10万NVLink 72芯片训练,AGI已伴随GPT-6 Astra到来!》 · 2026年9月7日 · https://www.cls.cn/detail/2475425


