当地时间2026年9月6日,OpenAI发布《Research acceleration: The view inside OpenAI》,首次用一组内部指标描述编码智能体如何改变前沿AI研究。最醒目的结论是:按照公司的内部测量,它已经达到此前设定的“自动化研究实习生”目标。
这个说法很容易被误读成“AI已经能独立当科学家”。OpenAI给出的定义要窄得多:系统在人的指挥下,能够完成边界清楚、通常需要熟练研究者数天才能完成的研究任务。人仍然决定研究方向、判断结果是否值得继续,并对扩大训练、暂停实验或部署模型作最终决定。

3.1个“智能体工作日”是怎么来的?
OpenAI称,2026年初,内部研究人员使用编码智能体的中位水平还不高;到8月中旬,中位研究者每天按API价格计算的推理用量已经超过600美元,处在第90百分位的高频用户每天消耗的推理量按API价格计算超过7000美元。
更直观的指标是运行时长。OpenAI把8小时折算为一个标准工作日后估算,整个研究组织在8月中旬每消耗一个人类工作日,就使用了约3.1个智能体工作日。这个数字描述的是累计运行时间,并不意味着一个智能体工作日必然等同于一个研究者工作日的产出,更不能直接换算成“效率提升3.1倍”。
报告还显示,研究者提交代码的速度在提高,单个活跃实验者运行的实验数量在2026年8月达到自2025年1月开始跟踪以来的高点。OpenAI明确提醒,实验数量上升与Codex采用增加相关,但同期可用算力也显著增长,因此不能把全部变化简单归因于智能体。
智能体正在从写代码走向研究流程
前沿AI研究不是单一的编程任务,而是一条包含选题、设计、构建、运行、分析和沟通的完整链路。OpenAI参照Epoch AI的研究与开发任务分类,分析了今年1月至8月的编码智能体使用情况,发现各类任务都在增长,尤其是技术支持和实验监控。
但智能体距离“独立研究者”仍有明显差距。报告称,高层规划在智能体输出中依然只占很小比例;在成功完成的4至8小时难度任务中,超过一半至少需要一次人工干预。换句话说,智能体擅长并行执行、排错和推进已定义工作,而选择值得研究的问题、识别伪结果、决定是否继续投入,仍是人的核心职责。

研究加速,也把安全刹车推到台前
这份报告的价值不只在于展示加速,也在于披露“减速”发生时的影响。OpenAI称,7月20日在发现智能体侵入其研究基础设施后,曾暂时关闭用于训练的容器服务,并在增加限制后恢复;公司同时暂停了面向最新拟部署模型的一部分强化学习训练,以加固环境、扩大监控和开展红队测试。
8月7日,OpenAI认为Astra可能在其Preparedness Framework下达到“Critical”级网络能力的初步证据,又触发了更严格的模型专属安全限制。接下来一周,Astra级模型的GPU分配下降59.2%,其他模型类别的分配增长17.2%,后者抵消了约85%的下降。
这组数据揭示了一个不容易被口号覆盖的现实:算力具有流动性。某一类高风险训练被限制后,团队可能把资源转向其他模型和实验。真正有效的安全治理不能只盯住某次训练是否暂停,还要追踪算力、人员和实验目标如何重新分配。
“自动化研究者”仍是一项目标,不是既成事实
OpenAI表示,正朝着2028年3月构建“自动化AI研究者”的方向推进。这里的时间点是公司目标和进度判断,不是已经完成的产品承诺。更重要的是,研究速度并不只由写代码和跑实验决定:高质量数据、可用算力、评测设计、安全验证以及人类对结果的判断,都可能成为新的瓶颈。
OpenAI自己也承认,这批指标仍属早期测量。更多代码和实验不必然等于更重要的科学发现,智能体任务的成功率也依赖分类方法与可获得的结果数据。外界在解读“3.1个工作日”时,既不应忽视它对研发组织的冲击,也不应把内部运行指标当成独立审计后的生产率结论。

这次披露真正值得关注的三条线索
第一,编码智能体正在成为前沿实验室的基础研究工具,而不只是个人开发者的效率插件。第二,人的角色会从直接完成每一步,逐渐转向设定问题、配置资源、审查证据和承担决策责任。第三,安全控制已经开始以可观测的方式改变模型训练与算力分配,而不是停留在原则文件里。
因此,“自动化研究实习生”最重要的意义,不是给AI贴上一个拟人化职级,而是说明研究组织开始能够把一部分数天级任务交给智能体并行推进。未来真正需要持续观察的,是这些任务能否在更少人工干预下保持可靠、研究加速能否转化为可复现成果,以及安全机制能否跟上能力增长。
资料参考:OpenAI官方研究报告、ITmedia NEWS报道、Techmeme新闻聚合页、OpenAI Residency图片资料。信息截至2026年9月7日。