适合关注 AI Agent、科研自动化和研发管理的读者。核心结论是:OpenAI 公布的数据表明,编码 Agent 已经深入其研究流程;但“Agent 运行时间超过人类工时”不等于“研究已被自动化”。真正值得关注的,是研究团队如何定义任务、介入过程、检查结果和设置停止条件。

发生了什么

2026 年 9 月 6 日,OpenAI 发布《Research acceleration: The view inside OpenAI》,称按照其内部测量,已达成“2026 年 9 月前实现自动化研究实习生”的目标。这里的“研究实习生”有明确边界:它指能在人类指导下完成定义清楚的研究任务,其中一些任务原本需要熟练研究者花费数天。[1]

公告同时给出了一组内部指标:截至 8 月中旬,以标准 8 小时工作日换算,OpenAI 研究组织每 1 个人类工作日对应 3.1 个 Agent 工作日;使用 Agent 的研究者更多地采用并发会话,提交代码和实验数量也在上升。这些数据描述的是 OpenAI 内部工作方式,不是独立第三方基准,也不能直接推导其他团队能获得同样增益。

本文更新于 2026 年 9 月 8 日,将 9 月 6 日的披露作为近期资讯解读,不把它包装成当日新闻。

3.1 倍不是 3.1 倍产出

“Agent 工作日”首先是运行时间的换算,而不是等价的人类劳动或可交付成果。Agent 可以并发运行,可能重复尝试,也可能在错误方向上消耗计算。所以,它更像“可调度的机器工时”,而不是劳动生产率的直接倍数。

OpenAI 自己也提醒,代码和实验数容易测量,但它们与真实研究进展的关系并不简单。当编码、环境排错和执行实验变快后,问题选择、研究品味、结果判断、算力和安全审查可能变成新瓶颈。实验数量上升可以是好信号,但只有在问题有价值、对照有效、结果可重现时,才会转化为研究进展。

“完成任务”仍然需要人类介入

公开数据中有一个比“工时”更值得关注的指标:对于估计需要人类 4–8 小时的任务,过去六个月里,超过一半的成功案例仍经历了至少一次人类介入。[1] 这说明较长任务已可委托,但“委托”还没有变成“无人值守”。

对企业而言,更实用的衡量方式是记录任务成功率、人工介入次数、无效实验比例、从结果到验证的时间,以及错误结果进入下游的概率。如果只展示 token、会话数和 Agent 运行时长,很容易把“忙碌”误当成“有效”。

为什么要把 AI 研发拆成任务链

OpenAI 在分析内部使用时,引用了 Epoch AI 提出的 AI 研发分类:决策、设计、构建、运行、分析和沟通六个阶段。Epoch AI 进一步把它们拆成 60 多项任务,并明确说明这仍是一份主观的初步分类,不能仅靠一张任务表判断科研自动化程度。[3]

这种拆分有助于看清能力边界。一个 Agent 也许能写评估脚本、修复训练环境并汇总结果,却未必能决定哪个问题值得投入、哪个异常应该追踪,或者某项能力是否应该扩大。如果只优化最容易自动化的“构建”和“运行”,就可能在更难测量的“决策”和“分析”上产生偏差。

安全约束不是附加项

OpenAI 首席科学家 Jakub Pachocki 在同日发布的文章中,将自动化 AI 研究与对齐、监控、网络安全和人类控制放在同一个讨论框架中,并明确反对把“继续快速扩展”当成理所当然的集体选择。[2] 这不是一个已被独立验证的安全结论,而是 OpenAI 管理层公开表达的风险判断和行动方向。

对实际团队来说,至少应落地四条护栏:研究 Agent 默认使用最小权限;训练、部署和外部写入分开授权;重要结论要求可重现证据和人工复核;异常行为、监控缺口或高危能力一旦触发阈值,必须先停止而不是自动重试。

对今天的研发团队有什么启示

第一,从定义清楚、结果可验证的子任务开始,例如生成对照实验、排查基础设施问题、整理失败模式。第二,把人工介入当成流程设计,而不是 Agent 失败后的补救。第三,同时计算质量、成本、安全和可重现性,不要用单一的运行时长作为成功指标。

“自动化研究实习生”是一个值得追踪的里程碑,但它依然是公司在自定义和自有环境中宣布的结果。下一阶段的关键不是 Agent 还能多跑多久,而是行业能否形成可比较的任务分类、成功标准、介入记录和安全停止条件。

参考资料