8月14日,开源 AI 基础设施公司 Prime Intellect 发了一篇博客,叫《Measuring Autonomous AI Research》。名字很学术,内容说白了是一场”AI 科研竞赛”:他们把 18 个前沿模型扔进同一个任务,用尽可能少的训练步数,把 1.24 亿参数 GPT 的验证集 loss 压到 3.28 以下。起点是 3290 步,人类公开的最好成绩是 2600 步。
实验规格不小:153 次完全自主的运行,每次独占 8 张 H200,单次最长跑了 8 天,全程断网、锁在沙箱里,只留一个日志通道。参赛名单也豪华
结果先说最扎眼的:没有任何一次运行提出真正意义上的新方法。大家找到的招数,无论是 normalization、学习率调整还是权重平均,都能在已有文献里找到影子。
有意思的地方恰恰在这:想法趋同之后,模型之间的差距反而更刺眼。
按量子位的报道,跑得最好的是 Fable 5,2726 步,把 baseline 到人类纪录之间 690 步的空间吃掉了大约 82%。Opus 5 是 2920 步。开源权重阵营里,Kimi K3 搭配 Prime Intellect 自家的 Prime Agent Harness,跑出 2930 步,超过 GPT-5.6 Sol 的 3042 步,离 Opus 5 只差 10 步。
我第一反应是:最贵的模型没赢多少,开源模型也没输多少。
差距到底在哪?Prime Intellect 的分析很直接:模型想到的东西差不多,拉开差距的是怎么把它试出来。弱模型一个 seed 跑差了就放弃整个方向;强模型会换 seed 重测、反复消融,recipe 变了还把旧方案捡回来重新验证。Opus 5 重新调 β2 刷出新纪录,Fable 5 一次重新探测旧方案省下 31 步。Kimi K3 甚至在持久 IPython 内核里给自己搭了一套研究流程,写实验函数、比 loss 曲线、恢复 baseline,还建了个小数值实验室验证 Newton-Schulz。
到这里,结论就有点反直觉了:科研能力越来越像一个试错吞吐量问题。拼的是单位成本里能跑多少实验、能多快排除错误。那些微弱但真实的信号,谁能抓住并一轮轮叠起来,谁就赢。idea 本身反而没那么稀缺了。
这对”AI 开发 AI”的叙事是个不小的修正。过去默认的剧本是:最强闭源模型先跨过自我改进的临界点,然后一路滚雪球,赢家通吃。这次实验给出了另一个版本:模型不一定非得最强,只要底下这套实验机器够快够便宜,开源模型靠更高的试错吞吐量照样能追上来。
所以 Prime Intellect 把下一步押在 Multi-Agent Harness 上,顺理成章。既然大量工作都耗在写代码、跑实验、盯结果上,就没必要每步都调最贵的前沿模型。让便宜的开源模型负责执行和监控,把需要判断的环节留给强模型,同样的钱能跑出更多实验。
当然,冷水还是要泼。速通游戏有明确反馈,和真实科研不是一回事,真实科研里”提出好问题”的分量,大概率远高于这个实验能测出来的东西。而且实验自己也承认,没有模型发明新方法。如果 AI 科研只能在已知空间里爬坡,那离真正的科研还差得远。
但方向已经很清楚了:让 AI 做科研,拼的不只是模型智商,还有实验基础设施的迭代速度。这跟人类科研的规律其实一样,多数突破不是灵光一现,而是把平庸想法快速试出来的副产品。只不过现在,跑实验的不再是人类了。
参考来源:
- Prime Intellect 官方博客
Autonomous AI Research(2026-08-14) - 量子位:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5(2026-08-20)