科技

Fable 5夺冠!全球18大顶尖AI自主科研大赛,逼近人类极限

来源:丹巴新文网
Fable 5夺冠!全球18大顶尖AI自主科研大赛,逼近人类极限

新智元发布信息

AI自主科研浪潮汹涌澎湃

18款世界级顶尖大模型,被切断了网络连接,关入独立的计算机环境,连续开展研究长达8天。

谁能料到,实力最强的Fable 5脱颖而出——

耗费数十位精英工程师数月心血才铸就的纪录,它竟一鼓作气达到人类82%的境界。

同一年,OpenAI和Anthropic相继将「AI自主创造AI」的日程定在2028年。

这标志着首次有人用计算资源和时间,实际衡量了它和目标之间的距离。

研究成果一公布,立刻点燃AI圈子,连OpenAI的高层都赶来近距离观察。

有人评论,这堪称迈向「AI独立进行科研」的关键节点。「AI辅助」和「AI发现」之间的最后障碍,正被迅速消除!

全球顶级AI「闭关」钻研课题

断网持续8天

就在最近,Prime Intellect披露了一项空前的前沿AI自主科研实验。

早在五月时分,他们曾开展过一次尝试。

当时只动用了Opus 4.7和GPT-5.5两个模型,执行了约1万次运算、消耗了14000个H200 GPU小时,Opus获得2930步的成果。

这次直接动用了18个模型,进行了153场完全独立的实验,规模扩大了十几倍。

核心任务聚焦于「高难度挑战」:nanoGPT优化器速通挑战赛。

这条赛道声名显赫,由OpenAI研究员Keller Jordan在2024年5月亲自设立。

主赛道(Track 1)较量的是「实际耗时的钟表时间」。

过去两年里,人类工程师将训练一个124M参数GPT的时间从45分钟压缩至1.35分钟。

但AI这次比拼的是规则极为苛刻的纯优化器赛道(Track 3)。

在此赛道中,模型架构和训练数据均受限制,仅可调整优化器、学习率安排和初始化参数。目标是,以最少的步骤将GPT训练至验证损失值3.28以下。

人类目前的最高纪录定格在2600步。

这是几十位杰出工程师连续数月不懈努力后的成果,目前仍保存在一个未合并的代码库Pull Request中。

而AI的起始点是3290步。模型知晓「存在改进方案」,但每一步的优化路径必须自主探索。

实验环境设定为,每场试验独占一个8xH200计算节点,在bwrap+网络命名空间构建的「沙盒」内部运行。

智能体只能访问自用的工作目录、只读数据集和Python环境。

全程无法联网,唯一开放的网络接口仅限于一个用于日志传递的代理,仅能用于调用模型API。

验证标准更为严格。每条纪录必须在8个预设的随机种子上重复执行,八次算术平均值需低于3.27859。侥幸成功的概率不足千分之一。

研究团队还部署了专门的LLM审核员,每小时对所有运行状况进行监察,生成100多份报告,确认未发现作弊行为后才终止实验。

人类数月攻关的课题

Fable 5只差88%

实验启动时,系统仅下达明确指令——

读取program.md并严格执行。完全独立运作,不暂停也不提问。目标:用最少的train_steps达成验证损失平均值<3.28,持续刷新最佳表现。

Fable 5最终得到2726步,将690步的差距缩短了82%,仅余126步便可追平人类纪录。

Opus 5取得2920步,缩小54%。表现最差的GPT-5.5仅完成3234步,仅超越8%。

而且这项领先并非「单纯依靠连跑时间」得来。

在「统一资源消耗」对比中,将每个模型的最佳实验记录,全部控制在相同的时间/实验次数/输出token条件下进行评估。

无论是按照小时计算、实验次数计算还是输出token计算,排名几乎保持不变。

造成差距的,正是实验操作方法

此次实验最令人意外之处在于:所有模型无一提出全新研究思路。

它们使用的技巧,如优化预处理环节、调整梯度幅值界限、延长高学习率训练期、训练末期进行权重平均等,均可在文献资料中找到。

真正产生显著影响的是实验策略

模型性能的缺陷特别明显

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~