科技

GPT-5.6一夜刷新AI智能天花板!最小模型成本暴降25倍

来源:丹巴新文网
GPT-5.6一夜刷新AI智能天花板!最小模型成本暴降25倍

新智元披露

GPT-5.6将AI智能高度再次抬高

今日,OpenAI发布《GPT-5.6构建者指南》,展示出一份出色的成果。

在ARC-AGI-3测试中,GPT-5.6 Sol的表现从13.3%跃升至38.3%,输出Token数量骤减6倍。

另一面,「小巧版」Luna的展示同样令人赞叹:

在BrowseComp考核中,其以84.04%的成绩紧随GPT-5.5(84.36%),并将成本从33.27 美元降至1.33美元。

另外,官方还提供了详尽的指导,指导初创团队如何以较低成本运行GPT-5.6。

GPT-5.6性能大幅提升

输出Token减少6倍

短短一个月内,GPT-5.6 Sol悄然完成了内部进化。

一直以来,ARC-AGI-3被视为顶尖AI尚未达到50%难度的测试,测试规则相当简单——

把AI放入一组全新的2D小游戏里,不提供使用说明,让它自行摸索游戏规则。

结果,GPT-5.6 Sol在官方排行榜上获取了7.8%的分数,GPT-5.5仅有0.4%。

比较上一代产品来看,同一Sol在ARC-AGI-2上获得了92.5%的得分,还成功通过了《宝可梦·火红》。

为此,OpenAI研究员Ilan Bigio和Ted Sanders调查了原因,毛病出在harness上。

ARC官方的「通用harness」完成了两大任务:每执行一步,就把模型的私人推理进程舍弃;上下文满载时,就从中剔除最旧的记录。

换言之,模型每执行一步,记忆就会被清零,然后重新开始。

因此,团队将harness换为Responses API,开启「推理保留」与「压缩」两个选项,再次运行公开题集。

意外的是,GPT-5.6 Sol从13.3%提升至38.3%,且输出Token削减了6倍。

「小型」Luna

成本更为低廉

《建造者指南》中最引人注目的对比,来源于BrowseComp。

这是OpenAI创建的,专门测试「能否在网上输出特殊事实」的排行榜。

三个月之前,GPT-5.5开到Extra High级别,取得了84.36%的成绩,总计花费33.27美元。

如今,GPT-5.6系列中最小最经济的是Luna,以同样Extra High模式,获得84.04%的成绩,花费1.33美元。

尽管成绩仅相差0.32%,但成本大幅削减了25倍。

当然,OpenAI想要强调的是——

三个月之前,只有旗舰GPT才能完成的任务,现在最低配置的Luna也能实现八九不离十的效果。

让GPT-5.6自行编写代码、运用工具

指南中,OpenAI还提供了三种方式,都是实现GPT-5.6更低成本运行的方法。

首个方法是程序化工具调用(Programmatic Tool Calling)。

以往的Agent如同事无巨细的老板:每收到资料,都必须亲自审阅一遍,才能确定下一步行动——

调用100次工具,就得往返100回。

现在模型能够直接编写Java代码,在沙盒中批量调用、筛选、整合工具,只拿出最终表格返回给模型。

金融研究公司Rogo的测试显示,在质量持平的条件下,输入Token减少了21%。

第二种方式是「原生多智能体」。

主模型扮演工头角色,将任务拆分给多个子模型并行处理,最后汇总结果。

ChatGPT里的ultra级别,原本就是用这种模式运行的,默认设定四个agent同步工作。

产品公司Obvious的联合创始人Jon Bell说,他们一次性输入了六份需求,边编写边搭建边讨论,整个过程未出现混乱。

第三种是「提示词缓存」。

缓存有效期延长至至少30分钟,还能自行设置断点位置。

AI公司Ploy的工程师给29000 token的共享提示词增加了断点和工作区专属键,未命中的输入直接减少了28%。

每秒处理750个token

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~