“最强模型”的周期似乎正在变短。
定焦One(dingjiaoone)原创
作者 | 雷晶
编辑 |金玙璠
仅仅一个月份内,就有9款旗舰大模型选择推向市场,这样的频率并非大模型行业发展常态。
月初,腾讯混元Hy3完成正式版本发布并实现开源,月底Anthropic推出Claude Opus 5,期间Kimi K3、Qwen3.8-Max预览版、Grok 4.5等模型也接踵而至。7月呈现出一年来少有的高密度发布态势。
各机构选择发布时机不尽相同。部分企业选择在竞品更新后迅速跟进,有的则在世界人工智能大会期间集中亮相,还有的通过价格策略来回应市场挑战。
但7月发布潮背后的两个变化,更为引人关注。
其一,模型间的能力鸿沟正在收窄。Artificial Analysis最新智能指数综合评估显示,头部模型得分差异已显著减小。随着版本快速更新,“最强模型”的宝座愈发难坐稳,各大机构开始分化赛道,找寻自身擅长领域,而非执着于单一指标的绝对领先。
其二,开源模型跻身第一阵营。7月推出的新模型中,腾讯混元Hy3、Kimi K3等纷纷开放模型参数供开发者下载部署。例如Kimi K3在Code Arena前端开发排名中领先,超越GPT-5.6 Sol和ClaudeFable 5。过去数年间,开源模型常被视作闭源模型的参照系,但此番竞争表明,开源模型已能在部分开发环境与闭源模型抗衡。
这场密集发布潮究竟带来哪些影响,又预示着何种趋势?
01.不再只比谁更博学
以往几年,大模型行业侧重通用技能比拼,比拼知识广度与回答精准度。眼下,比较维度已发生转变。
此番竞争,代码应用能力成为最突出的焦点。
OpenAI持续增强编程及复杂推理能力,不断扩充Codex生态,意图通过开发工具锁定程序员用户。Anthropic将重心放在代码理解与安全审查,协助开发者解决大型项目工程难题。Grok 4.5则注重高效与低成本,并与AI编程工具Cursor协作,覆盖常规开发场景。
大模型研究者姚宇航告知「定焦One」,各企业正重点投入编程能力建设,差距也在迅速缩小,比如Kimi K3的代码能力已有明显进步,正逐步逼近顶尖闭源模型水准。
图源 / pexels
智能体是各家争相布局的另一个焦点。GPT-5.6 Sol借助Codex探索自动化编程,Opus 5强调长程任务执行,Kimi K3展现实时运行复杂任务的长链能力,腾讯混元Hy3则尝试结合微信生态推进智能体应用落地。
但智能体在实践操作中仍存局限。独立开发者北城指出,当前智能体产品瓶颈并非工具调用,而是任务调度能力不足。以Codex的Ultra模式为例,会触发多个子代理,不同的子代理会重复读取同文件进行类似分析,最终Token消耗增加,但效率并未提升。在他看来,智能体能力改善不能仅靠增加子代理数量,关键在于能否判断哪些任务值得关注,哪些步骤可以简化。
姚宇航观点与之相近。他认为智能体是现阶段最值得期待的方向,但仍需时日走向成熟。在他看来,医疗、金融等专业领域的智能体存在巨大发展空间;未来拉开差距的关键不仅在于模型本身能力水平,还在于智能体在具体场景中的适配度及客户接受程度。
国产模型则通过差异化能力增强寻求突破。Kimi K3选择强化长上下文、前端编程与产品设计能力,在多项编程测试中位居前列,水平已接近海外闭源旗舰模型水准。
参数规模与推理效率之间的较量,也构成竞争主轴。
7月发布的多款模型参数规模突破万亿甚至数万亿大关,但参数数量已不能直接代表能力高低。随着MoE架构的演进,模型可获得更大的参数规模同时保持高效运行。









网友评论