阿里巴巴旗下千问(Qwen)团队在8月3日发布公告,将千问3.8-Max模型正式推出。这款模型拥有2.4万亿总参数量,其中激活参数达到95B,堪称千问系列里规模最大、性能最强的代表。值得注意的是,这是千问团队首次开源Max级别的模型,相关权重资料计划于下周在开源社区Hugging Face和ModelScope上线。
在商业层面,千问3.8-Max通过阿里云的千问AI平台对外提供API接口服务,其收费标准设定为:输入端2.0美元/百万tokens,输出端则收取6.0美元/百万tokens,隐式缓存的单价为0.25美元/百万tokens。
权威基准测试表明,千问3.8-Max在编程智能体和通用智能体等多个维度上与Anthropic Fable5保持在同一水平线,部分关键指标还实现了超越。比如,其PaperBench得分为93.0,高于Fable5的88.8;CoWorkBench得到74.8分,与Fable5的75.9分十分接近;WideSearch测试中取得81.9分,与Fable5的81.2分持平。
从性能数据来看,千问3.8-Max与Anthropic Claude Fable 5在多个核心指标上展现出同等水平,甚至部分测试项目表现更优:
多模态处理能力同样亮眼:
需要提及的是,Fable 5的个别实验可能采用了回退机制,千问团队在相关注释中已对此加以说明。
针对编程能力,千问团队通过三个实际案例验证了模型的自主开发水平,整个过程完全无需人工参与干预。
实操案例一:实现十天时间级别的自动编程。该模型从零状态开始构建oh-my-cli项目,在约16天内累计提交265次commits、完成127个PR、解决151个issues。它将用户意见反馈、社区实践经验及自测报告整合进工程流程,达成了需求自动获取、代码自动生成、测试自动验证的完整闭环效果。
案例二:完成论文复现且实现超越。模型独立运作约125小时期间,编写出了约7,600行代码,执行超过1,100步操作,经过33轮GPU训练,成功复现了学术论文《Unified Data Selection for LLM Reasoning》的六项核心观点。其后进入"自我迭代"阶段,提出18个改进方案并通过测试验证,最终在AIME24数学竞赛基准测试中,将论文原始方法的成绩提升了2.7分。
案例三:在WWW2025多模态对话意图识别竞赛中脱颖而出。模型在参赛队伍526支人类组成的激烈竞争中,通过45次迭代提交,准确率从0.60提升到0.853,最终战胜了458支对手队伍。
针对办公场景和长程任务处理,千问团队在数百类高价值职业领域检验了模型的生产力表现。
在E-Commerce Bench(为期365天的电商运营模拟基准测试)中,千问3.8-Max斩获¥416,252的最终收益,表现超过GLM 5.2模型达38%,较上一代千问3.7-Max的成绩提升了152%。
芯片设计优化方面,该模型展现了出色的长程自主规划才华:
任务目标是优化一个G CD/RSA密码硬件加速器的逻辑门数量配置。模型在未提供参考设计、无人工指导的条件下达成了约500轮交互沟通、71次性能评估,穿越了13个重要节点,将初始8,298门设计精简为678门,在所有参赛模型里实现了最佳表现。
硬件物理实现层面,芯片面积比例从106×106 µm²压缩至46×46 µm²,布线长度从33,369 µm缩短到4,187 µm,同时确保了500 MHz频率下的时序需求满足,芯片整体面积实现了高达81%的缩减比例。
关于多模态处理能力,千问3.8-Max的视觉执行机制不只是"识别图片",而是建立了一个贯穿始终的反馈循环:
模型在任务执行时会持续监测中间产出状态——检验页面布局、物体朝向、动画表现等细节——发现偏差后能自主进行问题定位并采取修正措施,确保任务流畅推进。










网友评论