科技

DeepSeek 给大模型划出的「斩杀线」,斩的到底是什么

来源:丹巴新文网
DeepSeek 给大模型划出的「斩杀线」,斩的到底是什么

一天之内,8 万亿个 Token。这是由 DeepSeek V4 Flash 这款模型,在某个 AI 编程工具上产生的单日消耗量。OpenCode 平台发布消息,透露 DeepSeek V4 Flash 正式版在其平台上运行时,总共使用了 8 万亿 Token。其中 5 万亿是免费额度带来的,另外 3 万亿则来自付费套餐 OpenCode Go。

拿这个数字和 OpenRouter 进行比较,后者接入超过 400 款模型,每月承载约 200 万亿 Token,折合每天大约 6.6 万亿。换句话说,DeepSeek 的一个模型,仅在 OpenCode 这一渠道上,单日的 Token 耗费就超过了 OpenRouter 整个平台同期的日均总量。

在 OpenRouter 上,DeepSeek V4 Flash 畅销,成为本周最受欢迎的模型之一。这与其价格策略密切相关。模型能力得到提升,而价格保持不变,原本被抑制的使用需求一下子就释放了出来。但 8 万亿 Token 这个数值背后,还有更深层的原因:人类与 AI 的互动方式正在经历转变。

此前,我们通常向模型提出问题,得到一段文字回复,交流就告一段落。如今,AI Agent 则能自主阅读文档、修改代码、运行程序、检验结果,遭遇失败还能重新尝试。单个任务可能持续数小时,需要调用多个工具,甚至让多个 Agent 协同工作。

模型生成的代码量或许没有显著增加,但消耗的 Token 却可能增长几十倍乃至几百倍。有人使用 Claude Opus 5 构建一个单页 3D 游戏,模型需要不断生成页面、截图查验、继续调整。最终成果只是一个 HTML 文件,但一句指令却耗费了 6.9 亿 Token,费用接近 3000 元人民币。

Agent 驱动的任务大量涌现,这使得模型的价值评估不再只看智能程度,性价比成为关键考量。衡量模型的标准,也从「单次回答有多聪明」转变为「完成一项复杂任务需要付出多少成本、耗费多长时间、以及失败几次」。

依照这套标准,DeepSeek V4 Flash 开始具备所有模型难以匹敌的竞争优势。一百万个输出 Token,DeepSeek 的收费是 2 元人民币。Anthropic 的 Claude Opus 4.8,标准定价为 25 美元,约合 170 元人民币,单纯从输出 Token 单价来看,二者相差约 85 倍。

7 月底,DeepSeek 发布 V4 Flash 正式版,在保留模型架构与规模的前提下,通过重新训练提升了编码能力和 Agent 任务表现。次日,大模型竞技场 Arena 发布前端编码评测榜单,将 V4 Flash 列为「价格—性能」类别的顶尖模型之一。根据 Arena 在 8 月 2 日截取的页面信息,V4 Flash 的排名一度领先于 Opus 4.8 Thinking。

Artificial Analysis 的 Intelligence Index v4.1 给出评分,V4 Flash Max 获得 50 分,Claude Opus 4.8 Max 获得 56 分。前者跑完整套评测产生的模型调用费用约为 72.02 美元,后者则高达 3752.55 美元。换言之,Opus 多得了 6 分,但执行相同评测的费用高出约 52 倍。

V4 Flash 当然尚未完全超越 Opus,但只要两者能够同台竞技,巨大的价格差距就足以影响默认的选用决策。当模型价格高出几十倍,而性能优势仅几个百分点时,选择变得异常困难。最先感受到冲击的,可能并非规模最小的模型。价格亲民、响应迅速的小模型仍然胜任分类、提取和路由等简单工作。最顶级的旗舰模型仍会处理疑难杂症,或在高失败成本场景中充当保障。真正处于两难境地的是那些处于中间地带的模型。

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~