科技

沿用DeepSeek架构,美国大模型开始抄中国作业

来源:丹巴新文网

01、

OpenAI前首席技术官穆拉蒂,打造了一款针对中国市场的模型变体。

Thinking Machines推出的Inkling模型,其混合专家结构基本承袭自DeepSeek-V3,后续训练的冷启动过程亦运用了Kimi K2.5等开放平台产生的数据。但在一系列基准测试里,Inkling的表现力逊于Kimi与GLM,并且调用费用更为高昂。

对于这家获得20亿美元融资、账面估值高达120亿美元,且团队里坐落着众多前OpenAI成员的明星企业而言,这样的结果显得略低于人们的期待。

尽管如此,穆拉蒂似乎从一开始就没指望Inkling能在性能上独占鳌头。在美国企业使用中国模型遭遇日益增多的掣肘背景下,一款性能适中、支持个性化改造且合规风险较小的本土开放式模型,已经具备了自己的生存空间。“贵替”未必强横,却也并不缺乏需求。

穆拉蒂的首秀模型,情况果真如此?

全球时间7月15日,Thinking Machines Lab揭晓了公司发展历程中的首款产品Inkling。

单从参数配置来看,这款模型完全符合顶级AI实验室的规格水准。

Inkling采用了混合专家架构,总参数规模抵达9750亿,每个Token处理流程会激活410亿参数单位;预训练环节耗费了45万亿Token,数据类型包含文本、图景、声频及视频,上下文最大支持100万个Token。它能够解析文字、图像及声频信息,并将结果以文字形式呈现,同时允许用户调节“思考幅度”,在性能、速率和成本间取得平衡。

Inkling同步开放了模型权重,选用非常宽松的Apache 2.0授权协议。开发人员有权下载权重自行部署,或借助Thinking Machines的Tinker平台实施微调。

公司为它设定的目标明确:并非要直接挑战ChatGPT的用户市场份额,Inkling更倾向于作为企业开发AI应用的底层支撑。

不过,Inkling最引起关注的特质,深藏于技术文档的末尾部分。

Thinking Machines在介绍模型结构时直截了当地指出,Inkling的混合专家设计“主要精研了DeepSeek-V3”。它同样配置了庞大的专家模块,每个Token仅激活其中极小部分,并沿用了DeepSeek-V3的无辅助损失负载均衡等技术方案。

中国模型对Inkling的技术影响并未止步于架构层面。

Thinking Machines披露,为启动后续训练,公司先用开放平台提供的权重模型生成了合成数据进行首轮监督微调,其中明确提及了月之暗面Kimi K2.5。

整个技术脉络一目了然:由OpenAI前首席技术官创立的美国企业,其首款模型借鉴了DeepSeek的架构思路,又通过Kimi产生的数据完成了训练起步阶段。

参考开放模型本身无可厚非。DeepSeek和Kimi均开放了权重并提供使用许可,科学探索与工程实践本质上就建立在前人公开成果的积累之上。真正令人尴尬的是,Inkling撷取了中国模型的技术精髓后,性能表现依然未能超越这些“前辈”。

Thinking Machines对此并未掩饰。公司在发布声明里坦诚:“Inkling并非当下性能最优越的模型,无论属于开放类别还是闭源范畴。”

根据Thinking Machines公布的测试成绩,

.在“人类最后的考试”纯文本基准测试中,Inkling得分29.7%,Kimi K2.6与GLM 5.2分别为35.9%和40.1%;

.当集成应用工具后,Inkling提升至46%,仍落后于Kimi K2.6的54%和GLM 5.2的54.7%;

.在评估真实软件工程能力的SWE-Bench Pro测试里,Inkling得到54.3%的分数,Kimi K2.6为58.6%,GLM 5.2则达到62.1%;

.Terminal Bench 2.1上的分野更为显著,Inkling

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~