科技

不蒸馏,大模型公司的代价是什么?

来源:丹巴新文网

文 | 李炤锋

编辑 | 张雨忻

“标准化的训练流程,需将蒸馏作为初始步骤,助力模型迅速达标90分,再着手优化剩余10分。”一位大模型研究员阐述蒸馏在当前LLM训练中的角色时分享了这番见解。

他所指的“初始步骤”,即让性能相对较弱的模型模仿强模型已验证的答案和方法,快速构建一个基础训练版本。

对于模型研发公司,选择“不蒸馏”则意味着放弃这一加速手段,需从零开始自主研发。这种方式的优势在于训练体系的独立性,缺陷是模型迭代周期更长。

《智能涌现》早前报道过,字节跳动Seed团队在创立时便确立了“不利用蒸馏”的方针。一位字节员工解释,团队目标是进入全球顶尖水平,而蒸馏难以助其达成。张一鸣在7月底Seed内部的一次会议上更明确表态,即便暂时落后于国内同行,字节也不会将蒸馏当作提升模型能力的易走路径。

这番关于“不蒸馏”的宣言,不仅是训练策略的技术抉择,更是对长远规划的决断。

同一时期,英伟达CEO黄仁勋在接受Axios联合创始人迈克·艾伦采访时持有截然不同的看法:“蒸馏,即让AI通过学习其他知识源来获取能力,这是智能发展的根本。”采访结束后不久,黄仁勋转发了一封由英伟达、Meta、微软及戴尔等企业联合发起的公开信。信中倡导建立通用的开放模型生态,并将蒸馏定位为模型优化、测试和验证的关键手段。

蒸馏到底是否必要?回避蒸馏需要付出怎样代价,又能获得什么回报?《智能涌现》采访了多位大模型研究人员,探讨这些议题。

01 回避蒸馏需付出多长时间成本

“数据储备不足、算力匮乏,同时缺乏配套管线。”一位研究员对比了国内基模团队与海外领先者的现状,指出国内预训练技术虽与北美顶尖已缩小差距,但在后训练和高质量数据层面仍存显著差异。

蒸馏技术正是弥补这些“短板”的有效工具,能够显著缩短模型迭代周期。

那么坚持“不蒸馏”的字节跳动,能否豁免这些问题?实际情况并非如此。7月底的数据显示,字节的最新基模Seed-2.1 Pro在Code Arena WebDev总榜排名第16位,落后于排名第二的Kimi K3和第六的GLM-5.2。

多数受访研究员认为,“完全放弃蒸馏会导致进度大幅延缓,短期内若无蒸馏辅助,将很难在Coding和Agent能力上取得行业领先地位。”

模型能力提升面临紧迫的时间压力,这源于“数据飞轮”的运作机制。模型需先达到可用状态才会进入实际开发环境,能力提升带来更多使用,使用又产生新的训练数据,新数据再投入下一轮训练。

一位字节员工曾向《智能涌现》透露,其Coding模型进展缓慢的部分原因,是业务使用意愿不足导致数据回流不够。

“若‘冷启动’环节受阻,后续训练流程便难以启动。”一位研究员指出,他比喻这一过程如同“马太效应”:用户倾向于使用当前最强的模型,高频使用会带来更多真实任务数据,从而扩大模型间的迭代差距。

Agent应用进一步加剧了时间差异。在当前Agent场景下,多轮工具调用要求模型实现连续的规划、执行与纠错,一旦前期步骤出错,错误可能沿任务链不断扩大。模型从零探索成功路径通常耗时,远超过学习已知解决方案的速度。

然而,“不蒸馏”的制约作用在各项能力上呈现不同表现。Seed在LLM领域的表现虽未跻身国内顶尖行列,但字节在视频生成技术的全球布局已取得领先地位。

多位业内人士将Seedance的成功归因于“纯粹依靠数据”。一位了解字节的人士向《智能涌现》表示,Seedance的视频训练流程不借助外部模型蒸馏,用于数据筛选、理解等环节的VLM也无需依赖其他模型输出。

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~