2026年的WAIC上,机器人依旧是焦点,但增长最快的新面孔,来自一个自称“AI Infra”的领域。不少老牌公司也在转型,名片上赫然写着“AI基础设施”。资源对接平台似乎也在向这个方向靠拢。整个产业链,像是要向更贴近用户的位置迁移。
道理很简单:大模型应用的商业化尚不明朗,提供AI相关的基础设施,似乎是更稳当的买卖。但走出展馆,现实的产业图景就不那么热闹了。过去三年,各地兴建了大批智算中心。如今,有些中心排满了订单,有些却在公开招商,用近乎成本的价格寻找客户;与此同时,模型企业和科研机构依旧抱怨算力不足。
卖基础设施的公司越来越多,但市场上“能用”的算力并没有增加。这种矛盾,藏在“AI Infra”的一条话术中:这是一条产业链,每家公司负责交付自己那一段——芯片、互连设备、存储单元、调度软件。而用户最终关心的,不是某一段的进展,而是整个任务能否按时完成、稳定运行。把这一切组织起来,提供完整的服务,这才是算力服务。
这条产业链可以容纳无数玩家,但算力服务却注定是少数人的游戏。
理解为什么,需要先看清算力这种商品的特别之处。
01 部件的升级,并不一定等于能用的算力
算力最让人易错的,是它看似像标准品——按卡计费、按小时结算,和水电类似。
实际上不尽然。
同样数量的计算卡,放在不同的网络架构、存储系统和软件环境下,表现可能天差地别:一套擅长大模型推理的集群,未必能应付高通信负载的训练任务;能跑主流开源模型,不代表能直接承接科学计算或工业仿真的需求。
即便硬件完全相同,系统的规模、互连效率、任务调度和软件适配的差异,都会导致最终交付给用户的有效算力不同。
产业链交付的是各部件的性能指标,用户需要的是一套系统的结果。中间需要大量的工程整合工作——而这恰恰是链条上多数参与者并不擅长的环节。
于是,部件层面繁荣的市场,出现了许多尴尬的中间状态:资源闲置,但系统不好用;平台众多,但无法掌控资源;客户不少,却无法解决应用难题。
撮合平台能指出哪里还有空闲的卡,却无法通过调度界面解决驱动兼容、存储瓶颈和集群通信效率的问题;资源方可以出租设备,却无力帮助客户迁移应用;集成商能把系统搭建起来,却不一定有能力持续导入任务。
这就是算力短缺和资源闲置能同时存在的原因:用户需要的从来不是一张卡,而是一套“开箱即用、运行稳定、故障有保障”的计算环境。
看到这里,可能会自然产生一个疑问:大型云厂商不是专门做这个的吗?
在标准化场景里,确实如此。头部云厂商的GPU云服务已经相当成熟,涵盖弹性、计费、生态等各方面。
然而,云的商业模式建立在标准化和规模化的基础上,优先服务需求量大、负载可预测、毛利结构清晰的客户。有几类需求,恰恰落在这模式的盲区:
科学计算和工业仿真项目,定制化程度高、单客户规模有限,往往要求FP64精度和特殊软件栈,投入产出比远不如标准推理业务;涉及数据主权、本地化部署和信创要求的政企与科研客户,需要的是一套建在自己机房里、还得有人长期负责的系统,而不是公有云上的租户账号;至于跨芯片、跨中心的异构资源整合,更是和云厂商“把客户留在自己技术体系内”的商业逻辑直接冲突。
云覆盖不好的这部分需求——综合、异构、长周期、重服务——才是算力服务真正需要攻克的难关。它的难点不在于把算力挂到网上卖,而在于把分散的计算资源,组织成可持续交付的能力。
02 一张计算卡背后,有三笔账要算清
这门生意的可行性,关键不在于显卡的标价,而在于能否算清三笔账:建设账、运营账、客户账。
先看建设账——
用户期望像购买水电那样按需购买算力,服务商面对的却是一个投资周期长、属于重资产的项目:机房建设、服务器采购、网络搭建……










网友评论