商汤科技联合创始人、大装置事业群总裁杨帆
出品|搜狐科技
作者|郑松毅
今年WAIC展会过后,能清楚察觉到行业风向有变。除了持续火爆的“人工智能”、“具身智能”,新冒出个热度颇高的词——Token工厂。
AI的推理和交互都离不开Token,这个就是AI时代的最基础生产资料。Token工厂,实际上就是用来大规模、低成本地生产AI算力与推理能力的核心设施。
随着智能体Agent的普及,全网Token的使用量呈现爆发式上涨。中国信通院副院长魏亮提到,国内AI每天的Token调用数从2024年初的一千亿,到2026年3月已膨胀到140万亿,短短两年间增加了千余倍,表明Token经济已经成型。
中国工程院院士郑纬民指出,单个Agent任务的Token需求量,是传统聊天模型的上百倍甚至上千倍。目前国内高端算力供应跟不上需求,供需失衡问题更加突出,导致行业出现“低端算力空置、高端产能紧张”的问题。
进入这样的行业困境,2026WAIC期间,商汤大装置在上海举办了“算创·无限——Agentic时代AI基础设施创新发展论坛”,着眼于国产算力大规模落地的难题与解决方案。
活动之后,围绕国产算力的独特发展策略、太空算力等公众关心的内容,商汤科技联合创始人、大装置事业群总裁杨帆,大装置事业群CTO宣善明,首席科学家张行程等高管与搜狐科技等媒体深入探讨。
以下是交流内容的精选:
媒体:商汤大装置为何要发展国产异构混合算力?
杨帆:追求单卡性能最大化是一种性价比不高的做法。国产芯片对比海外高端芯片,差距依然存在。
因此我们选择了更实际的策略,即PD分离异构混合推理。我们不强求单张国产卡达到海外高端芯片的水平,而是把AI推理细分成两个环节,分工合作:适合国产芯片处理的吃算力的上下文读取交给国产卡,需要大量显存和低延迟的Token生成任务交给高端芯片。这样不同芯片优势互补,实现高效协作。
媒体:这套策略实施效果如何?如何证明不是空谈?
杨帆:在上海临港智算中心自建基地,这套组合拳使国产芯片的利用率提升了152%,相比国产同构方案,推理性价比是NVIDIA H系列的1.25倍,已经实现盈利。
媒体:今年WAIC展会上,“Token工厂”很常见,不少创始人说市场已经趋于饱和。你们如何看待这个市场?
宣善明:做Token工厂的企业数量很多,类型也各不相同:有传统企业转型,也有初创公司,规模大小不一。
媒体:会担心商业策略被对手模仿吗?商汤的技术优势在那里?
杨帆:商汤的竞争力不仅在于技术,还在于构建了“技术-生态-商业”的闭环布局,从“性价比、适配性、能效比”三个层面解决问题,推动国产算力从基本可用到大规模盈利。
媒体:最近Kimi发布了K3大参数模型,但承认自身面临算力不足的问题。模型参数持续增大是未来方向吗?这对Token工厂带来哪些挑战?
张行程:我们与主要模型厂商有紧密交流,模型参数持续增大是主流趋势,万亿规模的模型甚至几万亿参数的模型仍然是大方向。
大型参数旗舰模型对算力服务提出了新要求:模型参数整体巨大,少数专家参与的单次计算增量有限。但庞大的参数量加上大幅增加的上下文长度,对推理系统的存储要求极高,不仅需要显存、内存、高速存储构成的大规模KV Cache,还必须配合大显存GPU建立PD分离分布式推理系统。
同时,供应链限制也使高端算力芯片供应紧张,需要上下游紧密合作,完成从技术到供应链的全链路控制,才能满足需求。
媒体:一些企业对国产算力仍存疑虑,你们是如何逐步










网友评论