Token工厂第一客户不是人类!
作者/ IT时报 孙妍
编辑/ 郝俊慧
2026年的世界人工智能大会(WAIC 2026),若用一个词形容,那无疑是“热”——7月骄阳似火,算力基础设施赛道更是热度飙升。
“去年WAIC我们愁的是卖不掉,今年供需反转了,算力不够、算力太贵、算力涨价。”PPIO联合创始人兼CEO姚欣对《IT时报》记者坦言。
一年之间,从“算力卖不掉”到“算力紧缺”。表面看,这是Token工厂的集体爆发。但水面之下,一场围绕智能体时代算力基础设施定价权与话语权的深层博弈,已在供需反转的大幕下悄然拉开。
WAIC 2026上,Token工厂模式不尽相同,却有着高度的共识:第一客户从人变成Agent。硬件见顶,软件是下一个10倍降本的主战场。
Kimi算力“熔断”
算力供需大反转
7月17日,在WAIC 2026开幕当天,月之暗面发布新一代旗舰模型Kimi K3,在权威的Text Arena综合排行榜中,该模型以1486分位列第9名,成为首个进入全球前十的开源模型。
然而,发布48小时后,因用户请求量大幅超出预期并逼近集群承载极限,Kimi不得不在7月19日宣布暂停C端新用户订阅。“Kimi很好用,但是动不动就得订阅会员,用不起。”上游算力涨价潮已直接影响C端用户的选择。
算力紧缺,是当前大模型行业的共性困境。“计算需求在指数级攀升,今天,仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的鸿沟。”无问芯穹联合创始人兼CEO夏立雪这样描述当前市场紧绷状态。
商汤大装置披露的数据也印证了这一趋势:其日均Token服务量已达2.42万亿,预计2026年全年服务规模实现25倍增长。
供需反转背后有两个动因。AI应用从聊天交互向智能体任务进化,单智能体Token消耗可达传统对话应用的百倍至千倍级,正如中国工程院院士郑纬民指出的:“驱动智能体的Token正在成为新的‘石油’。”
姚欣观察到,企业内部大量重复性劳动正在被AI改造,而使用最积极的不是技术人员,而是财务、人事、行政、市场这类非技术岗位。与此同时,OPC(一人公司)正在涌现,它们的Token月消耗量可达百亿级别,这一量级以前只有大型企业才能达到,而且OPC公司的人类员工与AI员工比例可以达到1:10,甚至1:20。
第一客户
从人变成智能体
“云的第一客户从人变成了Agent(智能体)。”姚欣的这一判断,在WAIC 2026上获得了来自产学研各界的呼应。中国信通院云计算与数字化研究所副所长栗蔚给出了一个新的定义——Agentic Cloud:以云计算资源为基础底座、大模型能力为核心驱动、智能体服务为基本单元,具备理解用户意图并自主完成复杂任务能力的新一代云计算服务体系,“正在成为未来主要云服务模式”。
云服务正从“降本”转向“增值”,交付的不再只是低成本算力资源,而是承载智能与能力的新模态服务。PPIO升级为Agentic Cloud,商汤大装置进化为“算力+平台+服务”全栈AI基础设施服务商,无问芯穹延伸至“前店后厂一中心”。三家的演进方向,都是从单点的算力基础设施走向融合运行环境、任务编排和应用的服务体系,目标都是要打造面向Agent时代的Token工厂。
正因客户主体发生转变,智能体的消费模式与人类存在本质差异。姚欣将其概括为“脉冲式使用”:人在使用虚拟机时,开启后往往连续运行数月不关机;而Agent调用沙箱时,完成任务即停止,一台虚拟机的单次使用时长可能仅1分钟便会关闭。这种模式对时延和并发的要求远高于传统场景。
对此场景,PPIO的应对措施是通过Harness手段托管Agent,实现7x24小时长时间运行,并且可以自我修复;无问芯穹用智能体能力反哺基础设施自身,打造运维智能体蜂群,以Agent能力驱动整套AI Infra形成自主迭代、自我优化的闭环。
硬件见顶
软件是下一个10倍降本的主战场
共识正在形成:GPU硬件的性能提升正在触达物理天花板,未来Token成本的下降将越来越依赖软件层面的系统级优化。
姚欣的分析最为直白:“GPU芯片已经到了物理极限,现在用的是3nm制程,2nm应该就到顶了,根据相关技术数据,2nm工艺相比3nm制程仅能实现约20%的晶体管密度提升、15%左右的性能提升,晶体管密度最多提升1.15倍,已经没有再提升10倍的能力了。”
他将未来成本下降的希望寄托于软件:“每隔12个月,智能体的使用成本就会下降至十分之一,软件的增长空间极其巨大。”
他还指出,推理侧最大的成本变量已经从GPU转向了存储。因为Agent追求长期记忆,上下文已经扩展到百万级,“100万KB的上下文要全部保存下来,只能先放显存,然后是内存,最后再到硬盘,由此直接推高了存储成本”。
降本,是所有使用者的诉求,必然也是所有Token工厂的核心思路。商汤大装置通过异构混推技术提升国产算力性价比,相比国产同构推理,异构混推集群实现同成本Token产出规模扩大2.5倍;无问芯穹在过去一年通过全栈技术实现推理成本下降10倍,并预期跨集群异构PD分离架构的规模化落地,还能再带来10倍下降空间。摩尔线程通过异构流水线组合,在硬件规格仅为国际主流产品一半的情况下,达到同等的推理水平。
Token工厂
不同的战略锚点
在WAIC 2026上,PPIO、商汤、无问芯穹、摩尔线程等多家Token工厂都抛出了战略之锚。
全栈优化派PPIO
姚欣将黄仁勋的五层蛋糕模型(能源—芯片—基础设施—模型—应用)作为参照,指出PPIO从第二层到第五层全部涉及。
“今天不仅仅要看Token生产的数量有多少,更要看Token的智能和毛利率,所以一定要做端到端的全栈式优化。”姚欣强调,目前国内真正能够做到全栈优化的厂商仍极其稀缺。
基于这一逻辑,PPIO推出的核心利器是智能模型网关。智能模型网关是AI Agent的智能调度中心,关键决策由混合模型把控以提升质量,简单任务则通过模型调度自动分流至轻量模型,确保Agent以最低Token成本、最优智能性能完成任务。当用户提出法律合同审查、医疗初步诊断等需求时,网关会将问题同时分发给多个擅长此道的专家模型,通过交叉验证和融合生成最终答案。
PPIO的混合模型可以将性能提升至接近Claude Fable5的水平,而成本却大幅降低。据综合测算,智能模型网关可以将智能水平提升20%,将成本降低50%~60%。
商汤大装置的国产化叙事
Token工厂叙事,则嵌在一条更大的国产化替代主线下。
商汤科技联合创始人、大装置事业群总裁杨帆判断:“未来五年国产化替代绝不仅仅是GPU的替代,而是背后整个AI基础设施生态体系的重构。”
摩根士丹利预测,最乐观的市场情景下,中国AI芯片自给率有望在2030年达到76%。
在国产芯片突围的背景下,商汤大装置的核心突破是异构混合推理。商汤大装置事业群CTO宣善明披露,通过异构混推,主流国产芯片MFU提升85%至152%,整体推理性价比达到NVIDIA H系列的1.25倍。在能效方面,商汤大装置提出了TPW(Tokens Per Watt)指标,将电力消耗与Token产出直接挂钩,替代传统的PUE能效指标。据商汤大装置数据,通过端到端全链路优化,单位电力成本Token产出已提升80%。
在产业落地的“最后一公里”,商汤大装置与电信运营商殊途同归,以FDE(前沿部署专家)模式交付结果。在先进制造领域,商汤大装置已服务5家上海大型国企,并总结出“1天明确业务价值、2天完成Demo验证、30天实现稳定版本上线”的AI“123”交付法则。
无问芯穹
“前店后厂一中心”
无问芯穹将Agentic Infra打造为“前店后厂一中心”:算力集散中心(自主式基础设施平台)、Token工厂(MaaS平台)、AI生产力商店(行业解决方案)。
它想通过全局资源一盘棋调度,实现十万卡级别以上的跨域计算资源支撑规模。无问芯穹的核心技术壁垒之一在于异构算力聚合,“算力的异质化、碎片化问题是全球性的,如何把不同的、跨区域的算力资源,高效聚合协同起来,是扩大智能资源规模的关键。”夏立雪认为。
无问芯穹联合中国电信完成国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升165%。同时,它还打通4个不同代际、不同型号的GPU集群,四集群协同性能提升41%。目前这套跨域训练系统已在全国部署触达超37000P算力、覆盖16种主流芯片,盘活了广域分散的异质算力。
在Token工厂层面,无问芯穹于2026世界人工智能大会发布了首创的新一代推理系统优化成果——跨集群异构PD分离架构(PDD),相当于让“偏科”的硬件只刷自己最擅长的题,实测显示该架构在实现首Token延迟降低51.5%的同时,单Token成本降低37.5%。
摩尔线程
从“芯”出发
与前三家从云服务或基础设施层切入不同,摩尔线程从芯片出发,提出了三大“AI工厂”的框架:模型训练工厂、词元生产工厂、智能体生产工厂。
摩尔线程创始人、董事长兼首席执行官张建中强调“全功能GPU”的概念,不仅能做训练和推理,还具备光线追踪和图形渲染能力,并称摩尔线程S5000是国内唯一具备光线追踪能力的智算芯片。
在Token生产工厂方面,摩尔线程的核心卖点是基于S5000的PD分离异构推理方案:将高算力需求的Prefill放在S5000上,将高带宽的Decode放在国际主流GPU上,相比于单独部署国际主流GPU同构方案,性价比优势显著。
从“种草”到“种树”
转化效率之争
当所有玩家都在谈论Token产能时,生产出Token还不是终点,将Token高效转化为产业生产力才是终局。
郑纬民表示:“Token与Token并不等值,如火如荼的算力基建也不等同于高效Token产能。”夏立雪提出的AI生产力公式或许是对这一趋势最凝练的概括:“AI生产力=智能资源规模×Token转化效率×AI生产力转化效率。”
行业正在从概念“种草”阶段进入实质“种树”阶段。PPIO的日均Token调用量超1.2万亿,商汤大装置的日均Token服务量已达2.42万亿,预计到2026年底将攀升至日均10万亿,全年实现25倍增长;无问芯穹半年增长曲线是40倍……这些不再是对未来的预测,而是已经发生的数字。但算力的终局不会是比谁能生产最多的Token,而是跑通从算力生产到价值落地的闭环。
Token使用者吐槽算力价格太贵,Token小厂坦承上游存储太贵,又面临国内Token市场面临大厂恶性价格战,毛利率接近负100%。
正如商汤大装置杨帆所言,人工智能企业如何实现持续的规模化盈利,“不仅是商汤的课题,也是当下众多大模型企业、AI应用企业所有人共同的课题”。
排版/ 季嘉颖
图片/ IT时报 采访对象
来源/《IT时报》公众号vittimes