①算力租赁转型潮后,今年Token工厂这种新型交付业态集中规模化落地,数十家上市公司入局; ②中国工程院邬贺铨院士谈到,Token的消耗并不是以多为荣,而是以效率为荣; ③当前行业一方面强调高质量Token供给不足,另一方面仍存在算力利用不充分的情况。
财联社9月13日讯(记者 付静 张校毓)位于北京亦庄的北京壹号词元工厂内,一块大屏幕上显示了TTFT(Time to First Token,首Token响应时间)、TPOT(Time Per Output Token,Token输出耗时)、TPM(Tokens Per Minute,分钟级Token吞吐量)等关键指标,直观反映这座由软通动力(301236.SZ)投建,今年6月刚刚投产、日产Token1.4万亿的词元工厂的运行状况。
“我们原来做ITO(信息技术外包)业务,2024年公司战略转型,AI基础设施服务、Token服务是重点的发力方向。我们有9万名程序员,在Coding场景已经形成商业闭环的背景下,先不说对外提供服务,我们内部都急需Token,所以我们做Token工厂有必然性,它是一个重要的技术、资源储备的过程。”软通动力相关负责人告诉财联社记者。
而在中国(河北)自由贸易试验区正定片区,由常山北明(000158.SZ)投资兴建的常山云数据中心,大模型API(Token)销售服务也在如火如荼地开展。
“模型能力在快速普及,但是真正用上AI的门槛还没有降下来。常山云词元工厂就是为了降低这个门槛,把AI算力做成一种随取随用、价格透明的公共基础能力。词元工厂上线十来天已经有100多个客户,个人用户词元调用量77亿。”常山云数据中心技术总监李强介绍。
财联社记者获悉,这座冀南地区建设规模最大、等级最高的第三方数据中心,已完成从传统机柜托管向智能算力服务的战略转型,建成“北明智擎”智能算力创新赋能平台,总算力达2248P。
这是2026中国算力大会前夕,财联社记者透过“算力中国行”(京津冀)调研活动观察到的两个上市公司转型案例。继此前的算力租赁转型潮后,今年Token工厂模式集中规模化落地,数十家A股上市公司入局,云厂商一体化玩家、第三方独立运营商(如硅基流动)、硬件资源持有方均盯上Token服务市场的“蛋糕”。
Token作为大模型处理信息的最小标准化单元,解决了AI产业长期缺乏统一算力与服务度量标尺的行业难题,已是AI产业的核心生产要素。在2026中国算力大会,Token受到与会者的高度讨论。
中国工程院邬贺铨院士在大会主论坛上谈到,智能体显著增加了Token调用量,今年3月国内Token的消费已经达到日均140万亿。“Token的消耗并不是以多为荣,而是以效率为荣。”邬贺铨院士还明确指出。
从“租卡”到“买服务”,Token工厂改变了什么?
2026中国算力大会期间,中国信通院云大所算力中心与能源部主任王月介绍,智算产业已形成“基础设施交付-集群组织调度-Token能力输出-行业应用落地”四层供给架构。其中,Token服务是一种将异构算力封装为标准化推理产能的新型交付业态,通过屏蔽底层多架构硬件差异,将异构智算资源统一封装为以Token为计量单元的标准化推理产能,面向各类AI应用提供可调用、可计量、可交易的专业化推理算力供给。
(财联社记者摄)
“Token工厂本质是把传统的卖GPU算力,转为把算力和推理引擎、模型、负载调度等服务打包,直接对外交付按Token计量的标准化推理服务。”IDC中国研究副总裁周震刚向财联社记者表示,传统算力供给通常按卡、整机或机柜集群租赁算力,而Token工厂交付的是可直接调用的Token产出。
具体到与传统算力租赁的核心差异上,王月从计费单位、交付标的、用户负担等细分维度将GPU卡时租赁与Token服务进行了对比。前者采用GPU小时计费,交付标的为硬件实例,用户需负担的是部署、调优、运维;后者按Token个数计费,Token消耗量为交付标的,用户负担仅API调用。
在周震刚看来,Token工厂的意义最主要在于推动推理算力标准化,通过统一计费标准和SLA,帮助加速AI应用层(智能体Agent等)规模化落地。一方面,统一做模型量化、KV Cache及多模型路由,可以提升算力产出效率;另一方面,提供轻量化接入,中小企业无需自建私有集群,直接采购Token即可快速上线服务,降低AI创新门槛。
而对于模型厂商和应用开发者而言,也可以把算力调度、推理工程化外包出去。“让模型厂商专注模型迭代,让最终用户/ISV专注于Agent开发。”周震刚表示,这有助于降低相关主体的基建与运维负担,减少资本开支。
北京壹号词元工厂相关负责人也谈到,“Token工厂更贴近应用层,对外面向大模型厂商、云厂商、C端客户售卖Token。”软通动力已在北京亦庄、广东韶关、贵州贵阳投建三座词元工厂,三座工厂规划日产能超3万亿,未来计划在全国多个算力节点城市完成词元工厂布局。
据财联社记者梳理,目前已有包括润建股份(002929.SZ)、弘信电子(300657.SZ)、行云科技(300209.SZ)、超讯科技(603322.SH)、南威软件(603636.SH)、证通电子(002197.SZ)、紫光股份(000938.SZ)、网宿科技(300017.SZ)、优刻得-W(688158.SH)、青云科技(688316.SH)在内的不少上市公司加快布局Token服务业务。今年5月,中国电信(601728.SH)百亿级Token工厂集采落地,更是引发产业高度讨论。
从需求场景看,北京壹号词元工厂方面介绍,目前超过50%的业务量集中在Coding场景,其次是AI办公等领域。
“量爆发、价上涨”格局下,成本约束也在变得具体
“Token的运转其实是三件事:需求、运营和供应。需求决定了消耗的总量,运营决定了成本,供应决定了天花板。”常山云数据中心技术总监李强介绍。
向Token化算力服务转型,意味着运营方需要承担更多责任。硬件能否稳定运行、模型能否高效部署,以及不同客户的请求如何调度,都会影响最终交付的服务质量和成本。
价格方面,据邬贺铨院士在大会上介绍,每百万Token价格在2024年约为8-15元,2025年约为5-10元,2026年普惠模型仅0.02元,高端推理模型则达到10-30元。
(财联社记者摄)
王月分享的数据显示,日均Token调用量两年增长超千倍,供给端高端芯片供给受限,算力卡与存储芯片成本上行推高边际成本,供需缺口推动头部API输出价格一年余(2025年Q1-2026年Q2)上涨80%,当前市场呈现“量爆发、价上涨”格局。
“AI已经走过了‘能不能做’的功能验证期,现在进入的是‘能不能用好’的落地效率期,包括看落地效率怎么样,成本控制怎么样。”清程极智联合创始人师天麾近期接受财联社等媒体采访时表示,如今真正的门槛在于在真实的生产环境中,AI能否以可控的成本、稳定的质量、可接受的延迟,持续地输出价值,而Token恰恰是把这三个维度串起来的“公分母”。
师天麾以公司服务的出海客户举例称,该类单一客户、单一模型的峰值用量可达1-2亿TPM。面对这种大规模、高稳定的业务需求,清程极智采用“资源预留+弹性调度”的组合策略:将90%以上的基础负载通过自产的“赤兔”专线保障,剩余波动部分(如从1.2亿到1.5亿的弹性峰值)则通过智能路由动态调度。
而对于个人开发者或中小企业,其用量通常远未达到这一量级,“因此主要依靠智能路由技术,在保障高性能、低延迟、高成功率的同时,实现更高的资源利用率,从而降低其使用成本。”师天麾补充道。
实际上,调用量增长的同时,成本约束也在变得具体。
师天麾在采访中提到,一位动漫导演曾向他坦言:AI辅助作画在技术上可以实现,但存在“抽卡”问题,质量时好时坏,为了得到一张可用的成片,往往要生成几十上百次,Token成本和后期筛选、修补的人力加起来,反而远超人工。“未来的AI竞赛,不再是模型参数规模的军备竞赛,而是单位Token产出价值的效率竞赛。”师天麾说。
财联社记者同时采访获悉,Agent架构设计是影响Token效率最关键的因素。传统的软件系统没有Token计费的概念,但在AI原生时代,缓存命中、上下文复用、问题分流这些机制成为全新的工程实践,这也说明,Token效率优化已经从可选优化项变成了核心架构能力。
算力有了,为什么高质量Token供给仍不足?
王月认为,当前国内Token服务市场呈现“高度集中与分工细化并存、需求爆发与供给短板共生”的特征,中期演进将围绕技术效率深化、商业模式多元、产业格局集中、标准体系完善四方向展开。
不过,异构算力一致性不足,价格竞争激烈、盈利承压,行业标准体系不完善和合规治理要求趋严,仍是行业面临的挑战。王月认为,行业核心竞争正从资源占有转向全栈运营能力。
值得关注的是,当前行业一方面强调高质量Token供给不足,另一方面仍存在算力利用不充分的情况。
据中商产业研究院发布的《2026年中国Token工厂发展白皮书》,我国已成长为全球Token生产与消费双中心,大模型Token调用量两年实现千倍级爆发,智能算力供给规模稳居全球第二,但行业普遍存在GPU平均利用率不足30%、重建设轻运营的发展短板。
周震刚认为,原因之一是此前大量算力建设主要面向训练集群为主,按大模型训练需求采购硬件。但目前的Token主要消耗在推理。训练集群硬件架构、组网、调度逻辑并不适配推理的短任务、高并发特征,不匹配推理场景,硬件规模大但Token产出能力弱。
“另外,缺少推理调度、模型适配和运维运营以及国产芯片生态适配问题,都拉低了Token的有效利用率。”周震刚补充道。
而具体到企业级服务层面,师天麾则认为,当前企业级服务普遍面临高质量Token供给不足的问题——“缺 Token”的本质是“缺卡”,供不应求导致价格上涨。
不过师天麾也表示,价格上涨也带来了一个积极信号:行业竞争正在从“卷价格”转向“卷服务”。“当 API 价格不再是唯一的竞争维度,客户会更加关注 Token 的质量、稳定性和性价比。”
今年7月的WAIC2026期间,燧原科技董事长赵立东也曾表示,“Token正成为AI产业的价值载体与计价单位,客户不再单纯为硬件成本付费,而是以Token生成效率与交付质量为核心评判标准。这要求我们必须从系统级、架构级层面优化算力综合成本。”
在周震刚看来,未来竞争会显著加剧。前段时间大量厂商涌入,价格战激烈但缺乏推理优化能力,很多仅靠硬件转租的 Token 工厂会被淘汰;未来头部玩家会形成稳定算力资源 + 推理软件到订单的闭环。国产芯片适配和算电协同可能是Token工厂将获得差异化竞争的重点。
