2026年3月,国家数据局局长刘烈宏在中国发展高层论坛上披露:我国日均Token(词元)调用量已突破140万亿,而两年前这一数字仅为1000亿,两年间增长超过千倍。
同一时期,“Token工厂”成为全球AI产业的高频词。英伟达创始人黄仁勋在GTC 2026大会上提出:未来的数据中心不再是存储文件的仓库,而是生产Token的工厂。阿里巴巴随即成立Alibaba Token Hub事业群,由CEO吴泳铭亲自负责,以“创造Token、输送Token、应用Token”为核心目标。
一个清晰的信号是:Token正在从技术指标,变成AI时代可计量、可交易的生产资料。随之而来的问题也同样朴素——每一个Token,由谁来生产?以什么成本生产?在哪里生产?
这是迈特芯(MetaChip)一直在思考并尝试回答的问题。

过去几年,行业的焦点集中在模型本身:参数规模、评测榜单、训练算力。如今,开源模型快速追赶,数百亿参数级别的模型已能胜任大量专业任务,行业重心正在从“谁的模型更强”转向“谁能把模型用起来、用得起”。
自动会议纪要、文档生成、办公协同、视频理解、电路图与机械图识读……当AI应用进入千行百业的日常流程,推理需求呈现出持续、高频、海量的特征。尤其是智能体(Agent)的普及,让一次任务往往需要多轮思考与工具调用,Token消耗成倍放大。
推理,正在成为AI算力的主战场。IDC判断,2026年是AI从训练主导转向推理主导的拐点,到2027年推理将占智能算力需求的70%以上。IDC与浪潮信息于2026年9月发布的《2026年中国人工智能计算力发展评估报告》进一步预测,2026至2030年中国Token消耗量的年复合增长率将高达3499%。
需求的爆发,离不开成本的下降。斯坦福大学《2025年人工智能指数报告》显示,GPT-3.5水平模型的推理成本在2022年11月至2024年10月间下降了280多倍。每一次成本下降,都会释放出一批新的应用。Token的生产效率与成本,将直接决定AI能否真正走向普惠。

Token工厂的竞争规则正在改写。黄仁勋在GTC 2026上指出,AI工厂受制于电力这一物理约束——“一个1吉瓦的工厂永远不会变成2吉瓦”。在电力固定的前提下,每瓦特能产出多少Token,决定了一座工厂的产能与收入。“每瓦Token”正在取代服务器数量与峰值算力,成为衡量算力基础设施的核心指标。
在国内,Token工厂已从概念走向规模化建设。今年5月,算力网被纳入国家重点规划建设的“六张网”体系;运营商推出面向个人用户的Token套餐,并启动百亿元级的Token生成能力采购;在WAIC 2026上,已有服务商披露日均Token服务量达到万亿级。
繁荣背后,挑战同样清晰。有业内人士指出,当前Token售价与算力采购成本之间的价差过小,盈利空间逼仄。降低每一个Token的生产成本,已成为整个产业链的共同课题。

主流的Token工厂是集中式的:建设大型算力中心,采购高端GPU集群,再通过云端API对外提供推理服务。这种模式适合训练和超大规模模型服务,但门槛同样很高。
迈特芯提出的是另一种思路——分布式Token工厂:以标准化PCIe推理算力卡为单元,部署在普通机房与园区内,像搭积木一样按需组合。
对比维度 | 集中式Token工厂 | 分布式Token工厂 |
初始投入 | 十亿元级 | 千万元级起步 |
部署周期 | 一年以上 | 周级 |
设施要求 | 高,部分需新建 | 普通机房即可 |
运维要求 | 高 | 低 |
扩容与调整 | 较难 | 按需增减,灵活 |
在落地路径上,迈特芯与零碳园区能源托管平台协同:利用园区已有的机房空间和绿电资源,降低场地与电力成本;同时,算力贴近产业与用户部署,带来更低的响应时延,并可结合各地算力券、模型券等政策降低用户门槛。分布式并不是要取代云端,而是与云端形成互补:日常高频任务就近完成,峰值与超大模型任务弹性调度至云端。这也与产业趋势相吻合:IDC预计,边缘基础设施的增速将超过核心数据中心。
在生态合作上,迈特芯已与慧联无限达成战略合作。慧联无限深耕“云—边—端”一体化AIoT领域,在产业园区、智慧城建、智慧能源等场景积累了丰富的落地经验。双方将围绕分布式Token工厂展开深度合作,发挥各自在推理芯片与云边端智能解决方案上的优势,共同推进分布式推理算力在园区与行业场景中的规模化落地。

分布式Token工厂能否成立,关键在于单张算力卡能否以足够低的成本和功耗,持续高效地生产Token。迈特芯的答案来自两项核心技术。
3D堆叠近存:正面突破内存墙。 迈特芯将存储与计算逻辑在垂直方向上堆叠,以高密度的垂直互联替代传统的长距离走线,大幅缩短数据搬运路径,以更低的功耗获得更高的带宽。以迈特芯基于28nm工艺的PCIe推理卡为例,单卡集成12颗芯片、120GB内存,总带宽达到7.2TB/s,约为当前主流旗舰数据中心GPU的1.5倍。
立方脉动阵列:让每一次访存都物尽其用。 脉动阵列让数据在计算单元之间有节奏地流动与复用,减少重复读写。迈特芯将其拓展到三维结构,与3D堆叠存储天然契合,使高带宽能够真正转化为有效的Token产出。
两项技术叠加,带来的是推理效率的系统性提升。据迈特芯内部测算,在270亿参数稠密模型和350亿参数MoE模型上,上述算力卡的词元能效(每瓦功耗产出的Token数,也正是Token工厂竞争的核心指标)可达主流GPU方案的数倍至二十余倍,单卡功耗则控制在450W以内。模型越是受带宽制约,这一架构的优势越明显。
与此同时,迈特芯基于国产工艺与国产存储供应链打造产品,并规划了更先进工艺节点的后续产品,持续降低功耗、提升能效。

技术优势最终要落到成本上。我们以上述28nm PCIe推理卡运行270亿参数稠密模型为例,按单卡7×24小时运行、利用率80%进行测算:质创新资源,推动芯片创新产品精准赋能制造业转型升级。
测算项 | 取值 |
单卡生成速度 | 约427 Token/秒 |
月产Token | 约8.85亿 |
月电费(450W×720小时≈324度) | 约400元 |
月折旧(按五年分摊) | 约250元 |
每百万Token成本 | 约0.73元 |
作为参照,当前云端大模型API的输出价格从每百万Token数元到上百元不等,主流旗舰模型多在数十元量级。相比之下,分布式算力的Token生产成本有望降至其数十分之一。
这背后是两股力量的叠加:一是开源模型进步迅速,数百亿参数规模的模型已能胜任大量专业场景;二是专用推理芯片让运行这些模型的成本大幅下降。模型“变强”与算力“变便宜”同时发生,形成了端侧推理的“戴维斯双击”。
注:以上为基于硬件参数与公开价格的估算,仅含电费与硬件折旧,未含机房、网络与运维等费用;实际成本随模型、负载、电价与部署规模而变化。

迈特芯不只提供一颗芯片,而是围绕Token的生产、运营与应用,构建完整的三层体系:
(1)Token生产层: 迈特芯3D近存推理芯片、标准化PCIe算力卡与整机服务器,是Token的“生产设备”。
(2)Token运营层: 算力池化与计量调度平台,支持单卡多模型、多卡单模型的灵活调度,提供Token精细化计量、多维配额与审计,并支持端侧与云端的弹性协同。
(3)Token应用层: AgentXpert智能体平台,面向通用场景本地开箱即用,覆盖自动会议纪要、文档生成、办公协同、视频理解、电路图与机械图理解等场景,并可延伸至智慧教育、政务办公、家庭存储、具身智能等终端形态。
对行业客户而言,安全与成本同等重要。迈特芯方案采用四层防护设计:物理层本地化部署,推理在本地完成,数据不出域;模型层设置安全围栏,对输入输出双向实时检测;身份层支持多因素认证与细粒度权限控制;运营层全链路记录模型调用与Token消耗,支持等保三级相关审计要求。
每一次技术革命的普及,都伴随着核心生产资料成本的大幅下降。电力如此,带宽如此,Token亦将如此。
当日均调用量从千亿迈向百万亿,Token工厂不应只有一种形态。集中式算力中心与分布式Token工厂,将共同构成中国AI算力的完整版图。迈特芯希望以自主创新的芯片架构,让每一个Token更便宜、更安全、离用户更近。
我们期待与园区、算力运营方、行业客户及生态伙伴携手,共同推动AI推理从“用得上”走向“用得起、用得好”。






