智谱AI日耗4.36万亿Token成OpenRouter榜首
9月22日,OpenRouter全球榜单出现了一组令人错愕的数字:来自中国的GLM-5.3-Flash模型,一天之内吞下了4.36万亿Token,环比暴增73%,力压所有国际大厂模型独占鳌头。同日,该系列另一款模型GLM-5.3也以5240亿Token排名第九。按照上榜模型的Token总和计算,智谱AI旗下的Z.ai当天成了OpenRouter平台上流量最高的厂商。
这不是一个偶然的峰值。在过去两周里,GLM-5.3-Flash的日均调用量已经从2.5万亿Token左右一路攀升至4.36万亿,增幅稳定在每日10%—15%的区间。如果这个增速继续保持下去,下个月它将稳定占据OpenRouter模型排行榜的第一名位置。
低价是武器:为什么开发者都选了它
OpenRouter是全球最大的AI模型API聚合平台,连接着数千个开发者与企业用户。在这个平台上,决定调用量的核心因素不是模型"好不好用",而是"值不值得用"。
GLM-5.3-Flash之所以能被大规模选用,原因很直接——性价比。在与同级别开源/半开源模型的竞争中,GLM-5.3-Flash的定价策略更具侵略性。具体而言,它的输入Token单价约为同等规模国际竞品的三分之一到二分之一,而输出Token的差价更加悬殊。在单次的对话场景下,几厘钱的差价可以忽略不计;但当调用量以万亿为单位累积时,成本差距就是决定性的。
想象一个典型的Agent应用场景:一个电商客服自动化系统,每天需要处理上万条用户咨询,每条咨询平均消耗500—1000个Token。如果每天处理1万条咨询,日调用量就超过500万Token。换算下来,按高价位模型计费,一个月的API成本可能在两三千元;而换成GLM-5.3-Flash,费用可以降到几百元甚至更低。对于利润率本来就薄的中小开发者来说,这就是生死之别。
更重要的是,Agent应用不同于传统对话Bot——它们不是"偶尔被问到才回答",而是全天候自主运行。一个成熟的Agent系统可以连续执行几十个甚至上百个子任务,每个子任务都产生Token消耗。这种模式下,算力的需求不再是脉冲式的,而是持续稳定的。
从聊天到干活:AI算力的消费逻辑变了
过去两年,大模型行业的主流叙事是"能力竞赛"——谁的模型更能解题、更长文本、更聪明。但这种叙事忽略了一个基本事实:绝大多数企业客户需要的不是一个完美的通用大脑,而是一个够用的专用工具。
OpenRouter的数据揭示了这个转变。当一个中国模型能够在一天内吃掉4.36万亿Token时,说明有大量真实的生产负载正在跑在这个平台上。这些负载来自哪里?根据平台公开的用户画像和部分头部客户的匿名反馈,主要集中在这三个场景:
首先是自动化办公和客服系统。这类应用对语言能力的要求不高,但对成本和响应速度极其敏感。GLM-5.3-Flash在中文场景下的表现接近顶级国际模型,但价格便宜一半以上,自然成为首选。
其次是数据清洗和结构化。随着AI Agent在企业内部的渗透率提升,越来越多的公司需要将非结构化数据转化为机器可读的格式。这个过程本质上是大规模的语言理解任务,消耗的Token量非常可观,而GLM-5.3系列的吞吐量正好满足了这一需求。
最后是图像与文本的多模态混合任务。虽然GLM-5.3-Flash本身是一个文本模型,但很多开发者将其作为Agent的"大脑",负责规划和调度,再由专门的视觉模型执行具体的图像识别工作。这种"分工协作"的模式极大地放大了文本模型的调用量。
这三种场景的共同特点是:它们都不是"炫技"型的实验,而是已经在产生商业价值。也就是说,这些Token消耗是有经济动机的,不是刷榜,也不是无意义的压力测试。
谁在为这4.36万亿Token买单?
理解了"为什么用",再看"用了之后"。算力消耗的巨大化直接传导到了上游。
据行业研究机构测算,2024年第一季度中国算力租赁市场规模已达680亿元人民币,同比增速高达62%。预计全年这一数字将突破2600亿元。这个增速远超云计算整体行业水平,反映出AI推理侧算力需求的特殊弹性。
为什么会这么快?因为GPU集群的建设周期通常为6—12个月,而AI应用的爆发往往是突发性的。当ChatGPT在2022年底突然爆红时,英伟达的GPU库存迅速被抽干,市场价格一度飙涨数倍。同样的剧本在2024年和2025年反复上演——只是这一次,算力消耗的主力从少数几个大厂的训练集群扩散到了数以万计的中小企业。
在这种情况下,算力租赁作为一种轻资产的商业模式获得了巨大空间。一批专门购买GPU硬件、搭建机房、转租给AI开发者的公司应运而生。其中最具代表性的包括利通电子——截至2024年中,该公司公告的总算力规模已达3.3万至3.8万P(即 petaFLOPs 级别),宏景科技也是IaaS层面的重要服务商。
但这个行业并非遍地黄金。公开数据显示,算力租赁的平均毛利率普遍在20%—35%之间,远低于纯软件业务的水平。更棘手的是,GPU折旧速度极快——一款旗舰显卡通常在18—24个月内就会因新一代产品的上市而大幅贬值。这意味着租赁商必须保持极高的设备利用率才能盈利,否则闲置一天的损失就是真金白银。
格局变化:国产模型的时代到了?
GLM-5.3-Flash登上OpenRouter榜首,背后有一个更大的故事:国产大模型正在从"跟跑者"变成"某些赛道的领跑者"。
过去,OpenRouter和Hugging Face等平台上的Model Leaderboard几乎被英文语境下的国际模型垄断。美国和中国在通用语言模型的能力上确实存在代差——GPT-4o、Claude Opus等在复杂推理、长上下文处理和跨语言能力上仍领先于大多数国产模型。但在特定的垂直场景中,这种差距可以被大幅压缩。
以中文场景为例,GLM-5.3-Flash的表现已经足够好,足以满足大部分企业的需求。再加上价格优势和对中国语境的深度优化,它在特定领域完全可以与国际竞品一较高下。这并不罕见——就像智能手机市场上,三星在中国的市场份额远小于苹果,但在全球市场依然稳居前列一样。
对智谱AI来说,OpenRouter的流量入口具有战略意义。掌握全球最大的模型API分发渠道之一,意味着他们可以直接触达数万开发者,获得海量的使用反馈,这对于模型的持续迭代至关重要。更不用说,流量本身就可以转化为后续融资和商业合作的筹码——当你告诉投资人你的模型在全球平台上排名第一时,估值逻辑是完全不同的。
接下来的看点
如果你打算追踪这条赛道的走向,以下几个指标值得持续观察:
每月OpenRouter Top 10模型的中国厂商占比变化。 如果中国模型持续进入前十甚至前五,说明这不是一次性的炒作,而是结构性的份额提升。
算力租赁企业的营收增速与实际利用率。 重点关注季度报告中的GPU出租率和资产周转率。营收增长如果没有对应的利用率提升配合,可能就是虚火。
主要GPU云厂商的资本开支计划。 这是判断算力供给能否跟上需求的先行指标。如果亚马逊AWS、微软Azure和国内头部厂商都在扩建设施,说明行业预期是乐观的;反之则需要警惕产能过剩风险。
智谱AI自身的商业化收入披露。 目前的证据主要来自第三方平台统计,缺乏官方财务数据的交叉验证。如果未来能有清晰的收入数据,将极大增强对这家公司估值的基本面信心。
一句话总结:4.36万亿Token的背后,是中国AI应用从实验室走向生产车间的真实写照。Agent落地带来的推理算力需求已经不是"可能的未来",而是"正在进行时"。至于谁能在这场算力军备竞赛中赚到钱——那取决于谁能在价格、效率和规模之间找到那个微妙的平衡点。


