BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月11日

注册 / 登录

DeepSeek用Flash取代Pro:AI算力账本被重算

从Pro到Flash:一次技术路线的彻底转向

2026年9月14日,DeepSeek宣布了一个看似简单却意味深长的决定——用刚推出的deepseek-flash(即V4.1 Flash)完全取代仍在运行的deepseek-v4-pro。

用户在调用deepseek-v4-pro接口时,实际接收的是V4.1 Flash服务,且按Flash费率计价。旧版本虽保留入口,但已在逐步退场路径上。

这不是一个普通的版本迭代。DeepSeek在官方说明中强调,V4.1 Flash在性能、成本和总耗时上"全面超越V4 Pro"。换言之,他们不仅推出了一个新模型,而且判定这个新模型值得杀死自己曾经引以为傲的王牌产品。

对于一个靠技术立身的公司而言,敢于亲手下架自家核心产品,背后是对新技术路线的信心,更是商业逻辑的根本转换。

552B参数背后的算力革命

V4.1 Flash的核心参数并不张扬——总参数量552B。这个数字本身并非业界最大,真正引发震动的是它的资源消耗效率。

根据DeepSeek披露的技术文档,该模型采用了一种被称为"CED非对称架构"的设计思路。配合FP4 KV Cache(键值缓存)技术,模型在推理过程中对显存和存储的占用出现了断崖式下降:

  • HBM(高带宽内存)需求降至原来的四分之一
  • SSD存储需求降至原来的八分之一
  • KV Cache规模相较传统方案缩水约437倍

这些数字单独看可能不够直观,放在一起就能理解其破坏力。

KV Cache是大语言模型推理时的核心瓶颈。以传统GPT-4级别的架构为例,在处理长文本时,KV Cache的显存占用会随序列长度线性增长,这正是导致高端GPU集群租赁费用居高不下的根本原因之一。而FP4量化技术通过极端的精度压缩,将原本需要更高精度的计算矩阵进行重组,实现了同样的输出质量,同时大幅削减了显存足迹。

换句话说,原来需要8块A100才能跑的模型,现在可能2块就够了。这种差距不是量变,而是阶跃。

硬件供应链的直接冲击

对于海力士、三星等国际HBM寡头而言,这是一个需要提前准备应对的故事。

长期以来,大模型参数量的指数级增长构成了HBM需求的刚性逻辑——参数越大、显存越宽、HBM芯片采购越多。这种供需关系支撑着HBM市场的溢价预期和产能扩张计划。但当单模型的显存需求可以压缩到四分之一时,这个逻辑链条就会出现松动。

假设一家云服务商原本部署了一个由100个节点组成的推理集群,每个节点配备4颗HBM显存的GPU卡,那么改用V4.1 Flash后,同等服务能力的集群规模可能缩减到25至30个节点。短期内不会有订单违约,但新增需求的增长曲线会被明显压低。

对国内HBM产业链而言,情况更为复杂。兆易创新、长鑫存储等企业一直在努力推进国产替代,但当前国产HBM在良率、规模和生态适配上仍与国际巨头存在差距。如果国际大厂本身的需求增速放缓,国产替代的时间窗口可能被压缩,也可能被延长——取决于下游客户是否愿意趁此机会加速导入国产方案来压低整体成本。

SSD方面的压力逻辑相似,但不如HBM敏感。毕竟消费级和企业级SSD的价格竞争本就激烈,存储密度提升本身也在持续进行。

谁最先受益?谁最先承压?

最直接受益的,是中小规模的AI应用开发者。

过去,想要使用接近GPT-4级别的大模型能力,要么自建昂贵算力集群,要么按token付费承受高额API账单。随着单次推理成本的断崖式下降,许多之前被认为"太贵"的应用场景——比如垂直行业的智能客服、法律辅助、医疗问诊——突然变得经济可行。

这也解释了为什么腾讯等互联网平台已经在第一时间接入V4.1 Flash。对用户端感知最直接的,往往是应用体验的快速响应和成本可控。如果腾讯云将其旗下的混元大模型或其他AI服务迁移至DeepSeek的后端推理层,节省下来的不仅是资金,更是弹性扩展的空间。

短期承压的,是那些围绕"算力稀缺"构建商业模式的玩家。

有些云厂商和算力租赁平台的定价策略,很大程度上依赖于模型复杂度不断提升所带来的资源紧张预期。当效率翻倍时,这套叙事就需要重写。更激烈的竞争可能迫使它们下调租金、提供折扣,或者转向差异化服务。

此外,传统大模型厂商将面临一道选择题:继续投入巨资训练更大参数量的模型追求绝对性能天花板,还是跟随技术趋势转向极致性价比路线?无论选择哪条路,都会改变整个行业的研发节奏。

值得注意的是,这轮降本效应的传导速度可能比预想中更快。因为API计费模式的调整与模型更新同步进行,用户无需等待新的定价表出台就能直接感受到价格变化。这对中小开发者而言意味着即时可用,而不是理论上的远期利好。

接下来看什么

如果你关注这场技术变革的实际落地效果,以下几个观察指标比任何预测都有参考价值:

第一,API定价公告。DeepSeek是否正式公开Flash版本的每百万tokens单价?相比V4 Pro降幅几何?这是衡量"降本"幅度的最关键数据。

第二,云平台迁移进度。腾讯云及其他主流AI平台何时宣布全面切换至V4.1 Flash后端?首批接入的业务场景是什么?这决定了普通用户最快何时能感受到变化。

第三,国产替代节奏。国内HBM厂商是否在客户技术交流层面获得新的验证机会?长鑫存储的下一代产品时间表有无调整?这关系到供应链格局的中期演变。

第四,竞对反应。OpenAI、Anthropic、Google是否会跟进类似的技术路线?还是保持原有架构继续堆叠参数?这将决定行业未来两年的技术走向。

技术的价值不在于有多先进,而在于它改变了哪些人做事的成本结构。DeepSeek这次的举动,本质上是在给AI基础设施做一次降压手术。降压带来的好处显而易见,但血管壁的弹性如何、会不会出现其他部位的压力转移,还需要时间验证。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。