BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月22日

注册 / 登录

阿里Qwen向5到10万亿参数跃进,谁能买单

2026年9月22日的杭州云栖大会主会场聚光灯下,阿里巴巴通义实验室LLM项目带头人刘大一恒站在台上说了这样一句话:"Scaling是迈向ASI的关键路径。"

他的身后投影出了一个令人震惊的数字计划:未来的Qwen4.5、Qwen5将把总参数量扩展到5万亿甚至10万亿。

如果这个数字按字面理解,它意味着一个跃迁幅度——当前已发布的最大开源模型Qwen3旗舰版235B总参数,新目标是其200到400倍

这不是渐进式升级,而是直接跳过了中间所有层级。对于全球AI行业而言,这种跳跃本身就是一次信号发射:中国最大的云计算厂商正在用开源路线正面挑战闭源模型的霸主地位。

万亿参数的代价是什么?

先搞清楚"万亿参数"到底有多大概念。

当前全球开源领域最强的模型之一是Meta的Llama系列。截至2025年的最新旗舰仍在70B到400B区间徘徊。OpenAI的GPT-4o和Anthropic的Claude最佳版本的参数量据业内估算也不过数千亿级别,官方从未正式披露精确数字。而谷歌Gemini系列同样保持在千亿到千亿级范畴内。

阿里这次的口径是五万亿起步,最高十万亿。

这意味着阿里要从"追平"阶段直接跳到"挑战规模天花板"的位置。但这种跳跃的成本也同样惊人。

一个粗略估算:如果保持Qwen3系列的训练精度(约36万亿tokens用于预训练),一个五万亿参数模型的完整训练所需FLOPs可能在10^27量级。作为对比,目前公开报道中最大规模的GPT-3训练消耗约2.5乘以10^24 FLOPs。新目标相当于前者的近千倍。

更现实的衡量标准是芯片需求。假设用英伟达H100或国产替代方案来构建集群,训练这样一个体量的模型至少需要数万片高端训练卡并行工作超过数月

谁在为这些算力买单?这才是投资者真正关心的问题。

MoE架构:降低门槛的杠杆

阿里知道这个问题。所以他们没有像早期那样堆砌密集参数,而是继续依赖稀疏混合专家架构。

Qwen3最大的模型Qwen3-235B-A22B采用了94层、128个专家的MoE设计——虽然总参数达到2350亿,但每次推理只激活其中约220亿。这种架构让推理成本比同等规模的密集模型降低了约九成。

到了下一代Qwen3.8-Flash,阿里进一步声称训练成本骤降了近90%。同时,在新款平头哥GPU上的自主适配优化让单实例推理吞吐量提升了96%。

这些数字如果属实,就意味着阿里正在通过工程创新来抵消单纯放大参数带来的成本爆炸。用更低的边际成本撬动更大的参数规模,正是MoE路线的核心逻辑。

但要注意的是,成本降低不等于成本消失。即使推理效率提升显著,五到十万亿参数模型的训练周期和能耗预算仍然可能达到天文数字。这要求阿里在两个方面同时发力:一是持续优化训练算法和数据效率,二是保障大规模GPU集群的稳定供应。

"自我进化"的故事线

阿里在云栖大会上展示了一个更诱人的叙事:Qwen正在学会自我迭代。

根据现场介绍,Qwen3.8-Max在无人类干预的情况下完成了超过一个月的持续训练,经历了33轮有效迭代。基于递归自我改进和后训练技术的联合优化,该模型在Artificial Analysis评测中得分从40分提升至45分,达到了与Claude和GPT最强模型并列的水平,领先于包括GLM5.3和Kimi-K3在内的所有国产模型。

这套说辞指向了一个行业趋势:当算力不再是唯一的瓶颈时,训练方法论本身成了新的竞争维度。

但值得注意的是,"零参与"并不等于"无引导"。阿里团队仍然负责搭建训练流程、构造数据和设计实验框架。AI自身的迭代是在人类设定的搜索空间内进行的。这是一个重要的区别,也是评估其可持续性的关键点。

开源生态的真正武器

与其说五到十万亿参数是一个产品路线图,不如说它是阿里用来巩固开源护城河的信号弹。

截至目前,阿里已累计开源460余个Qwen模型,在Hugging Face平台上累计下载量突破30亿次,衍生开源模型超过30万个。Qwen3.8-27B更是超越了DeepSeek-R1和Meta Llama3.1,成为该平台历史上最受欢迎的开源大模型。这些数据让Qwen稳坐全球最大开源模型家族的席位。

开源模式的财务回报路径相对清晰:大量企业和开发者使用Qwen系列 → 带动阿里云Bailian平台API调用量 → 增强阿里云整体竞争力 → 反哺底层研发投入。这就是所谓的"以开源换生态、以生态促商业"的逻辑链条。

至于那些网传的"API调用成本远低于闭源模型百分之八"的说法,尽管未能在此前公开材料中找到确切的统计口径支撑,但业界共识是开源模型确实凭借更灵活的定价策略对商用API形成了显著的价格压力。

接下来看什么

这篇报道留给投资者的可操作思考点有三个:

第一,算力采购与适配进度。阿里在平头哥GPU上实现了推理吞吐量的大幅提升,说明自研芯片与通义大模型的协同优化正在进行。关注未来半年内平头哥新一代GPU的实际量产规模和云端部署能力,这将直接影响五到十万亿参数计划的可行性和成本结构。

第二,训练成本的公开验证。阿里声称Qwen3.8-Flash训练成本下降近90%,但这个基准价格表尚未公开。投资者可以关注阿里云百炼平台的新定价政策变化,这是最直接的间接验证渠道。

第三,开源下载转化为收入的拐点。30亿次下载和30万个衍生模型是很好的流量指标,但能否转化为企业付费客户,取决于三个具体观察点:一是阿里云财报中是否首次单独披露通义系列的独立收入项;二是国内头部互联网公司和政企客户中采用Qwen开源版并转为API付费的比例;三是海外特别是东南亚市场的开源采纳增速。


阿里这次喊出五到十万亿的目标,短期内不会改变任何人的日常体验。但对云计算基础设施供应商、AI芯片制造商以及下游应用开发公司而言,这已经是一则需要认真对待的产业风向信号。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。