阿里一口气降95%:0.8元背后的AI语音价格战
2026年9月23日的云栖大会上,阿里云向市场投放了一把锋利的新手术刀。
伴随着千问(Qwen)系列的全面升级,阿里云一次性发布了5款全新的语音大模型,覆盖了语音识别(ASR)、语音合成(TTS)以及实时交互(Realtime)三大核心场景。而在炫目的技术参数背后,更让业内感到震动的是一套颠覆性的定价表:全系列语音模型实现断崖式降价,其中ASR(语音转文字)环节的降幅高达95%,输入价格被死死按在0.8元人民币/百万tokens的水平上。
对于依赖大语言模型的互联网公司和智能硬件企业而言,这意味着一项曾经昂贵且需要定制开发的“高端技能”,正在迅速退化为几乎可以忽略不计的“通用耗材”。
0.8元的数学题:从高端定制到水电煤
要理解这次降价的分量,首先必须算一笔账。
在此次发布中,阿里云主推的旗舰级ASR模型——Qwen-Audio-3.1-ASR-Flash,其输入价格为0.8元/百万tokens,输出价格为2.7元/百万tokens。此前同类模型的基准价格通常在十几元到几十元不等,按照95%的降幅计算,这一动作直接击穿了业内的心理底价。
与此同时,其他两大核心板块也遭遇了类似的雪崩式降价:TTS(语音合成)模块平均降价约70%,其中入门级的TTS-Flash输入仅需1.5元;而主打全双工实时对话、支持工具调用的Realtime模型,则迎来了最惨烈的洗牌,价格降幅逼近85%。
“0.8元”是什么概念?在当前的技术条件下,一百万个tokens大约对应着数十万字的中文口语内容。如果一家中型电商企业使用AI进行全天候的客户来电转写,过去的月度账单可能高达数万元,而现在这笔开销将被压缩至几百元甚至更低。
这种程度的价格下探,通常只出现在两种场景中:一种是旧技术的末路清仓,另一种则是生产力发生质变后的规模摊薄。阿里云显然选择了后者,并试图用极低的边际成本,将AI语音能力彻底拖入“水电煤”式的公用设施轨道。
但这并非单纯的让利。在同一天公布的性能测试报告中,这套号称“降价不降质”的方案展现出了极强的统治力。
在权威的KeSpeech公开方言测试中,新模型的平均字错误率(CER)被压低至4.55%。更为恐怖的是其在复杂环境下的表现:内部自建方言测试集的字错率为10.38%,AST语义句准率达到82.10%。在实时响应环节,首字延迟被压缩到了惊人的160毫秒左右,背景语音干扰下的意图识别成功率提升至82.0%。
当极致的性价比叠加行业领先的抗噪与方言能力时,这套方案就不再只是一个“更便宜的选项”,而是成为了所有商业应用的默认首选。
谁会被挤出牌桌?算力鸿沟下的生死线
在这场由巨头掀起的降价风暴中,最先感到刺骨寒意的并非消费者,而是那些夹缝中生存的垂直领域初创企业与中小云服务商。
回顾过去两年,不少中小型AI公司依靠租用公有云服务,针对特定行业(如医疗问诊录音、金融合规转录、车载语音助手等)进行微调或API倒卖,赚取高额的技术溢价。他们的商业模式依赖于高单价带来的毛利空间,以覆盖并不低廉的GPU租赁成本和研发损耗。
然而,当阿里云这样的底层算力拥有者直接将“批发价”砸穿地板时,中小玩家的生存逻辑被瞬间瓦解。
如果它们选择跟进降价,由于缺乏底层的大规模集群调度能力和自研芯片红利,其单张显卡的训练和推理成本远高于阿里云,跟随降价意味着每处理一个请求都在净亏损;如果它们选择不跟进,由于新发布的千问模型在准确率上已经形成代差优势,客户只会毫不犹豫地迁移走。
这是一种典型的“基础设施陷阱”。巨头利用庞大的资本开支(Capex)和极高的资源利用率,不断蚕食市场的增量,并将利润率锁死在竞争对手的成本线之下。在这场博弈中,单纯靠软件算法层构建壁垒的公司,若无法提供差异化的增值服务,很快将面临被“管道化”的风险。
这也解释了为何在此次发布会除了云端API,还同步展示了首款Agent硬件QwenNote A2和桌面机器人Eva。因为阿里深知,只有将低成本的基础能力通过软硬一体的形态固化到终端设备上,才能构建起真正的生态护城河。
从文本对话到实时交互的入口争夺
如果说ASR的价格战是为了抢占存量市场,那么新发布的Realtime模型则标志着AI交互时代的全面提速。
在过去的大模型应用中,用户在对话框里打字、等待模型逐字生成,这种非实时的互动体验始终无法替代人类面对面的流畅交谈。而本次主打的Qwen-Audio-3.1-Realtime-Plus不仅实现了全双工通话(即用户可以随时打断模型,模型也能实时中断正在输出的内容),更首次赋予了语音模型直接调用外部工具的能力。
这意味着,未来的手机助手不再是一个只能陪你聊天的“复读机”,而是一个能实时听指令、查日程、操作App的活体Agent。这种“听得懂、回得快、办得成”的体验,建立在极低的推理延迟之上。当输入成本降至毫厘级别,开发者和企业才有动力去设计那些原本因高昂调用费而不敢落地的超长对话、复杂多轮任务处理场景。
这也是为什么在此次新品矩阵中,专门切分出TTS-Next这样支持精细情绪控制和跨语言音色合成的“高价次品类”模型——大厂需要用不同维度的模型组合拳,来通吃低端跑量和高端定制的双重利润。
观察指标
阿里云这波近乎自杀式的降价能否长久持续,仍需结合后续的市场动态加以验证。以下三个指标值得持续关注:
- 对手的跟进速度与底线:百度、讯飞及海外云厂商是否会采取对等的报复性降价?或是放弃API赛道转向私有化部署等高端防线?
- 模型调用的实际消耗量增长:价格降低后,企业的单次会话时长与调用频次是否会出现指数级爆发,从而带动大盘收入不降反升?
- 第三方应用端的存活空间:在官方基础模型极度强大的背景下,垂直领域的初创公司是能找到差异化生存缝隙,还是会在半年内大面积出清?
随着千问A2硬件和Eva机器人的陆续面市,我们可以预期,一场围绕“谁掌握了最便宜且最强的耳朵和嘴巴”的产业洗牌,才刚刚开始。


