BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年10月02日

注册 / 登录

Gemini 4上线:性能超GPT-6,API定价腰斩

2026年9月30日深夜,谷歌正式发布新一代旗舰语言模型Gemini 4 Argon。这款等了将近一年的产品一出手就带着两套武器:跑分和价格。

在代码软件工程基准测试DeepSWE v1.1上,Argon录得77.9%得分,把刚发布的GPT-6 Astra(74.1%)和Claude Opus 5.5(74.2%)都甩在身后。更关键的是定价——每百万输入Token 2美元、输出Token 10美元。据量子位援引的消息,这一价格在单题调用层面比GPT-6 Astra低了大约四成。

对于正在为AI API账单发愁的企业来说,这个数字意味着什么?我们来算一笔账。

跑分亮眼,但Code Arena只排第八

Argon的技术亮点确实集中体现在代码和推理两个方向。它的输出上下文窗口扩展到100万Token,相比此前64K的上限是一个量级跃升。

量子位报道的数据显示,除了DeepSWE之外,Argon在漏洞修复基准CWE-bench v1上达到68%,与GPT-6 Astra并列第一;自动化任务基准AutomationBench上跑出51.3分,排名第一。谷歌还演示了一个具体实验:将视频解码器移植到Rust语言后,Argon实现了2.7倍的性能提升。在谷歌自有数据中心的实践中,它被用于识别并修复内存漏洞,预期释放超过300TiB的存储空间。

但这些数字有一个前提条件:它们主要来自受控的基准测试。

在同为量化评测的Code Arena项目中,Argon的表现并不突出——排在第八位,反而落后于同期竞品。Text Arena方面以1525分位居榜首,但这种侧重理解能力的测试与实际的软件开发效率之间,隔着一条难以精确丈量的鸿沟。

换言之,Argon擅长的是“特定场景的深度推理”,而非通用编码能力的全方位碾压。这也解释了为什么谷歌选择先向网络安全防御方开放——这个垂直领域恰好能最大化Argon的优势,同时最小化其短板的影响。

值得注意的是,这种选择性开放的策略在AI行业并不新鲜。从AlphaFold到早期的Stable Diffusion,高性能模型往往先在科研和专业领域打磨,再逐步推向大众市场。对谷歌而言,Fairwind计划既是一种安全管控手段,也是一种低成本的市场验证方式。

2美元的定价信号

真正的冲击来自价格。

每百万输入Token 2美元、输出10美元。这是谷歌面向付费API客户直接公布的入门级价格结构——缓存输入的Token更是享受95%折扣,即仅需0.1美元/百万Token。

作为参照,GPT-6 Astra的同等定价高出约40%。这意味着一个每天调用数百万次大模型请求的中大型企业客户,年度API支出可能缩减数万美元甚至数十万美元的量级。

当然,Argon当前并非全面开放。它已首批接入谷歌“Fairwind计划”,专门面向通过背景审查的网络安全防御方。这个安排有其合理性:Argon的去护栏版本移除了网络防御安全限制,让企业可以自主用它进行黑箱渗透测试和漏洞挖掘。Wiz等网络安全公司已经将其纳入内部测试流程。

但在商业化路径上,谷歌明确表示未来将逐步面向开发者、企业和消费者开放——首先触达的是付费API用户和Google AI Ultra订阅群体。

这种“先垂直行业、再泛化推广”的节奏,本质上是一种风险控制策略:既能让早期采用者获得性价比优势,又能在出现问题时将影响范围限制在可控领域。对OpenAI和Anthropic而言,这不仅仅是竞争对手发布新模型的常规动作,而是直接冲击其企业客户预算的定价挑战。

谷歌员工为什么不买账

就在量子位的报道末尾,披露了一个耐人寻味的细节:谷歌内部不少工程师对Argon的实际表现持保留态度。

他们的质疑集中在两个方面。其一是部分真实场景下的编程效果并未达到跑分显示的亮眼程度,有人怀疑存在特定数据集“刷榜”的可能性。其二是前端界面的交互体验仍是短板,用户反馈不够流畅。

这不罕见。大型模型研发过程中,基准测试与实际生产力之间的落差几乎是必然存在的——前者测试的是“在已知规则下能否解题”,后者考验的是“在不确定的需求中能否持续产出可用结果”。

但内部质疑的价值在于提醒我们:跑分只是入场券,不是通行证。如果Argon不能在实际开发工作流中证明自己的不可替代性,那么即便价格便宜40%,企业也可能选择继续观望,或者同时使用多个模型来弥补短板。

从商业角度看,这种内部分歧也可能被竞品利用。OpenAI和Anthropic完全可以在客户沟通中放大这些质疑,强调“稳定可靠比跑分更重要”的话术策略。毕竟在AI赛道,信任本身就是最贵的成本。

价格战之后的下一局

Argon的发布标志着AI基础设施成本曲线进入新一轮下行通道。当头部模型的API价格从每百万5美元跌至2美元,整个产业的经济账需要重算。

中小企业可以更便宜地尝试大模型应用,不再需要先验证商业模式再承担高昂调用成本;企业IT决策者将面临新的选型压力——如果两个模型在某个任务上表现相近,价格差距就是决定性因素;开源社区的压力也在增大,闭源模型的性价比持续逼近开源方案,后者需要在延迟、定制化和隐私保护上寻找差异化。

但这一切的前提是Argon能够在大规模商业场景中稳定兑现其承诺。对于普通用户而言,真正的影响还不在于今天跑了多少分、明天能省多少钱,而在于什么时候能用到它——以及到时候,它是否真的像跑分那样好用。

接下来关注三个指标

API账单变化:观察主流云服务商在Argon全量开放后是否会跟进降价,这决定了价格战的范围。

实际代码采纳率:开发者在使用Argon辅助编码后的代码合并率和问题修复周期,比任何基准分数都有说服力。

企业采购意向:关注是否有知名企业在公平开放后宣布迁移或新增Gemini API部署,用真金投票比跑分更可靠。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。