BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年08月17日

注册 / 登录

写代码之后开始抓漏洞:网络安全会成为大模型下一个赚钱场景?

AI刚刚开始抢程序员的饭碗,又盯上了安全工程师。

8月14日,智谱发布GLM-5.3。相比上一代,它没有更换基座模型,而是通过扩大后训练规模,把编程能力进一步提高约50%。但真正值得关注的不是又一轮Coding排行榜,而是另一项突然冒出来的能力:模型开始自己读代码、找漏洞、验证漏洞。 按智谱披露的评测口径,GLM-5.3在CyberGym上获得84.5%的成绩,同时在更偏向漏洞利用的ExploitBench上,从上一代24.4%提高到54.4%。

发布前两周,智谱还联合安全团队进行了真实项目测试,据披露累计发现2404个潜在漏洞,其中1088个被划为中高危,覆盖220个项目。

这意味着,大模型正在跨过一个非常重要的边界:

以前AI帮助程序员把代码写出来,下一步可能开始帮企业检查“这些代码到底安不安全”。

而后者,很可能比聊天机器人更容易赚钱。

一、为什么AI写代码之后,自然会轮到“抓漏洞”?

因为两件事本来就是同一种能力的正反面。

一个优秀的Coding Agent需要理解几十万行代码之间的依赖关系,知道某个函数为什么这样运行、改动之后会不会导致程序崩溃。安全审计做的事情其实类似,只不过问题从“怎么把功能实现”变成了“哪里可能被攻击”。

GLM-5.3就是一个很典型的案例。

智谱没有重新训练一个更大的基座模型,而是把后训练任务进一步扩展到真实计算环境、代码库、存储系统和复杂工程流程,让模型不断执行“分析—修改—运行—报错—再修改”的完整工作流。官方数据显示,其Terminal-Bench 3.0从4.6提高到28.3,DeepSWE v1.1从46.2提高到66.9。

当AI越来越能理解完整软件工程,它自然会开始发现一个过去由人类安全工程师负责的问题:

这段程序能不能被人钻空子?

所以网络安全不是突然出现的新能力,更像Coding能力继续往深处走之后必然出现的一条支线。

二、为什么“找漏洞”可能比聊天更容易让企业掏钱?

因为安全预算原本就在那里。

Gartner预计,2026年全球信息安全终端支出将达到约2440亿美元,到2029年进一步升至3220亿美元。

这与很多AI新应用完全不同。

做一个AI聊天工具,需要先说服消费者“为什么我要为它付费”;网络安全不需要重新创造需求,银行、电信、能源、政府、互联网公司本来每年就在购买代码审计、漏洞扫描、安全运营和渗透测试服务。

企业真正缺的是人。

软件越来越多,代码更新越来越快,人工安全团队却不可能按同样速度扩张。一家公司一天可能提交几千次代码更新,人类安全工程师很难逐行检查。

如果AI能在代码进入生产环境之前,自动阅读代码、发现高风险位置,再把真正值得人工处理的问题交给安全人员,那么这套账非常容易计算。

以前10个人审一天的代码,现在两个人加AI就能完成。

安全AI出售的不是“智能”,而是减少事故和降低人工成本。

这种产品天然更接近企业预算。

三、2404个漏洞,比跑分更值得看

这也是GLM-5.3这次最有价值的地方。

Benchmark第一当然能够带来传播,但企业真正关心的是模型离实际工作还有多远。

据科技日报报道,GLM-5.3发布前的安全测试发现2404个潜在漏洞,其中1088个为中高危;研究团队还披露发现一个涉及DNS协议的长期风险案例。

这些结果仍主要来自智谱及合作团队披露,后续还需要更多独立安全机构和实际部署验证,不能简单理解成“AI已经可以替代安全专家”。

但它至少证明了一件事:

大模型安全能力正在从回答“什么是SQL注入”,走向真正打开代码库寻找问题。

两者商业价值完全不是一个量级。

前者是知识问答。

后者是生产工具。

四、但有个数字必须泼冷水:会找漏洞,不等于会完整攻防

这里尤其不能因为84.5%这个数字,就得出“GLM-5.3网络安全已经超过所有闭源模型”的结论。

智谱自己的文档就明确写道,目前GLM-5.3的优势主要集中在漏洞链条前端,例如白盒代码审查、漏洞发现和验证;到了更深入的漏洞利用和完整攻防任务,仍然有提升空间。

比如在ExploitBench上,GLM-5.3虽然由24.4%提高到54.4%,但这也说明复杂漏洞利用仍远没有被彻底解决。

而CyberGym研究本身之所以受到安全圈关注,恰恰因为它试图让AI面对真实软件漏洞,而不是做几道安全选择题。最初的CyberGym包含1507个真实漏洞,来自188个大型开源项目,要求Agent理解真实代码并生成能够验证漏洞的程序。

安全不是模型“知道答案”就够了。

真正困难的是面对几十万行陌生代码,持续推理、运行、失败、修改,最后找到一个可以稳定复现的问题。

五、网络安全最大的商业价值,也可能是最大的风险

这里出现了大模型行业一个非常特殊的矛盾。

一个AI越擅长找漏洞,对防守方越有价值。

但同样的能力,也可能降低攻击者的技术门槛。

CyberGym后续研究已经发现,AI Agent在真实漏洞发现、PoC生成乃至漏洞修复方面的能力正在快速提高;与此同时,新的ExploitGym研究也专门讨论AI将漏洞进一步转化成真实攻击的风险。

所以安全模型和普通Coding模型不同。

代码写得越好,可以直接开放给所有人。

攻击能力越强,开放范围反而越需要谨慎。

这也是为什么智谱在GLM-5.3发布过程中强化红队测试、安全审查,并对敏感能力采取限制。安全模型未来很可能形成一种特殊商业模式:

防御能力可以普及,更高风险的攻防能力则只向验证企业、安全实验室和可信客户开放。

某种程度上,这反而提高了B端收费的可能性。

六、企业真正需要的,可能不是一个“网络安全大模型”

未来真正有价值的产品,未必是打开一个网页问AI:“帮我看看有没有漏洞。”

更可能是AI直接进入企业软件开发流程。

程序员写完代码,AI自动审查;提交到代码仓库,AI再次检查;上线之前跑一次安全测试;发现漏洞之后自动定位影响范围、生成修改建议,再由人工确认。

安全因此从“系统上线后找问题”,变成软件开发过程中的一个自动环节。

Gartner已经把AI驱动的安全运营中心列为2026年网络安全重要趋势之一,并指出AI正在帮助企业进行告警分类和安全事件调查,同时也带来新的治理和人员协作问题。

这可能才是大模型安全真正大的机会:

不是替代所有网络安全产品,而是把安全检查嵌进每一次代码生产。

七、Coding之后,安全为什么可能成为第二个赚钱场景?

因为两者都有一个共同特征:

效果可以算账。

Coding Agent好不好,可以看程序员一天多写多少代码。

安全AI有没有价值,可以看漏洞发现率、误报率、安全人员处理效率以及事故减少多少。

这与很多“用了AI感觉效率提高”的场景不同,它们都有明确KPI,也都有现成企业预算。

因此,大模型竞争进入今天这个阶段,真正有意思的已经不是谁又多了几千亿参数。

模型能力越来越接近之后,决定商业价值的可能是:

谁先找到一个客户愿意持续付钱,而且结果可以量化的工作流。

编程已经证明了这一点。

网络安全很可能正在成为下一个试验场。

当然,一次模型发布和一批漏洞测试,还不足以证明这门生意已经跑通。GLM-5.3未来真正需要验证的,是在真实企业代码库里的误报率、连续运行稳定性、部署成本,以及客户到底愿意为安全能力付多少钱。

但至少方向已经越来越清楚。

AI写代码解决的是“程序员不够快”,AI安全审计解决的却是“漏洞永远比安全工程师多”。

后者也许没有聊天机器人那么热闹。

但在一个2026年已经超过2400亿美元的全球安全市场里,它可能离真正的钱更近。

 


 

参考资料:

智谱/Z.AI《GLM-5.3》官方技术资料;科技日报《智谱发布新一代基座模型GLM-5.3》;CyberGym研究论文;Gartner全球信息安全支出预测及《Top Cybersecurity Trends for 2026》。

文中GLM-5.3相关评测成绩主要来自智谱官方披露,不同安全Benchmark的任务定义、Agent框架和评分口径存在差异,不宜直接横向等同。以上内容仅为科技产业与商业趋势分析,不构成任何投资建议。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。