写代码之后开始抓漏洞:网络安全会成为大模型下一个赚钱场景?
AI刚刚开始抢程序员的饭碗,又盯上了安全工程师。
8月14日,智谱发布GLM-5.3。相比上一代,它没有更换基座模型,而是通过扩大后训练规模,把编程能力进一步提高约50%。但真正值得关注的不是又一轮Coding排行榜,而是另一项突然冒出来的能力:模型开始自己读代码、找漏洞、验证漏洞。 按智谱披露的评测口径,GLM-5.3在CyberGym上获得84.5%的成绩,同时在更偏向漏洞利用的ExploitBench上,从上一代24.4%提高到54.4%。
发布前两周,智谱还联合安全团队进行了真实项目测试,据披露累计发现2404个潜在漏洞,其中1088个被划为中高危,覆盖220个项目。
这意味着,大模型正在跨过一个非常重要的边界:
以前AI帮助程序员把代码写出来,下一步可能开始帮企业检查“这些代码到底安不安全”。
而后者,很可能比聊天机器人更容易赚钱。
一、为什么AI写代码之后,自然会轮到“抓漏洞”?
因为两件事本来就是同一种能力的正反面。
一个优秀的Coding Agent需要理解几十万行代码之间的依赖关系,知道某个函数为什么这样运行、改动之后会不会导致程序崩溃。安全审计做的事情其实类似,只不过问题从“怎么把功能实现”变成了“哪里可能被攻击”。
GLM-5.3就是一个很典型的案例。
智谱没有重新训练一个更大的基座模型,而是把后训练任务进一步扩展到真实计算环境、代码库、存储系统和复杂工程流程,让模型不断执行“分析—修改—运行—报错—再修改”的完整工作流。官方数据显示,其Terminal-Bench 3.0从4.6提高到28.3,DeepSWE v1.1从46.2提高到66.9。
当AI越来越能理解完整软件工程,它自然会开始发现一个过去由人类安全工程师负责的问题:
这段程序能不能被人钻空子?
所以网络安全不是突然出现的新能力,更像Coding能力继续往深处走之后必然出现的一条支线。
二、为什么“找漏洞”可能比聊天更容易让企业掏钱?
因为安全预算原本就在那里。
Gartner预计,2026年全球信息安全终端支出将达到约2440亿美元,到2029年进一步升至3220亿美元。
这与很多AI新应用完全不同。
做一个AI聊天工具,需要先说服消费者“为什么我要为它付费”;网络安全不需要重新创造需求,银行、电信、能源、政府、互联网公司本来每年就在购买代码审计、漏洞扫描、安全运营和渗透测试服务。
企业真正缺的是人。
软件越来越多,代码更新越来越快,人工安全团队却不可能按同样速度扩张。一家公司一天可能提交几千次代码更新,人类安全工程师很难逐行检查。
如果AI能在代码进入生产环境之前,自动阅读代码、发现高风险位置,再把真正值得人工处理的问题交给安全人员,那么这套账非常容易计算。
以前10个人审一天的代码,现在两个人加AI就能完成。
安全AI出售的不是“智能”,而是减少事故和降低人工成本。
这种产品天然更接近企业预算。
三、2404个漏洞,比跑分更值得看
这也是GLM-5.3这次最有价值的地方。
Benchmark第一当然能够带来传播,但企业真正关心的是模型离实际工作还有多远。
据科技日报报道,GLM-5.3发布前的安全测试发现2404个潜在漏洞,其中1088个为中高危;研究团队还披露发现一个涉及DNS协议的长期风险案例。
这些结果仍主要来自智谱及合作团队披露,后续还需要更多独立安全机构和实际部署验证,不能简单理解成“AI已经可以替代安全专家”。
但它至少证明了一件事:
大模型安全能力正在从回答“什么是SQL注入”,走向真正打开代码库寻找问题。
两者商业价值完全不是一个量级。
前者是知识问答。
后者是生产工具。
四、但有个数字必须泼冷水:会找漏洞,不等于会完整攻防
这里尤其不能因为84.5%这个数字,就得出“GLM-5.3网络安全已经超过所有闭源模型”的结论。
智谱自己的文档就明确写道,目前GLM-5.3的优势主要集中在漏洞链条前端,例如白盒代码审查、漏洞发现和验证;到了更深入的漏洞利用和完整攻防任务,仍然有提升空间。
比如在ExploitBench上,GLM-5.3虽然由24.4%提高到54.4%,但这也说明复杂漏洞利用仍远没有被彻底解决。
而CyberGym研究本身之所以受到安全圈关注,恰恰因为它试图让AI面对真实软件漏洞,而不是做几道安全选择题。最初的CyberGym包含1507个真实漏洞,来自188个大型开源项目,要求Agent理解真实代码并生成能够验证漏洞的程序。
安全不是模型“知道答案”就够了。
真正困难的是面对几十万行陌生代码,持续推理、运行、失败、修改,最后找到一个可以稳定复现的问题。
五、网络安全最大的商业价值,也可能是最大的风险
这里出现了大模型行业一个非常特殊的矛盾。
一个AI越擅长找漏洞,对防守方越有价值。
但同样的能力,也可能降低攻击者的技术门槛。
CyberGym后续研究已经发现,AI Agent在真实漏洞发现、PoC生成乃至漏洞修复方面的能力正在快速提高;与此同时,新的ExploitGym研究也专门讨论AI将漏洞进一步转化成真实攻击的风险。
所以安全模型和普通Coding模型不同。
代码写得越好,可以直接开放给所有人。
攻击能力越强,开放范围反而越需要谨慎。
这也是为什么智谱在GLM-5.3发布过程中强化红队测试、安全审查,并对敏感能力采取限制。安全模型未来很可能形成一种特殊商业模式:
防御能力可以普及,更高风险的攻防能力则只向验证企业、安全实验室和可信客户开放。
某种程度上,这反而提高了B端收费的可能性。
六、企业真正需要的,可能不是一个“网络安全大模型”
未来真正有价值的产品,未必是打开一个网页问AI:“帮我看看有没有漏洞。”
更可能是AI直接进入企业软件开发流程。
程序员写完代码,AI自动审查;提交到代码仓库,AI再次检查;上线之前跑一次安全测试;发现漏洞之后自动定位影响范围、生成修改建议,再由人工确认。
安全因此从“系统上线后找问题”,变成软件开发过程中的一个自动环节。
Gartner已经把AI驱动的安全运营中心列为2026年网络安全重要趋势之一,并指出AI正在帮助企业进行告警分类和安全事件调查,同时也带来新的治理和人员协作问题。
这可能才是大模型安全真正大的机会:
不是替代所有网络安全产品,而是把安全检查嵌进每一次代码生产。
七、Coding之后,安全为什么可能成为第二个赚钱场景?
因为两者都有一个共同特征:
效果可以算账。
Coding Agent好不好,可以看程序员一天多写多少代码。
安全AI有没有价值,可以看漏洞发现率、误报率、安全人员处理效率以及事故减少多少。
这与很多“用了AI感觉效率提高”的场景不同,它们都有明确KPI,也都有现成企业预算。
因此,大模型竞争进入今天这个阶段,真正有意思的已经不是谁又多了几千亿参数。
模型能力越来越接近之后,决定商业价值的可能是:
谁先找到一个客户愿意持续付钱,而且结果可以量化的工作流。
编程已经证明了这一点。
网络安全很可能正在成为下一个试验场。
当然,一次模型发布和一批漏洞测试,还不足以证明这门生意已经跑通。GLM-5.3未来真正需要验证的,是在真实企业代码库里的误报率、连续运行稳定性、部署成本,以及客户到底愿意为安全能力付多少钱。
但至少方向已经越来越清楚。
AI写代码解决的是“程序员不够快”,AI安全审计解决的却是“漏洞永远比安全工程师多”。
后者也许没有聊天机器人那么热闹。
但在一个2026年已经超过2400亿美元的全球安全市场里,它可能离真正的钱更近。
参考资料:
智谱/Z.AI《GLM-5.3》官方技术资料;科技日报《智谱发布新一代基座模型GLM-5.3》;CyberGym研究论文;Gartner全球信息安全支出预测及《Top Cybersecurity Trends for 2026》。
文中GLM-5.3相关评测成绩主要来自智谱官方披露,不同安全Benchmark的任务定义、Agent框架和评分口径存在差异,不宜直接横向等同。以上内容仅为科技产业与商业趋势分析,不构成任何投资建议。


