news_article.exe
📰
#GPT#Claude#开源#大模型#多模态

刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了

2026年8月14日1 次浏览来源:量子位 阅读原文

顺手拿下最强开源安全模型

刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了 量子位

刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了

昨儿DeepSeek V4 Pro正式版+Harness、Grok 4.6“你方唱罢”,今儿GLM-5.3闪亮一记“我登场”——

一出手便杀回开源一哥、国模一哥,甚至在Coding方面更加接近Claude Fable 5!

也就是说,唐杰给马斯克“画的饼”(说国产模型超越Fable 5不会太久),往前拱了一大截,也就花了2个月整。

在多项主流基准测试中,GLM-5.3是当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型。

更值得注意的是不同推理强度下的表现。随着Token预算增加,GLM-5.3的Coding准确率继续往上走;在High档位下,已经能以明显更低的Token消耗,做到超过Claude Opus 4.8最高档位的准确率。

这次GLM-5.3除了Coding之外,另一个更重要的关键词,是安全。

在CyberGym白盒代码审查中,GLM-5.3拿到84.5%,相比5.2的77.2%继续提升,也略高于Mythos 5和GPT-5.6 Sol,一举成为最强开源安全模型。

并且在GLM-5.3发布前两周,智谱就联合清华、南开,以及国内众多企业、实验室,开展了密集的红队测试与安全评估。

据悉,累计发现漏洞2404个(经过初筛、去重),其中1088个为中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等220个项目。

所以,这次智谱发布GLM-5.3,两个关键词便一目了然了:一个是Coding,另一个是安全。

不意外,GLM-5.3一出,瞬间在X引发了大量的关注和热议,网友们已经把它称作“Fable 5级”了:

不得不说啊,这次GLM-5.3又在国际上把国产AI给支棱起来,这盛况,真是应了揽佬的“名人名言”:

最重要的一点是,在体验GLM-5.3的真实过程中,我们的体感真真儿的可以用一句话来概括:

我们这次所有的实测,都会在智谱自家的Harness,即ZCode里进行。

第一个任务,就拿Karpathy最新抛出的指环王基准来小试牛刀一下。

在把《指环王》第一章开头的文字和对应Prompt输进去之后,模型选择我们提前拿到的内测GLM-5.3,并把模式变成“完全访问”,保证全程无人工干预:

然后,GLM-5.3就自己唰唰唰地开始干活了,你只需要做的,就是等:

https://mp.weixin.qq.com/s/LXLsciw8OqStAyxWnktbzg

Karpathy设计的这个任务,考验的是模型能否长时间自主规划、写代码、摆放3D资产、编排动画并做出完整可运行作品。

并且我们在Prompt中还刻意加大了难度,让AI根据原文自行改编成约90秒中文旁白,但不能改变核心情节。

从GLM-5.3的结果来看,它不仅可以hold住这项测试的基本要求,更能从文学文本里抓重点,并把文字重新组织成视听语言。

这类任务的难点,其实也不只是Three.js能不能跑起来。模型得先把一段文学叙事拆成场景、人物、镜头和时间线,再一路落进代码里,最后还得保证90秒的内容能连续跑起来。

为了更直观地感受GLM-5.3 Coding能力的提升,我们还用一模一样的Prompt和设置,让GLM-5.2跑了一遍:

接下来,我们加大难度,让它再做一个可以完全交互的3D手表解构的Demo。

在输入完Prompt之后,GLM-5.3依旧是自己开始操作,遇到需要修复的地方,也会自行检查做调整:

在没有任何扫描、没有下载任何手表相关模型的情况下,手表各处细节都能被解构得明明白白,而且是把镜头拉到特别大也是能hold住的那种。

相比前面的“指环王基准”,这一关考的又不太一样:一块完整的表好画,但拆开以后,表盘、机芯、齿轮和表链之间的空间关系还能不能保持住,才是考验3D Coding的地方。

不过有一说一,上面两个实测效果虽然还算不错,但终归是属于演示级别的Demo。

因此,Coding能力的最后一个实测,我们尝试GLM-5.3是否能做可交付的模拟游戏。

也就是说,这个任务跑下来,它不仅是有视觉效果,还得是有后端、有数据库、有权限、有测试、有部署的完整模拟游戏。

但对于此次任务的验收,我们不能停留在只放出来最终效果,且得一步一步验证。

然后我们进入游戏后进行操作,点击保存到数据库,并退出游戏;要保证进来后还是刚才存档的进度:

权限测试方面,我们退出刚才的账号,再重新注册一个;进入游戏后,我们不难发现2个账号的信息是互相看不到的。

最后,为了方便起见,我们让GLM-5.3自己跑测试并输出验收报告,Prompt如下:

最终的报告结果如下,可以看到,这个项目确实是把前端、后端、数据库、权限等,通通跑通了:

结合上面三个实测来看,GLM-5.3在Coding方面,不仅仅是更会写质量更高的“页面”,现在,它已经能把一个需求真正交付成软件。

既然GLM-5.3已经是可交付的生产级AI,那么安全,也就是此次智谱发布动作里的第二个关键词,也得好好实测一番。

我们测试用到的项目叫做AegisDesk,它是一个真实结构的小型Node.js Web应用,并且提前埋好了一组安全问题。

但项目里没有答案、没有漏洞注释,也没有告诉模型一共有多少个Bug。

然后我们这次把ZCode的权限,从“完全访问”改成“变更前确认”,并输入Prompt:

从最显眼的明文密码、Stored XSS,到藏得更深的Mass Assignment提权、跨用户IDOR、路径穿越,再到一条需要顺着req.body→用户对象→Session role一路追下去的权限链,它基本都翻了出来。

甚至三个散落在不同路由里的IDOR,它也没为了刷数量拆成三个Bug,而是识别出共同根因,合并成一个Finding。

不过5.3也并非完全零失误。一处CSRF风险虽然判断方向正确,但真正能否完成跨站攻击仍依赖浏览器Cookie行为,它自己在报告末尾也意识到了这一点,前面却依旧打上了CONFIRMED。

这次任务直接把GLM-5.3刚刚生成的审计报告又塞了回去(既然这12个洞都是你自己找的,那你自己补[看] )。

但是会备份新文件夹并在ZCode里新建项目进行;同样的,在输入Prompt后,GLM-5.3就开始干活了:

这一次它没有简单把危险功能删掉。路径穿越加上目录边界校验,IDOR把ownerId真正压进数据查询,Stored XSS修在输出Sink,明文密码则迁移到了带Salt的scrypt。

更关键的是,它给这些漏洞自己补出了一套回归测试。最终ZCode显示54/54通过。

为了避免模型自己出题、自己判满分,我们又把完整项目单独拿出来重跑了一遍——54项,依旧全部通过。

在Mac没有GPU的情况下,让GLM-5.3硬写CUDA,看它会不会瞎编。

并且我们设计这个任务的Prompt时,也不会提前告知GLM-5.3这台电脑没有英伟达GPU,只给它CUDA工程任务:

CPU能验证的算法逻辑自己造了一套模拟测试;CUDA代码本机编不了,就借Docker里的CUDA Toolkit真正跑了一遍nvcc;但到了真实GPU执行、CPU/GPU数值一致性以及性能Benchmark,它全部停在了UNVERIFIED。

我们后来又把它生成的CPU测试单独拿出来重新编译运行,结果依旧全部通过。

对于一个正在获得越来越多系统权限的Coding Agent而言,“知道自己不知道”,本身也是安全能力的一部分。

而从技术设计上看,GLM-5.3这次强调的“安全”,其实也不太是传统印象里那种,问模型一句危险问题,看它会不会拒答。

更核心的,是让模型真正进入代码和工程环境之后,能不能理解漏洞为什么成立。

从智谱这次展示的能力结构来看,安全测试重点就包括白盒代码审查和漏洞推理。

前者,是把完整代码库直接扔给模型,让它从输入开始一路追踪到权限校验、数据流和最终的危险操作;后者更进一步,要求模型不能只看到一行可疑代码,还要把一个漏洞成立所需要的前因后果给串起来。

比如Mass Assignment提权,GLM-5.3并没有停在“这里用了req.body”这一层,而是一路追出了这么一整条攻击链:

req.body→用户对象→role字段→Session同步→普通用户最终获得管理员权限。

模型既要知道洞该堵在哪里,还得给修复补上回归测试,确认攻击路径被掐掉之后,原来的业务没有一起被修死。

所以从找Bug,到修Bug,再到最后没有GPU时主动区分VERIFIED、INFERRED和UNVERIFIED,这三轮实测实际上对应的是三种能力:

这也解释了为什么GLM-5.3这次会把Coding和安全放在一起。

因为模型一旦真正开始写工程代码,安全本身,也就成了工程能力的一部分。

原因并不复杂。Coding Agent已经开始真真儿地在现实世界里干活了。

以前模型写代码,更多还是“给你一段代码,你自己拿去用”;到了ZCode这一类Agent,它已经可以直接读整个Repo、改文件、调用终端、装依赖、跑测试,甚至参与部署。

能力越强,Agent能接触到的系统越多、拿到的权限也越高。到了这一步,一次判断失误带来的后果,自然也会被同步放大。

所以,安全正在一点点从Coding流程的末端往前挪。过去可能是:

我们刚才的实测就是一个很直观的缩影:GLM-5.3先把12类漏洞翻出来,又拿着自己的审计报告把洞一个个补上,最后再通过54项回归测试确认修复没有把正常功能一起“修死”;到了CUDA这一关,它还得进一步知道,哪些结论已经验证,哪些只能推断。

今年Hugging Face在处理一次自主Agent驱动的安全事件时,需要分析超过17000条攻击相关操作。由于其中包含真实攻击命令、利用载荷和C2痕迹,部分商业模型API的安全机制会阻断分析,最后他们把GLM-5.2直接部署在自己的基础设施里,用来重建攻击时间线。

这件事恰好说明了一点,Agent开始以机器速度写代码、操作系统,安全也得跟上机器速度。

所以再回头看GLM-5.3这次同时强化Coding和安全,两者已经越来越难分开。

能交付、能验证、知道边界,还能把自己写出来的洞补上,才是生产级Coding真正开始的地方。

这个新生图模型有点夯:4K直出的,国产的,开源的!2026-08-03

北京说Agent已经能造世界,杭州却说它是刚发明的电灯泡2026-07-25

刚刚,智谱和华为搞波大的:中国首个国产芯片训练出的SOTA多模态模型!

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

达摩院开源VideoLLaMA3:仅7B大小,视频理解拿下SOTA | 在线可玩

这波更新,满眼都是Coding,Coding,还是Coding

智谱上市后首份财报:超7.24亿元!国内收入最高大模型公司,MaaS发力了

GPT-5.6和Fable联手,解决了一道悬了25年的数学难题

Jeff Dean创业BP曝光,杨植麟也在上面!硅谷VC抢破头送钱

都学坏了!奥特曼亲手封锁最强模型Astra,重蹈Mythos覆辙

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

> 分享: